- android - 多次调用 OnPrimaryClipChangedListener
- android - 无法更新 RecyclerView 中的 TextView 字段
- android.database.CursorIndexOutOfBoundsException : Index 0 requested, 光标大小为 0
- android - 使用 AppCompat 时,我们是否需要明确指定其 UI 组件(Spinner、EditText)颜色
我一直在尝试(不成功,我可能会补充)使用 Python 和 urllib/urllib2 抓取使用 Microsoft 堆栈(ASP.NET、C#、IIS)创建的网站。我还使用 cookielib 来管理 cookie。在花了很长时间在 Chrome 中分析网站并检查标题之后,我一直无法想出一个有效的登录解决方案。目前,为了让它在最基本的层面上工作,我已经使用所有适当的表单数据(甚至 View 状态等)对编码的 URL 字符串进行硬编码。我还传递了有效的 header 。
我目前收到的回复是:
29|pageRedirect||/?aspxerrorpath=/default.aspx|
我不确定如何解释以上内容。此外,我还非常广泛地研究了用于处理登录字段的客户端代码。
运作方式如下:您输入您的用户名/密码并点击“登录”按钮。按 Enter 键也模拟此按钮按下。输入字段不在表单中。相反,在所述登录按钮上有一些 onClick 事件(其中大部分只是为了美观),但有一个问题处理验证。在将其发送到服务器端之前,它会进行一些基本检查。根据 Web 资源,它显然使用的是 .NET AJAX。
正常登录本网站时,您会以 POST 形式请求域名,其中包含您的用户名和密码等表单数据。然后,有某种 URL 重写或重定向将您带到 url.com/twitter 的内容页面。当尝试直接访问 url.com/twitter 时,它会将您重定向到主页。
我应该指出,我已决定将有问题的 URL 排除在外。我没有做任何恶意的事情,只是每隔合理的时间增量自动执行一次非常单调的检查(我熟悉富有同情心的屏幕抓取)。但是,如果域所有者不满意,将我的 StackOverflow 帐户与该帐户相关联是微不足道的。
我的问题是: 我过去曾成功登录并自动化服务,但这些都不是基于 .NET 的。有什么我应该做的不同的事情,或者我可能遗漏了什么吗?
最佳答案
对于将来可能处于类似困境的任何其他人:
我只想指出,我在 Chrome 中使用 Greasemonkey 用户脚本来完成我所有的抓取和自动化工作取得了很大的成功。我发现它比 Python + urllib2 容易得多(至少对于这种特殊情况)。用户脚本是用 100% Javascript 编写的。
关于asp.net - 使用 Python 和 urllib2 抓取 ASP.NET,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/5973245/
如有任何帮助,我将不胜感激。我使用 Python 3.4.1 并尝试导入 urllib.request 和 urllib.parse。没有成功。我总是收到: Traceback (most recen
我正在尝试一个教程代码,它从一个网站获取 html 代码并打印出来。我在 ubuntu 上使用 python 3.4.0。代码: import urllib.request page = urllib
根据这个answer几年前给出了一个相同的问题,Javascript 中的 encodeURIComponent(str) 应该等同于 Python 中的 urllib.quote(str, safe
1。弃用问题 在 Python 3.7 中,我使用 urllib.request.urlretrieve(..) 函数从 URL 下载了一个大文件。在文档 ( https://docs.python.
在 python 3 中,导入时出现此错误:没有名为“urllib.request.urlretrieve”的模块; “urllib.request”不是一个包 import urllib impor
import urllib print urllib.urlopen('http://www.reefgeek.com/equipment/Controllers_&_Monitors/Neptune
我在 gooogle colab 中使用来自 parselmouth 的 praat,在导入 from parselmouth.praat import call 时出现此错误 /usr/local/
是否有与 Python 的 urllib.parse.quote() 等效的 JavaScript 函数?和 urllib.parse.unquote() ? 我遇到的最接近的是encodeURI()
这个问题在这里已经有了答案: Importing installed package from script with the same name raises "AttributeError: m
Python 的 urllib.quote 和 urllib.unquote 在 Python 2.6.5 中无法正确处理 Unicode。这就是发生的事情: In [5]: print urllib
这个问题在这里已经有了答案: How to route urllib requests through the TOR network? [duplicate] (3 个回答) 关闭6年前。 示例代码
我正在制作一些简单的 python 帖子脚本,但效果不佳。 有两部分必须登录。 第一次登录使用' http://mybuddy.buddybuddy.co.kr/userinfo/UserInfo.a
我有以下脚本: from currency_converter import CurrencyConverter test = CurrencyConverter('http://www.ecb.eu
我正在编写一个小工具来监控学校的开课情况。 我编写了一个 python 脚本,每隔几分钟就会从每个部门获取当前类(class)的可用性。 该脚本一直正常运行,直到大学网站开始返回以下内容: SIS S
为什么下面的结果会出错? import re from urllib import quote as q s = re.compile(r'[^a-zA-Z0-9.: ^*$@!+_?-]') s.s
我正在开发一个网络爬虫来自动下载巴西网站上的一些文档。并且它使用了一些未知的编码(head 标签中没有定义字符集)。 人们只需付出很少的努力就可以阅读这些文档。但真正的问题是,列出文档的页面使用的链接
我有一个程序,我需要打开许多网页并下载其中的信息。然而,这些信息位于页面中间,需要很长时间才能找到。有没有办法让 urllib 只检索 x 行?或者,如果没有别的事,之后就不加载信息? 我在 Mac
我有一个脚本,使用 Urllib 打开我安装了谷歌分析的网页。我的问题是,为什么如果我执行脚本,GA 上不会显示访问次数? 最佳答案 Google Analytics 脚本是 JavaScript 代
我正在尝试下载航类搜索结果,但我不断收到一个与通过右键单击并手动存储网站获得的文件不同的文件。我已经尝试过 urllib 、 urllib2 以及我在这里找到的每个命令都无济于事。 这是一个 MWE:
我最近用Python(Windows 64位v3.3.1)编写了一个程序,并试图将其移植到D。我遇到的问题是我使用了urllib Python 中的模块,特别是 urllib.request.Requ
我是一名优秀的程序员,十分优秀!