- android - RelativeLayout 背景可绘制重叠内容
- android - 如何链接 cpufeatures lib 以获取 native android 库?
- java - OnItemClickListener 不起作用,但 OnLongItemClickListener 在自定义 ListView 中起作用
- java - Android 文件转字符串
我有大约 80 000 个网址,我想获得它们的响应状态代码。请注意,我想尽快拿到它。我已经使用 requests
python 电池尝试了 HEAD
和 GET
请求,但它对我的目标来说太慢了。根据我的计算,它需要 > 10 个小时。这是可悲的。我发现的另一种方法是使用 tornado
。我已经在 500 个网址上对其进行了测试(请查看代码)。它使他的工作速度很快,但是(!)大量的响应代码是 599。这很奇怪,然后我检查了通过浏览器映射到 599 代码的 url(简单的 GET
请求)并进行了确保该网址非常好。如何解决这个问题?
from urlparse import urlparse
from threading import Thread
import httplib, sys
from Queue import Queue
from tornado import ioloop, httpclient, gen
import tornado
from time import sleep
i = 0
good = 0
def handle_request(response):
global good
if response.code != 200:
print response.code, response.reason, response.request.url
else:
good += 1
print 'KKKKKKKKKKK: ', good, '[%s]' % response.request.url
global i
i -= 1
if i == 0 or i < 0:
ioloop.IOLoop.instance().stop()
http_client = httpclient.AsyncHTTPClient()
lis = []
for url in open('urls'):
lis.append(url.strip())
specific_domain = '...'
for l in lis[:500]:
i += 1
method = 'GET' if specific_domain in l else 'HEAD'
req = tornado.httpclient.HTTPRequest(l, method=method, request_timeout=30.0)
http_client.fetch(req, handle_request)
ioloop.IOLoop.instance().start()
最佳答案
599 是 Tornado 为内部超时生成的响应代码。在这种情况下,大多数请求可能在等待插槽时在队列中超时。您可以增加超时(在发出请求时传递 request_timeout
)或管理您自己的队列以尽可能快地将请求馈送到 AsyncHTTPClient
(这通常是推荐用于大型爬网作业,因为它可以让您自己决定不同主机之间的优先级和公平性)。有关队列的示例,请参阅我在 tornado: AsyncHttpClient.fetch from an iterator? 中的回答
关于python - 获取数万个 HTTP 响应码,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/35107646/
据我了解,HTTP POST 请求的正文大小没有限制。因此,客户端可能会在一个 HTTP 请求中发送 千兆字节 的数据。现在我想知道 HTTP 服务器应该如何处理此类请求。 Tomcat 和 Jett
在了解Web Deploy我遇到了一些讨论 http://+:80 和 http://*:80 的 netsh.exe 命令。这些是什么意思? 最佳答案 引自URLPrefix Strings (Wi
假设我有一个负载均衡器,然后是 2 个 Web 服务器,然后是一个负载均衡器,然后是 4 个应用程序服务器。 HTTP 响应是否遵循与 HTTP 请求服务相同的路径? 最佳答案 按路径,我假设您是网络
我有一个带有 uri /api/books/122 的资源,如果在客户端为此资源发送 HTTP Delete 时该资源不存在,那么相应的响应代码是什么这个 Action ?是不是404 Not Fou
是否有特定的(或约定的)HTTP 响应消息(或除断开连接之外的其他操作)来阐明服务器不接受 pipelined HTTP requests ? 我正在寻找能让客户端停止流水线化它的请求并分别发送每个请
在了解Web Deploy我遇到了一些讨论 http://+:80 和 http://*:80 的 netsh.exe 命令。这些是什么意思? 最佳答案 引自URLPrefix Strings (Wi
我有一个带有 uri /api/books/122 的资源,如果在客户端为此资源发送 HTTP Delete 时该资源不存在,那么相应的响应代码是什么这个 Action ?是不是404 Not Fou
关闭。这个问题需要更多focused .它目前不接受答案。 想改进这个问题吗? 更新问题,使其只关注一个问题 editing this post . 关闭 8 年前。 Improve this qu
我使用 Mule 作为 REST API AMQP。我必须发送自定义请求方法:“PRINT”,但我收到: Status Code: 400 Bad Request The request could
我需要针对具有不同 HTTP 响应代码的 URL 测试我的脚本。我如何获取响应代码 300、303 或 307 等的示例/示例现有 URL? 谢谢! 最佳答案 您可以使用 httpbin为此目的。 例
我正在尝试编写一个程序来匹配 HTTP 请求及其相应的响应。似乎在大多数情况下一切都运行良好(当传输完全有序时,即使不是,通过使用 TCP 序列号)。 我发现的唯一问题是当我有流水线请求时。在那之后,
RESTful Web Services鼓励使用 HTTP 303将客户端重定向到资源的规范表示。它仅在 HTTP GET 的上下文中讨论主题。 这是否也适用于其他 HTTP 方法?如果客户端尝试对非
当使用chunked HTTP传输编码时,为什么服务器需要同时写出chunk的字节大小并且后续的chunk数据以CRLF结尾? 这不会使发送二进制数据“CRLF-unclean”和方法有点多余吗? 如
这个问题在这里已经有了答案: Is it acceptable for a server to send a HTTP response before the entire request has
如果我向同一台服务器发出多个 HTTP Get 请求并收到每个请求的 HTTP 200 OK 响应,我如何使用 Wireshark 判断哪个请求映射到哪个响应? 目前看起来像是发出了一个 http 请
func main() { http.HandleFunc("/", handler) } func handler(w http.ResponseWriter, r http.Request
我找不到有值(value)的 NodeJS with Typescript 教程,所以我在无指导下潜入水中,果然我有一个问题。 我不明白这两行之间的区别: import * as http from
问一个关于Are HTTP headers case-sensitive?的问题,如果 HTTP 方法区分大小写,大多数服务器如何处理“get”或“post”与“GET”或“POST”? 例如,看起来
我正在使用ASP.NET,在其中我通过动词GET接收查询,该应用程序专用于该URL。 该代码有效,但是如果用户发送的密码使http 200无效,请回答我,并在消息的正文中显示“Fail user or
Closed. This question needs details or clarity。它当前不接受答案。 想改善这个问题吗?添加详细信息,并通过editing this post阐明问题。 9
我是一名优秀的程序员,十分优秀!