java - 提高Crawler4j-Crawler效率、可扩展性-6ren

java - 提高Crawler4j-Crawler效率、可扩展性

转载作者：行者123 更新时间：2023-11-29 05:17:15

30

4

我正在使用 Crawler4j 爬虫来爬取一些域。现在我想提高爬虫的效率，我希望我的爬虫使用我的全部带宽并在给定时间段内爬取尽可能多的 url。为此我采用以下设置:-

我增加了编号。爬虫线程数到 10(使用此函数 ContentCrawler('classfilename',10);)
我已将礼貌延迟减少到 50 毫秒(使用 Crawlconfig.setpolitenessdelay(50);)
我将爬行深度设置为 2(使用 Crawlconfig.setMaxDepthOfCrawling(2))

现在我想知道的是:-

1) 这些设置是否有任何副作用。

2) 除了这个我还需要做些什么来提高我的爬虫速度。

3) 有人能告诉我每个设置的最大限制吗(例如:- crawler4j 一次支持的最大线程数等)。因为我已经查看了 Crawler4j 的代码，但我没有找到任何限制任何地方。

4) 如何在不检查域的 robots.txt 文件的情况下抓取域。因为我知道 crawler4j 在抓取之前首先检查域的 robots.txt 文件。我不想那样!!

5)page fetcher是如何工作的(请简单说明)

感谢任何帮助，如果问题很愚蠢，请放轻松。

最佳答案

我会尽力在这里帮助你。我不能保证正确性和完整性。

b) 减少策略延迟会在网站上产生更多的爬网负载，并且可以(在小型服务器上)从长远来看增加接收时间。但是现在这不是一个常见的问题，所以 50ms 应该还是可以的。另请注意，如果从网络服务器接收响应需要 250 毫秒，该线程抓取下一页仍需要 250 毫秒。
c) 我不太确定您希望通过将 crawlDepth 的值设置为 2 来实现什么。例如。从 1 开始的抓取深度意味着您抓取种子而不是抓取种子上找到的每个站点然后停止。 (crawlDepth = 2 只会更进一步，依此类推)。这不会影响您的抓取速度，只会影响您的抓取时间和找到的页面。
不要在 CrawlerThread 及其涵盖的所有方法/类中实现耗时的操作。在最后或在额外的线程中执行它们。
爬虫配置本身没有提供任何限制。限制将由您的 CPU(不太可能)或要抓取的站点的结构(很可能)设置。
将此行添加到您的 CrawlController:robotstxtConfig.setEnabled(false);

现在应该是这样的:

PageFetcher pageFetcher = new PageFetcher(config);
RobotstxtConfig robotstxtConfig = new RobotstxtConfig();
robotstxtConfig.setEnabled(false);
RobotstxtServer robotstxtServer = new RobotstxtServer(robotstxtConfig, pageFetcher);
CrawlController controller = new CrawlController(config, pageFetcher, robotstxtServer);

页面 getter 将设置一些参数，然后使用先前设置的参数向给定 url 上的网络服务发送 HTTPget 请求。来自网络服务器的响应将被评估，一些信息如响应头和二进制形式的 html 代码将被保存。

希望我能帮到你一点。

关于java - 提高Crawler4j-Crawler效率、可扩展性，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/26094576/

30

4

0

文章推荐： mysql - 从表中获取两个 UID 之间的所有可用 UID

文章推荐： java - 如何在 SQL Wrapper 类中返回 ResultSet

文章推荐： ios - 如何在 Swift 中的 UIView/Utility 类中获取导航栏

jQuery .on 效率
第一个 .on 函数比第二个更有效吗？ $( "div.container" ).on( "click", "p", function(){ }); $( "body" ).on( "click",
JavaScript 效率
已关闭。此问题不符合Stack Overflow guidelines 。目前不接受答案。这个问题似乎与 help center 中定义的范围内的编程无关。 . 已关闭 7 年前。 Improve
jQuery 效率
我有这样的查询: $('#tabContainer li'); JetBrains WebStorm IDE 将其突出显示为低效查询。它建议我改用这个: $('#tabContainer').find
Ruby 效率
我刚刚在 coursera ( https://www.coursera.org/saas/) 上听了一个讲座，教授说 Ruby 中的一切都是对象，每个方法调用都是在对象上调用发送方法，将一些参数传递
excel - 函数输入数据类型是否影响循环速度/效率
这可能是用户“不喜欢”的另一个问题，因为它更多的是与建议相关而不是与问题相关。我有一个在保存和工作簿打开时触发的代码。它在 f(白天与夜晚，日期与实际日期)中选择正确的工作表。周一到周三我的情况
performance - 效率:递归与循环
这只是我的好奇心，但是更有效的是递归还是循环？给定两个功能（使用通用lisp）： (defun factorial_recursion (x) (if (> x 0) (*
loops - For循环或While循环-效率
这可能是一个愚蠢的问题，但是while循环的效率与for循环的效率相比如何？我一直被教导，如果可以使用for循环，那我应该这样做。但是，实际上之间的区别是什么: $i = 0; while($i <
elasticsearch - elasticsearch排序与得分-效率？
我有一个Elasticsearch索引，其中包含几百万条记录。 (基于时间戳的日志记录) 我需要首先显示最新记录(即，按时间戳降序排列的记录) 在时间戳上排序desc是否比使用时间戳的函数计分功能更有
Java 效率 - 点与坐标
使用Point2D而不是double x和y值时，效率有很大差异吗？我正在开发一个程序，该程序有许多圆圈在屏幕上移动。他们各自从一个点出发，并越来越接近目的地(最后，他们停下来)。使用 .getC
Java ArrayList 效率
我正在编写一个游戏，并且有一个名为 GameObject 的抽象类和三个扩展它的类(Player、Wall 和 Enemy)。我有一个定义为包含游戏中所有对象的列表。 List objects; 当
javascript - 链接与创建新集合 - 效率
我是 Backbone 的初学者，想知道两者中哪一个更有效以及预期的做事方式。 A 型:创建一个新集合，接受先前操作的结果并从新集合中提取 key result = new Backbone.Coll
SQL 通配符搜索 - 效率？
最近，关于使用 LIKE 和通配符搜索 MS SQL 数据库的最有效方法存在争论。我们正在使用 %abc%、%abc 和 abc% 进行比较。有人说过，术语末尾应该始终有通配符 (abc%)。因此，根
java - Scala 效率
关闭。这个问题是opinion-based 。目前不接受答案。想要改进这个问题吗？更新问题，以便 editing this post 可以用事实和引文来回答它。 . 已关闭 8 年前。 Improv
java - setVisible() 效率
我想知道，这样做会更有效率吗: setVisible(false) // if the component is invisible 或者像这样: if(isVisible()){
c# - 很多insertQuerys - 效率
我有一个静态方法可以打开到 SQL Server 的连接、写入日志消息并关闭连接。我在整个代码中多次调用此方法(平均每 2 秒一次)。问题是 - 它有效率吗？我想也许积累一些日志并用一个连接插入它们
javascript - PHP生成jQuery——效率
这个问题在这里已经有了答案: Best practice to avoid memory or performance issues related to binding a large numbe
java - 石头剪刀布游戏 - 效率？
我为我的 CS 课(高中四年级)制作了一个石头剪刀布游戏，我的老师给我的 shell 文件指出我必须将 do while 循环放入运行者中，但我不明白为什么？我的代码可以工作，但她说最好把它写在运行者
java - 自定义数组包装类类型转换安全/效率
我正在编写一个需要通用列表的 Java 应用程序。该列表需要能够经常动态地调整大小，对此的明显答案是通用的Linkedlist。不幸的是，它还需要像通过调用索引添加/删除值一样频繁地获取/设置值。 A
php - MYSQL查询的问题(效率)
我的 Mysql 语句遇到了真正的问题，我需要将几个表连接在一起，查询它们并按另一个表中值的平均值进行排序。这就是我所拥有的... SELECT ROUND(avg(re.rating
java - 效率？这些代码之间有什么区别吗？
这个问题在这里已经有了答案: 关闭 10 年前。 Possible Duplicate: Is there a difference between i==0 and 0==i? 以下编码风格有什么

首页

博学

6Ren·AI

商城

java - 提高Crawler4j-Crawler效率、可扩展性