Scrapy 抓取简历不会抓取任何东西，只是完成-6ren

Scrapy 抓取简历不会抓取任何东西，只是完成

转载作者：行者123 更新时间：2023-12-01 04:50:20

28

4

我使用 CrawlSpider 派生类开始爬网，然后使用 Ctrl+C 暂停它。当我再次执行命令恢复它时，它不会继续。

我的开始和恢复命令:

scrapy crawl mycrawler -s JOBDIR=crawls/test5_mycrawl

Scrapy 创建文件夹。权限为777。

当我恢复抓取时，它只输出:

/home/adminuser/.virtualenvs/rg_harvest/lib/python2.7/site-packages/twisted/internet/_sslverify.py:184: UserWarning: You do not have the service_identity module installed. Please install it from <https://pypi.python.org/pypi/service_identity>. Without the service_identity module and a recent enough pyOpenSSL tosupport it, Twisted can perform only rudimentary TLS client hostnameverification.  Many valid certificate/hostname mappings may be rejected.
  verifyHostname, VerificationError = _selectVerifyImplementation()
2014-11-21 11:05:10-0500 [scrapy] INFO: Scrapy 0.24.4 started (bot: rg_harvest_scrapy)
2014-11-21 11:05:10-0500 [scrapy] INFO: Optional features available: ssl, http11, django
2014-11-21 11:05:10-0500 [scrapy] INFO: Overridden settings: {'NEWSPIDER_MODULE': 'rg_harvest_scrapy.spiders', 'SPIDER_MODULES': ['rg_harvest_scrapy.spiders'], 'BOT_NAME': 'rg_harvest_scrapy'}
2014-11-21 11:05:10-0500 [scrapy] INFO: Enabled extensions: LogStats, TelnetConsole, CloseSpider, WebService, CoreStats, SpiderState
2014-11-21 11:05:10-0500 [scrapy] INFO: Enabled downloader middlewares: HttpAuthMiddleware, DownloadTimeoutMiddleware, UserAgentMiddleware, RetryMiddleware, DefaultHeadersMiddleware, MetaRefreshMiddleware, HttpCompressionMiddleware, RedirectMiddleware, CookiesMiddleware, ChunkedTransferMiddleware, DownloaderStats
2014-11-21 11:05:10-0500 [scrapy] INFO: Enabled spider middlewares: HttpErrorMiddleware, OffsiteMiddleware, RefererMiddleware, UrlLengthMiddleware, DepthMiddleware
2014-11-21 11:05:10-0500 [scrapy] INFO: Enabled item pipelines: ValidateMandatory, TypeConversion, ValidateRange, ValidateLogic, RestegourmetImagesPipeline, SaveToDB
2014-11-21 11:05:10-0500 [mycrawler] INFO: Spider opened
2014-11-21 11:05:10-0500 [mycrawler] INFO: Crawled 0 pages (at 0 pages/min), scraped 0 items (at 0 items/min)
2014-11-21 11:05:10-0500 [scrapy] DEBUG: Telnet console listening on 127.0.0.1:6023
2014-11-21 11:05:10-0500 [scrapy] DEBUG: Web service listening on 127.0.0.1:6080
2014-11-21 11:05:10-0500 [mycrawler] DEBUG: Crawled (200) <GET http://eatsmarter.de/suche/rezepte> (referer: None)
2014-11-21 11:05:10-0500 [mycrawler] DEBUG: Filtered duplicate request: <GET http://eatsmarter.de/suche/rezepte?page=1> - no more duplicates will be shown (see DUPEFILTER_DEBUG to show all duplicates)
2014-11-21 11:05:10-0500 [mycrawler] INFO: Closing spider (finished)
2014-11-21 11:05:10-0500 [mycrawler] INFO: Dumping Scrapy stats:
    {'downloader/request_bytes': 225,
     'downloader/request_count': 1,
     'downloader/request_method_count/GET': 1,
     'downloader/response_bytes': 19242,
     'downloader/response_count': 1,
     'downloader/response_status_count/200': 1,
     'dupefilter/filtered': 29,
     'finish_reason': 'finished',
     'finish_time': datetime.datetime(2014, 11, 21, 16, 5, 10, 733196),
     'log_count/DEBUG': 4,
     'log_count/INFO': 7,
     'request_depth_max': 1,
     'response_received_count': 1,
     'scheduler/dequeued': 1,
     'scheduler/dequeued/disk': 1,
     'scheduler/enqueued': 1,
     'scheduler/enqueued/disk': 1,
     'start_time': datetime.datetime(2014, 11, 21, 16, 5, 10, 528629)}

我有一个 start_url。这可能是原因吗？我的爬虫使用一个 start_url，然后使用 LinkExtractor 按照规则进行分页，并通过特定的 url 格式调用解析项:

我的蜘蛛代码:

class MyCrawlSpiderBase(CrawlSpider):
    name = 'test_spider'

    testmode = True
    crawl_start = datetime.utcnow().isoformat()

    def __init__(self, testmode=True, urls=None, *args, **kwargs):        
        self.testmode = bool(int(testmode))
        super(MyCrawlSpiderBase, self).__init__(*args, **kwargs)        

    def parse_item(self, response):
        # Item Values
        l = MyItemLoader(RecipeItem(), response=response)

        l.replace_value('url', response.url)
        l.replace_value('crawl_start', self.crawl_start)

        return l.load_item()


class MyCrawlSpider(MyCrawlSpiderBase):
    name = 'example_de'
    allowed_domains = ['example.de']
    start_urls = [
        "http://example.de",

    ]

    rules = (
        Rule( 
            LinkExtractor( 
                allow=('/search/entry\?page=', )
            )
        ), 


        Rule(
            LinkExtractor(
                allow=('/entry/[0-9A-z\-]{3,}$', ),
            ), 
            callback='parse_item'
        ),
    )

    def parse_item(self, response):
        item = super(MyCrawlSpider, self).parse_item(response)

        l = MyItemLoader(item=item, response=response)

        l.replace_xpath("name", "//h1[@class='fn title']/text()")         

        (...)

        return l.load_item()

最佳答案

由于您的 URL 始终相同，因此很可能会过滤请求。您可以通过两种方式解决此问题:

在您的settings.py 文件中，添加以下行:
DUPEFILTER_CLASS = 'scrapy.dupefilter.BaseDupeFilter'
这会将默认的 RFPDupeFilter 替换为不会过滤任何请求的 BaseDupeFilter。如果您实际上想过滤掉一些与此问题无关的其他请求，这可能不是您想要的。
您可以更多地参与创建请求的过程，并使用参数 dont_filter=True 创建它们，这将禁用基于每个请求的过滤。为此，您可以删除 start_urls 并将其替换为将产生解析请求的方法 start_requests()。在 official documentation 中查看更多信息.

关于Scrapy 抓取简历不会抓取任何东西，只是完成，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/27065816/

28

4

0

文章推荐： symfony - Doctrine - Criteria - expressions - 包含(多对多)

文章推荐： jquery - 如何通过事件 "sortremove"查询 DOM 以获取属性值

文章推荐： asp.net-core - Aspnet core mvc 在验证时更改默认语言

文章推荐： language-agnostic - 如何发布/销售/推广半商业/开源项目？

docker-compose down 不会.. "down"容器
我有几个系统使用 docker-compose 并且没有问题。但是，我在这里有一个“向下”根本不做任何事情的地方。 'up'虽然完美。这是在 MacOS 上。该项目的昵称是“ Storm ”，脚本
PHP 不会 str_replace 数据库中的单引号
解释起来确实很奇怪，所以就这样...... 我正在从 phpmyadmin 获取包含未转义单引号的数据。我正在尝试转换'至'通过使用Content-Type: text/html;在 php
ios - Tableview 不会 reloadData()
伙计们？在这里需要一些帮助。我使用委托(delegate)协议(protocol)将一些字符串从“第二个 View Controller ”传回给它的前一个。我的数组附加了我在委托(delegate
Python 不会 eval() 代码
我有以下 eval() 东西: c = Customer() eval("c.name = row.value('customer', '{c}')".format(c=column_name), {
java - WebApplicationContext 不会 Autowiring
我写了这个测试类: @ContextConfiguration(locations = { "classpath:/test/BeanConfig.xml" }) public class Candi
java - FilterChainProxy 不会 Autowiring
我这样写代码: @ContextConfiguration(locations = { "classpath:/test/BeanConfig.xml" }) @RunWith(SpringJUnit
由于更改了文件，Git 不会 pull
假设我更改了文件，然后进行 pull 。 Git 会报错，因为本地仓库还没有保存，将被覆盖。如果我然后删除该添加并使文件与以前相同(与远程 repo 相同)，那么会发生 pull 吗？最佳答案是的
面试官：不会“不定高”虚拟列表，你在简历上面提他干嘛？
前言很多同学将虚拟列表当做亮点写在简历上面，但是却不知道如何手写，那么这个就不是加分项而是减分项了。在上一篇文章欧阳教会你如何实现一个定高虚拟列表，但是实际项目中更多的是不定高虚拟列表，这篇文
java - 为什么 Eclipse 不会@Override？
我正在阅读《Java for Dummies》一书，但遇到了问题。我不明白为什么 @Override 不起作用。我确信这与我的代码有关，因为我之前已经获得了一个多态数组来使用覆盖，但它对我来说太简单了
wpf - StopStoryboard 不会...停止 BeginStoryboard
我从我的项目中提取了这段代码，因为我试图找到我犯的一个错误，该错误使我的 BeginStoryboard 无法自行停止。我尽可能地简化了代码，但仍然没有发现问题。你认为它可能是什么？
char* 会导致段错误，但 char[] 不会
这个问题在这里已经有了答案: Difference between char[] and char * in C [duplicate] (3 个答案) 关闭 7 年前。我想我知道自己问题的答案，
Java Scanner 不会 "finish"读取输入
我一直在使用 java 的 Scanner 类时遇到问题。我可以让它很好地读取我的输入，但问题是当我想要输出一些东西时。给定多行输入，我想在完全读取所有输入后只打印一行。这是我用来读取输入的代码:
如果再次单击，javascript 不会 .toggleClass() 吗？
对于这个问题，我已经用最简单的术语表达了这一点。如果元素被点击，'active'类被添加到元素，'active'类从其他元素中移除。但是，如果该元素是“事件的”并且它被第二次单击，则“事件”类不应
c++ - SHFileOperation 不会 move 文件夹的所有内容
这会在桌面上创建一个新文件夹，但不会将文件夹 .pfrom 的内容 move 到文件夹 .pTo。 int main() { SHFILEOPSTRUCT sf = {0}; TCHA
c++ -/MTd 会触发断点但/MDd 不会
我有一个关于多线程调试 DLL (/MDd) 和多线程调试 (/MTd) 设置的问题。它们之间的区别很明显:一个是使用动态库，一个是使用静态库。当我使用/MDd 编译我的程序时，一切都进行得很好。但是
javascript - jQuery 不会 append 在文档就绪时声明的克隆
我的问题是，如果我在页面加载时创建一个克隆变量，jQuery 只会 append 它一次。奇怪! Click to copy This is an element! $(document)
python - heroku postgresql 不会 syncdb
所以...我是一个开发 django 应用程序的新手，但是当我尝试通过 virtualbox heroku 运行 heroku run python manage.py syncdb 时，它一直在下面
java - SpringBootApplication 不会 Autowiring 我的服务
我在 Spring Boot 初始化时遇到了问题。我在一个简单的 Spring Boot 项目中有这个结构。 com.project.name |----App.java (Annoted with
css - div 不会 float ，任何人都可以看到为什么吗？
我在 www.7hermanosmx.com/menu.php 页面上有以下代码 - 一切正常，除了黄色框(类 menuholder)应该每行三个相互 float 。他们坚决拒绝这样做!我知道我做错了
javascript - 单击时我的 div 不会 slideDown()。
我正在尝试在我正在构建的小型网站上添加一个下拉菜单。出于某种原因，我可以获得我想要向下滑动到 fadeOut() 的 div 并执行其他类似的操作，但我无法将它获取到 slideDown()。我不知道

首页

博学

6Ren·AI

商城

Scrapy 抓取简历不会抓取任何东西，只是完成