python - 从脚本运行蜘蛛时获取 scrapy crawl 命令的功能-6ren

python - 从脚本运行蜘蛛时获取 scrapy crawl 命令的功能

转载作者：行者123 更新时间：2023-11-29 12:04:48

32

4

我在一个 scrapy 项目中编写了一个爬行蜘蛛，它可以正确地从 url 中抓取数据并将响应通过管道传输到 postgresql 表中，但仅当使用 scrapy crawl 命令时。当蜘蛛从项目根目录中的脚本运行时，似乎只有蜘蛛类的解析方法被调用，因为仅使用 python 命令运行脚本时不会创建表。我认为问题是 crawl 命令有一个特定的协议(protocol)，用于在 spiders 包上方的目录中查找和调用特定模块(例如模型、管道和设置模块)，当蜘蛛运行时，这些模块不会被调用一个脚本。

我遵循了 docs 中包含的说明但他们似乎没有在数据被抓取后处理流水线数据。这就提出了一个问题，我什至应该尝试运行一个脚本来运行蜘蛛，或者我是否应该以某种方式使用 scrapy crawl 命令。问题是，我计划在用户以导致我进入 this SO post 的形式提交文本时从 django 项目运行 scrapy 蜘蛛。，但提供的答案似乎并没有解决我的问题。我还需要将表单中的文本添加到蜘蛛 url(我以前只是使用 raw_input 创建 url)。我应该如何正确地运行蜘蛛？如果需要，我有脚本代码和下面的蜘蛛代码。提供任何帮助/代码将不胜感激，谢谢。

脚本文件

from ticket_city_scraper import *
from ticket_city_scraper.spiders import tc_spider 

tc_spider.spiderCrawl()

蜘蛛文件

import scrapy
import re
import json
from scrapy.crawler import CrawlerProcess
from scrapy import Request
from scrapy.contrib.spiders import CrawlSpider , Rule
from scrapy.selector import HtmlXPathSelector
from scrapy.selector import Selector
from scrapy.contrib.loader import ItemLoader
from scrapy.contrib.loader import XPathItemLoader
from scrapy.contrib.loader.processor import Join, MapCompose
from ticket_city_scraper.items import ComparatorItem
from urlparse import urljoin

bandname = raw_input("Enter bandname\n")
tc_url = "https://www.ticketcity.com/concerts/" + bandname + "-tickets.html"  

class MySpider3(CrawlSpider):
    handle_httpstatus_list = [416]
    name = 'comparator'
    allowed_domains = ["www.ticketcity.com"]

    start_urls = [tc_url]
    tickets_list_xpath = './/div[@class = "vevent"]'
    def create_link(self, bandname):
        tc_url = "https://www.ticketcity.com/concerts/" + bandname + "-tickets.html"  
        self.start_urls = [tc_url]
        #return tc_url      

    tickets_list_xpath = './/div[@class = "vevent"]'

    def parse_json(self, response):
        loader = response.meta['loader']
        jsonresponse = json.loads(response.body_as_unicode())
        ticket_info = jsonresponse.get('B')
        price_list = [i.get('P') for i in ticket_info]
        if len(price_list) > 0:
            str_Price = str(price_list[0])
            ticketPrice = unicode(str_Price, "utf-8")
            loader.add_value('ticketPrice', ticketPrice)
        else:
            ticketPrice = unicode("sold out", "utf-8")
            loader.add_value('ticketPrice', ticketPrice)
        return loader.load_item()

    def parse_price(self, response):
        print "parse price function entered \n"
        loader = response.meta['loader']
        event_City = response.xpath('.//span[@itemprop="addressLocality"]/text()').extract() 
        eventCity = ''.join(event_City) 
        loader.add_value('eventCity' , eventCity)
        event_State = response.xpath('.//span[@itemprop="addressRegion"]/text()').extract() 
        eventState = ''.join(event_State) 
        loader.add_value('eventState' , eventState) 
        event_Date = response.xpath('.//span[@class="event_datetime"]/text()').extract() 
        eventDate = ''.join(event_Date)  
        loader.add_value('eventDate' , eventDate)    
        ticketsLink = loader.get_output_value("ticketsLink")
        json_id_list= re.findall(r"(\d+)[^-]*$", ticketsLink)
        json_id=  "".join(json_id_list)
        json_url = "https://www.ticketcity.com/Catalog/public/v1/events/" + json_id + "/ticketblocks?P=0,99999999&q=0&per_page=250&page=1&sort=p.asc&f.t=s&_=1436642392938"
        yield scrapy.Request(json_url, meta={'loader': loader}, callback = self.parse_json, dont_filter = True) 

    def parse(self, response):
        """
        # """
        selector = HtmlXPathSelector(response)
        # iterate over tickets
        for ticket in selector.select(self.tickets_list_xpath):
            loader = XPathItemLoader(ComparatorItem(), selector=ticket)
            # define loader
            loader.default_input_processor = MapCompose(unicode.strip)
            loader.default_output_processor = Join()
            # iterate over fields and add xpaths to the loader
            loader.add_xpath('eventName' , './/span[@class="summary listingEventName"]/text()')
            loader.add_xpath('eventLocation' , './/div[@class="divVenue location"]/text()')
            loader.add_xpath('ticketsLink' , './/a[@class="divEventDetails url"]/@href')
            #loader.add_xpath('eventDateTime' , '//div[@id="divEventDate"]/@title') #datetime type
            #loader.add_xpath('eventTime' , './/*[@class = "productionsTime"]/text()')

            print "Here is ticket link \n" + loader.get_output_value("ticketsLink")
            #sel.xpath("//span[@id='PractitionerDetails1_Label4']/text()").extract()
            ticketsURL = "https://www.ticketcity.com/" + loader.get_output_value("ticketsLink")
            ticketsURL = urljoin(response.url, ticketsURL)
            yield scrapy.Request(ticketsURL, meta={'loader': loader}, callback = self.parse_price, dont_filter = True)

def spiderCrawl():
   process = CrawlerProcess({
    'USER_AGENT': 'Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 5.1)'
   })
   process.crawl(MySpider3)
   process.start()

最佳答案

回答你的问题

Scrapy 不区分抓取命令和抓取命令行(来自脚本)执行。

您缺少的唯一部分(和区别)是:

scrapy crawl 命令...总是而且必须从内部执行项目目录 ..scrapy.cfg 文件所在的位置....如果你仔细看，它包含设置文件所在的位置位于..和设置文件是你所有的中心位置项目特定设置位于..like..cache policy，管道、 header 设置、代理设置等所以在使用 scrapy crawl 时..所有这些设置都是内部加载的
对于从脚本执行 Scrapy...你只是提供了蜘蛛的位置以及它所在的位置并执行它没有任何来自 settings.py 文件的自定义设置

为使此设置生效..使用项目设置创建 crawlprocess 对象..

settings = get_project_settings()
settings.set('USER_AGENT','Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 5.1)')
process = CrawlerProcess(settings)
process.crawl(MySpider3)
process.start()

关于python - 从脚本运行蜘蛛时获取 scrapy crawl 命令的功能，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/31640971/

32

4

0

文章推荐： mysql - 将大型 html 文本存储在数据库中

文章推荐： sql - 在psql中选择每组前5个得分结果

文章推荐： php - DataTables 导出 MySQL 表中的所有记录

文章推荐： sql - 如何返回数据库中现有表中某一行的特定列值？

Powershell 脚本 - 脚本 - 我如何禁用它
我有 powershell 脚本。通过调度程序，我运行 bat 文件，该文件运行 PS1 文件。 BAT文件 Powershell.exe -executionpolicy remotesigned
Jquery - getScript 版本<脚本>..
什么更快？或者 $.getScript('../js/SOME.js', function (){ ... // with $.ajaxSetup({ cache: true });
linux - Bash 脚本 Shell 脚本
需要bash脚本来显示文件 #!/bin/bash my_ls() { # save current directory then cd to "$1" pushd "$1" >/dev/nu
ksh - Unix 脚本 - 需要提高性能的建议(shell 脚本)
我有一个输入 csv 文件，实际上我需要在输入文件中选择第 2 列和第 3 列值，并且需要转换两个值的时区(从 PT 到 CT)，转换后我需要替换转换后的时区值到文件。注意: 所有输入日期值都在太平
Bash 脚本 - 编写 init.d 脚本
我正在使用/etc/init.d/httpd 作为 init.d 脚本的模板。我了解文件中发生的所有内容，但以下行除外: LANG=$HTTPD_LANG daemon --pidfile=${pid
python - 将具有多个子选项的命令行选项传递给 python 脚本 -- shell 脚本
我有以下选择: python runscript.py -O start -a "-a "\"-o \\\"-f/dev/sda1 -b256k -Q8\\\" -l test -p maim\""
linux - 用于重命名文件的 Shell 脚本 - Shell 脚本
我对 shell 脚本完全陌生，但我需要编写一个 shell 脚本来检查文件是否存在，然后移动到另一个位置这是我写的: 一旦设备崩溃，我就会在/storage/sdcard1/1 中收集日志 #!/
linux - Bash 脚本 - Bash 脚本 - 编辑文件中文本的行
我正在使用 bash 脚本从文本文件中读取数据。数据: 04:31 Alex M.O.R.P.H. & Natalie Gioia - My Heaven http://goo.gl/rMOa2q
php - 按下按钮运行 php 脚本，该脚本会回显 javascript 脚本
这是单击按钮时运行的 javascript 的结尾 xmlObj.open ('GET', /ajax.php, true); xmlObj.send (''); } 所以这会执行根目录中的php脚本
linux - 重新激活 python 脚本 - Linux bash 脚本
关闭。这个问题需要debugging details .它目前不接受答案。编辑问题以包含 desired behavior, a specific problem or error, and th
python - Nodejs 脚本 fs.createReadStream 到 Python 脚本
我需要将文件转换为可读流以通过 api 上传，有一个使用 fs.createReadStream 的 Node js 示例。任何人都可以告诉我上述声明的 python 等价物是什么？例子 const
python - 从 shell 脚本 cron 调用 python 脚本
我有一个 shell 脚本 cron，它从同一目录调用 python 脚本，但是当这个 cron 执行时，我没有从我的 python 脚本中获得预期的输出，当我手动执行它时，我的 python 脚本的
javascript - 安全的 ajax 脚本(javascript 请求的 PHP 脚本)
如何使 XMLHttpRequest (ajax) 调用的 php 脚本安全。我的意思是，不让 PHP 文件通过直接 url 运行，只能通过脚本从我的页面调用(我不想向未登录的用户显示数据库结果，并
脚本 block 错误中的经典 asp 脚本 block 中的 javascript
我正在尝试添加以下内容我正在使用经典的 asp。但我不断收到的错误是“一个脚本 block 不能放在另一个脚本 block 内。”我尝试了此处的 document.write 技术:Javasc
php - 如何从一个 PHP 脚本(如批处理文件)中运行多个 PHP 脚本？
如何从另一个 PHP 脚本(如批处理文件)中运行多个 PHP 脚本？如果我了解 include 在做什么，我认为 include 不会起作用；因为我正在运行的每个文件都会重新声明一些相同的函数等。我想
html - 如何从 HTML5 脚本/文件/页面调用 Lua 脚本
我想创建具有动态内容的网页。我有一个 HTML 页面，我想从中调用一个 lua 脚本如何调用 lua 脚本？ ? ？从中检索数据？我可以做类似的事情吗: int xx = 0; xx
jquery - 表格行不会自动滚动。脚本 1 滚动，脚本 2 不滚动。为什么？
我删除了我的第一个问题，并重新编写了更多细节和附加 jSfiddle domos。我有一个脚本，它运行查询并返回数据，然后填充表。表中的行自动循环滚动。所有这些工作正常，并通过使用以下代码完成。然而
javascript - amp-script 未找到脚本哈希。 amp-脚本[脚本 ="hello-world"]
我尝试使用 amp 脚本，但收到此错误: “[amp-script] 脚本哈希未找到。amp-script[script="hello-world"].js 必须在元[name="amp-script
java - 从 Java 执行 Shell 脚本，具有读取操作的 Shell 脚本
我有一个读取输入的 Shell 脚本 #!/bin/bash echo "Type the year that you want to check (4 digits), followed by [E
arrays - Redis Lua 脚本 - 如何将数组作为参数传递给 nodejs 中的 Lua 脚本？
我正在从 nodejs 调用 Lua 脚本。我想传递一个数组作为参数。我在 Lua 中解析该数组时遇到问题。下面是一个例子: var script = 'local actorlist = ARGV

首页

博学

6Ren·AI

商城

python - 从脚本运行蜘蛛时获取 scrapy crawl 命令的功能