- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我需要抓取一个电影共享网站,其中每部电影可以有多集。蜘蛛仍然可以正常工作,但返回的项目有一些缺点。
当蜘蛛访问索引页面时,它会提取观看电影的链接( http://tamnhinso.info/phim/phim-bo/ ),然后它会产生请求以获取电影的放映页面(有很多集),从那里它会解析链接对于每个剧集,然后尝试对每个剧集 URL 生成 GET 请求。之后,蜘蛛将解析 HTML 响应以获取每集的视频链接。
def start_requests(self):
for url in self.start_urls:
yield Request(url=url, callback=self.parse_list_movie)
def parse_list_movie(self, response):
movie_urls = LinkExtractor(restrict_xpaths="//div[@class='col-md-2 col-xs-6 movie-item']").extract_links(response)
for item in movie_urls:
yield Request(url=item.url, callback=self.parse_movie_info)
next_page = response.meta.get('next_page')
num_next_page = 2 if next_page is None else next_page
next_page_link = "phim/phim-bo/viewbycategory?page="
if num_next_page <= 40:
yield response.follow(next_page_link + str(num_next_page),
callback=self.parse_list_movie, meta = {'next_page' : num_next_page + 1})
def parse_movie_info(self, response):
l = ItemLoader(item=PhimBoItem(), response=response)
#some code to retrieve information from that film
link_film_url = response.xpath("//div[@class='movie-detail']//div[@class='mt-10']/a/@href").extract_first()
yield scrapy.Request(url=response.urljoin(link_film_url), callback=self.parse_list_episode, meta={"item": l})
def parse_list_episode(self, response):
loader = response.meta.get('item')
script = """
function main(splash)
splash.html5_media_enabled = true
splash.private_mode_enabled = false
assert(splash:go(splash.args.url))
assert(splash:wait(3))
return splash:html()
end
"""
for episode in LinkExtractor(restrict_xpaths="//div[@class='col-md-6 mt-20 watch-chap']").extract_links(response):
yield SplashRequest(url=response.urljoin(episode.url), callback=self.parse_link_episode, meta={'item': loader}, endpoint='execute',
args={'lua_source': script,'wait': 5, 'timeout': 3600})
def parse_link_episode(self, response):
loader = response.meta.get('item')
loader.replace_value('episode', self.get_episode(response))
return loader.load_item()
def get_episode(self, response):
l = ItemLoader(item=Episode(), response=response)
l.add_value('ep_num', response.url, re = r'\-(\d+)')
l.add_value('link', self.get_link(response))
return dict(l.load_item())
def get_link(self, response):
l = ItemLoader(item=Link(), response=response)
l.add_xpath('link_360', "//source[@label='360']/@src")
l.add_xpath('link_720', "//source[@label='720']/@src")
l.add_xpath('link_1080', "//source[@label='1080']/@src")
return dict(l.load_item())
返回的项目将通过项目管道传递并以 json 行格式保存。由于每部电影都有很多集,所以我得到的结果是这样的:
{"id":1, ..., "episode": {"ep_num": "1", "link": "..."}}
{"id":1, ..., "episode": {"ep_num": "2", "link": "..."}}
{"id":2, ..., "episode": {"ep_num": "1", "link": "..."}}
因为传递到管道的项目是电影中每一集的数据。我希望数据看起来像这样:
{"id":1, ..., "episode": [{"ep_num": "1", "link": "..."},
{"ep_num": "2", "link": "..."}, ...]}
{"id":2, ..., "episode": {"ep_num": "1", "link": "..."}}
我想我需要将数据传递回scrapy中的先前回调,但我不知道如何做到这一点。请帮帮我。我真的很感激。谢谢。
最佳答案
据我所知,至少没有简单的方法可以在解析方法中收集这些响应。
最简单的方法可能是在抓取完成后对项目进行后处理。
如果您等不了那么久,您可以将所请求的 URL 列表作为元数据传递给每个请求。在您的项目管道中,您可以尝试等待所有这些响应,直到进行进一步处理。在这种情况下,您必须确保所有请求实际上都会生成一个项目(即使是那些失败或被丢弃的请求)。
编辑:我刚刚偶然发现了这个库。它可能对您有帮助:https://github.com/rmax/scrapy-inline-requests
关于python - 使用 Scrapy 将数据传递回之前的回调,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/55748168/
我正在寻找一种使此打印 HTML 代码 fragment 向后兼容旧 Android 版本的简单方法: @TargetApi(Build.VERSION_CODES.KITKAT) private v
我在 GCC 终端 (centos linux) 中为 ATM 项目编译以下 c 和 .h 代码时收到以下错误。请帮忙,因为我是编程新手。 validate_acc.h #ifndef _VALIDA
在写关于 SO 的不同问题的答案时,我制作了这个片段: @import url('https://fonts.googleapis.com/css?family=Shadows+Into+Light'
试图弄清楚我应该如何在 my_div_class 之前放置一个 span 而不是替换所有它。现在它取代了 div,但我不想这样做。我假设它类似于 :before 但不知道如何使用它。 { va
我正在使用选择库 http://github.hubspot.com/select/和 noUiSlider https://refreshless.com/nouislider/ .我面临的问题如下
我是开发新手,独自工作。我正在使用 Xcode 和 git 版本控制。可能我没有适本地组织和做错事,但我通常决定做 promise 只是为了在我破坏一切之前做出安全点。在那一刻,我发现很难恰本地描述我
我想确保在同一个桶和键上读取和写入时,应该更新获取的值,也就是说,应该在对其进行写入操作之后获取它。我怎样才能做到这一点? 我想要的是,如果我更新一个键的值,如果我同时使用不同线程获取值,则更新同一个
我的问题与this有关问题,已经有了答案: yes, there is a happens-before relationship imposed between actionsof the thre
The before and after hook documentation on Relish仅显示 before(:suite) 在 before(:all) 之前调用。 我什么时候应该使用其中
我有 CSV 行,我想在其中检测所有内部双引号,没有文本限定符。这几乎可以正常工作,但我的正则表达式还可以检测双引号后的字符。 CSV 部分: "7580";"Lorem ipsum";"";"Lor
是否可以通过Youtube数据API检查广告是否可以与特定视频一起显示? 我了解contentDetails.licensedContent仅显示视频是否已上传至同一伙伴然后由其声明版权。由于第三者权
考虑一下用漂亮的彩色图表描述的“像素管道” https://developers.google.com/web/fundamentals/performance/rendering/ 我有一个元素(比
之前?
在 MVC3 中,我可以轻松地将 jQuery 脚本标签移动到页面底部“_Layout.vbhtml” 但是,在 ASP.NET MVC3 中,当您使用编辑器模板创建 Controller 时,脚手
悬停时内容被替换,但是当鼠标离开元素时我希望它变回来。我该怎么做? $('.img-wrap').hover(function(){ $(this).find('h4').text('Go
已关闭。这个问题是 not reproducible or was caused by typos 。目前不接受答案。 这个问题是由拼写错误或无法再重现的问题引起的。虽然类似的问题可能是 on-top
已关闭。这个问题是 not reproducible or was caused by typos 。目前不接受答案。 这个问题是由拼写错误或无法再重现的问题引起的。虽然类似的问题可能是 on-top
已关闭。此问题不符合Stack Overflow guidelines 。目前不接受答案。 已关闭 9 年前。 有关您编写的代码问题的问题必须在问题本身中描述具体问题 - 并包含有效代码以重现该问题。
版本:qwt 6.0.1我尝试开发频谱的对数缩放。我使用简单的线条来启用缩放plotspectrum->setAxisScaleEngine(QwtPlot::yLeft, new QwtLog10S
我有两个相同的表,I_Subject 和 I_Temp_Subject,我想将 Temp_Subject 表复制到 Subject 表。 I_Temp_Subject 由简单用户使用,I_Subjec
我的印象是第一次绘制发生在触发 DOMContentLoaded 事件之后。特别是,因为我认为为了让第一次绘制发生,需要渲染树,它依赖于 DOM 构造。另外,我知道 DOM 构造完成时会触发 DOMC
我是一名优秀的程序员,十分优秀!