- ubuntu12.04环境下使用kvm ioctl接口实现最简单的虚拟机
- Ubuntu 通过无线网络安装Ubuntu Server启动系统后连接无线网络的方法
- 在Ubuntu上搭建网桥的方法
- ubuntu 虚拟机上网方式及相关配置详解
CFSDN坚持开源创造价值,我们致力于搭建一个资源共享平台,让每一个IT人在这里找到属于你的精彩世界.
这篇CFSDN的博客文章Python爬虫实战之爬取携程评论由作者收集整理,如果你对这篇文章有兴趣,记得点赞哟.
这里的数据源是指html网页?还是Aajx异步。对于爬虫初学者来说,可能不知道怎么判断,这里辰哥也手把手过一遍.
提示:以下操作均不需要登录(当然登录也可以) 。
咱们先在浏览器里面搜索携程,然后在携程里面任意搜索一个景点:长隆野生动物世界,这里就以长隆野生动物世界为例,讲解如何去爬取携程评论数据.
。
页面下方则是评论数据 。
。
。
从上面两张图可以看出,点击评论下一页,浏览器的链接没有变化,说明数据是Ajax异步请求。因此我们就找到了数据是异步加载过来的,这时候需要去network里面是查看数据包.
在network中找到下面这个数据包 。
。
查看Preview里面的内容(请求返回内容) 。
可以看到数据已经请求到了,下面看一下数据是否是正确的(和网页内容一致).
。
ok,没问题之后,下面开始编写Python程序去请求数据.
1.请求地址 。
可以获取到请求链接和请求方式.
这里请求不用添加请求头header也是可以的。其中postUrl是请求链接,data_1是请求参数.
2.请求参数 。
在network里可以看到请求参数 。
在程序中的构建如下:
其中需要关注的是arg中的pageIndex(页数),pageSize(每页条数).
最终结果如下:
该景点的评论就可以成功爬取下来了.
上面只是采集了第一页的评论数据,通过改变arg中的pageIndex(页数),就可以遍历爬取全部的评论.
比如这个景点一共是300页。现在把循环给加上 。
最终的完整代码如下:
到此这篇关于Python爬虫实战之爬取携程评论的文章就介绍到这了,更多相关Python爬取携程评论内容请搜索我以前的文章或继续浏览下面的相关文章希望大家以后多多支持我! 。
原文链接:https://blog.csdn.net/aaahtml/article/details/117325495 。
最后此篇关于Python爬虫实战之爬取携程评论的文章就讲到这里了,如果你想了解更多关于Python爬虫实战之爬取携程评论的内容请搜索CFSDN的文章或继续浏览相关文章,希望大家以后支持我的博客! 。
关闭。这个问题不符合Stack Overflow guidelines .它目前不接受答案。 要求我们推荐或查找工具、库或最喜欢的场外资源的问题对于 Stack Overflow 来说是偏离主题的,
我是一名优秀的程序员,十分优秀!