python 爬取马蜂窝景点翻页文字评论的实现-6ren

python 爬取马蜂窝景点翻页文字评论的实现

转载作者：qq735679552 更新时间：2022-09-29 22:32:09

CFSDN坚持开源创造价值，我们致力于搭建一个资源共享平台，让每一个IT人在这里找到属于你的精彩世界.

这篇CFSDN的博客文章python 爬取马蜂窝景点翻页文字评论的实现由作者收集整理，如果你对这篇文章有兴趣，记得点赞哟.

使用Chrome、python3.7、requests库和VSCode进行爬取马蜂窝黄鹤楼的文字评论(http://www.mafengwo.cn/poi/5426285.html).

首先，我们复制一段评论，查看网页源代码，按Ctrl+F查找，发现没有找到评论，说明评论内容不在http://www.mafengwo.cn/poi/5426285.html页面.

python 爬取马蜂窝景点翻页文字评论的实现

回到页面，划到评论列表，右键检查，选择Network，然后点击后一页翻页，观察Network里的变化，我们要爬的文件就在下面的某个文件里（主要找XHR和JS两个模块）。选择Preview可以更好的让我们寻找我们想要的文件，然后选择Headers找到我们要爬的url.

python 爬取马蜂窝景点翻页文字评论的实现

经过分析我们找到要爬取的url是http://pagelet.mafengwo.cn/poi/pagelet/poiCommentListApi?callback=jQuery18102698237405245767_1579401525334&params=%7B%22poi_id%22%3A%225426285%22%2C%22page%22%3A2%2C%22just_comment%22%3A1%7D&_ts=1579402072160&sn=20e98d65a0&=1579402072161 然而点进去是这样的。

python 爬取马蜂窝景点翻页文字评论的实现

这个时候对比一下这两个页面的Request Headers，发现原页面多了个Refer参数。

原页面。

python 爬取马蜂窝景点翻页文字评论的实现

然后看一下请求get请求需要的参数Query String Parameters，其中poi_id是景点id，page是评论页面（翻页只用改变page的值就行）.

python 爬取马蜂窝景点翻页文字评论的实现

 
         import 
         re 
        
         import 
         time 
        
         import 
         requests 
        
         #评论内容所在的url，？后面是get请求需要的参数内容 
        
         comment_url 
         = 
         'http://pagelet.mafengwo.cn/poi/pagelet/poiCommentListApi?' 
        
         requests_headers 
         = 
         { 
        
         'Referer' 
         :  
         'http://www.mafengwo.cn/poi/5426285.html' 
         , 
        
         'User-Agent' 
         :  
         'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/79.0.3945.88 Safari/537.36' 
        
         } 
         #请求头 
        
         for 
         num  
         in 
         range 
         ( 
         1 
         , 
         6 
         ): 
        
         requests_data 
         = 
         { 
        
         'params' 
         :  
         '{"poi_id":"5426285","page":"%d","just_comment":1}' 
         % 
         (num)   
         #经过测试只需要用params参数就能爬取内容 
        
         } 
        
         response  
         = 
         requests.get(url 
         = 
         comment_url,headers 
         = 
         requests_headers,params 
         = 
         requests_data) 
        
         if 
         200 
         = 
         = 
         response.status_code: 
        
         page  
         = 
         response.content.decode( 
         'unicode-escape' 
         ,  
         'ignore' 
         ).encode( 
         'utf-8' 
         ,  
         'ignore' 
         ).decode( 
         'utf-8' 
         ) 
         #爬取页面并且解码 
        
         page  
         = 
         page.replace( 
         '\\/' 
         ,  
         '/' 
         ) 
         #将\/转换成/ 
        
         #日期列表 
        
         date_pattern  
         = 
         r 
         '<a class="btn-comment _j_comment" id="codetool">

结果。

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持我.

原文链接：https://blog.csdn.net/qq_45373920/article/details/104037607 。

 
         
         
         
          
           
          马蜂窝 
          评论 
          Python 
          爬取 
          
          
           
          
         
         
          
          延伸 · 阅读 
          
          
          2020-04-08python机器学习库xgboost的使用 
          2020-04-08python爬取本站电子书信息并入库的实现代码 
          2020-04-07举例分析Python中设计模式之外观模式的运用 
          2020-04-05Python实现FLV视频拼接功能 
          2020-04-05python同义词替换的实现（jieba分词） 
          2020-04-05TIOBE 4月榜单出炉：Python进前三，少儿编程语言 
          
         
         
         
         
          
           
          
         
         
         
           精彩推荐 
          
         
         
          
           
            
           
          Python 
            
            python处理csv数据的方法 
            这篇文章主要介绍了python处理csv数据的方法,实例分析了Python处理csv数据的技巧,需要的朋友可以参考下... 。 
             
             kirkversion1 
             292 
             2019-11-27 
             
           
  
          Python 
            
            使用tensorboard可视化loss和acc的实例 
            今天小编就为大家分享一篇使用tensorboard可视化loss和acc的实例，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧... 。 
             
             正在努力学习的大金 
             134 
             2020-04-03 
             
           
  
          Python 
            
            TensorFlow实现打印每一层的输出 
            今天小编就为大家分享一篇TensorFlow实现打印每一层的输出，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧... 。 
             
             Kluiverthoo 
             300 
             2020-04-03 
             
           
  
          Python 
            
            python提取内容关键词的方法 
            这篇文章主要介绍了python提取内容关键词的方法,适用于英文关键词的提取,非常具有实用价值,需要的朋友可以参考下... 。 
             
             上大王 
             347 
             2019-12-03 
             
           
  
          Python 
            
            Python比较两个图片相似度的方法 
            这篇文章主要介绍了Python比较两个图片相似度的方法,涉及Python操作pil模块实现图片比较的技巧,具有一定参考借鉴价值,需要的朋友可以参考下... 。 
             
             pythoner 
             295 
             2019-11-28 
             
           
  
          Python 
            
            Python实现将n个点均匀地分布在球面上的方法 
            这篇文章主要介绍了Python实现将n个点均匀地分布在球面上的方法,涉及Python绘图的技巧与相关数学函数的调用,具有一定参考借鉴价值,需要的朋友可以参考下... 。 
             
             redraiment 
             320 
             2019-11-27 
             
           
  
          Python 
            
            django 文件上传功能的相关实例代码(简单易懂) 
            这篇文章主要介绍了django 文件上传功能的相关实例代码,代码简单易懂，非常不错，具有一定的参考借鉴价值，需要的朋友可以参考下... 。 
             
             二十七º 
             393 
             2020-04-02 
             
           
  
          Python 
            
            tensorflow-gpu安装的常见问题及解决方案 
            这篇文章主要介绍了tensorflow-gpu安装的常见问题及解决方案，本文给大家介绍的非常详细，具有一定的参考借鉴价值，需要的朋友参考下吧,需要的朋友可以... 。 
             
             上山老人 
             197 
             2020-04-08 
             
           
  
          
         
         
          
           
          
          
           
           最近更新 
           
           
            
            tensorflow-gpu安装的常见问题及解决方案 
            python 爬取马蜂窝景点翻页文字评论的实现 
            python机器学习库xgboost的使用 
            使用tensorflow DataSet实现高效加载变长文本输入 
            浅谈tensorflow中Dataset图片的批量读取及维度的 
            
           
          
          
           
           编辑推荐 
           
           
            
             
              
               
               
               python是什么意思？python有什么用？ 
               
              
            2 
              
              使用Python抓取模板之家的CSS模板 
              2019-12-07 
              
            3 
              
              Python 列表(List)操作方法详解 
              2019-11-22 
              
            
           
          
          
           
           阅读排行 
           
           
            
            1 python实现端口转发器的方法 
            2 Python实现简单的可逆加密程序实例 
            3 Python用GET方法上传文件 
            4 Python编写屏幕截图程序方法 
            5 Python爬取读者并制作成PDF 
            6 python模拟鼠标拖动操作的方法 
            7 python定义类self用法实例解析 
            8 Python Web框架Flask中使用七牛云存储实例 
            9 Python标准库urllib2的一些使用细节总结 
            10 Python中使用wxPython开发的一个简易笔记本程序 
            
           
          
          
           
           热门标签 
           
           
           
             2048 　 contextlib 　 SLOTS 　 MELIAE 　 FEEDPARSER 　 暂存 　 持久性管理 　 pickle模块 　 THREADING 　 reduce 　 nignx 　 装饰器 　 函数式编程 　 兔子毒药 　 监控文件 　 流量监控 　 动态解析域名 　 xgboost 　 Web框架 　 自定义编码 　 PIL库 　 高斯模糊 　 wxPython 　 import 　 自定义模块 　 Python开发 　 元类 　 metaclass 　 魔术方法 　 DNSPod 　 
            
           
          
          
           
          
         
         
         
          
          © 2019-2020 脚本之家 | 我(www.zzvips.com)旗下站点 版权所有 
          关于我们联系我们版权申明网站地图

最后此篇关于python 爬取马蜂窝景点翻页文字评论的实现的文章就讲到这里了,如果你想了解更多关于python 爬取马蜂窝景点翻页文字评论的实现的内容请搜索CFSDN的文章或继续浏览相关文章，希望大家以后支持我的博客！。

文章推荐： win10安装tensorflow-gpu1.8.0详细完整步骤

文章推荐： tensorflow-gpu安装的常见问题及解决方案

文章推荐： python机器学习库xgboost的使用

文章推荐：使用tensorflow DataSet实现高效加载变长文本输入

python - Python 中的集群或合并集群以减少组数 (Python)
我正在处理一组标记为 160 个组的 173k 点。我想通过合并最接近的(到 9 或 10 个组)来减少组/集群的数量。我搜索过 sklearn 或类似的库，但没有成功。我猜它只是通过 knn 聚类
python - python 列表的子集基于同一列表的元素组，pythonically
我有一个扁平数字列表，这些数字逻辑上以 3 为一组，其中每个三元组是 (number, __ignored, flag[0 or 1])，例如: [7,56,1, 8,0,0, 2,0,0, 6,1,
python - 激活 Python 虚拟环境并在另一个 Python 脚本中调用 Python 脚本
我正在使用 pipenv 来管理我的包。我想编写一个 python 脚本来调用另一个使用不同虚拟环境(VE)的 python 脚本。如何运行使用 VE1 的 python 脚本 1 并调用另一个 p
python - 在焕然一新的 Python 环境中以编程方式从 Python 内部执行 Python 文件
假设我有一个文件 script.py 位于 path = "foo/bar/script.py"。我正在寻找一种在 Python 中通过函数 execute_script() 从我的主要 Python
python - 从 python 脚本但在 python 脚本之外运行 python 脚本
这听起来像是谜语或笑话，但实际上我还没有找到这个问题的答案。问题到底是什么？我想运行 2 个脚本。在第一个脚本中，我调用另一个脚本，但我希望它们继续并行，而不是在两个单独的线程中。主要是我不希望第
python - 使用不同的 python 从 python 运行 python 脚本
我有一个带有 python 2.5.5 的软件。我想发送一个命令，该命令将在 python 2.7.5 中启动一个脚本，然后继续执行该脚本。我试过用 #!python2.7.5 和http://re
python - 为什么从 Python 命令行调用 Python 时 Python 无法找到并运行我的脚本？
我在 python 命令行(使用 python 2.7)中，并尝试运行 Python 脚本。我的操作系统是 Windows 7。我已将我的目录设置为包含我所有脚本的文件夹，使用: os.chdir("
python - 使用动态版本的 Python 执行嵌入的 Python 代码时出现致命的 Python 错误
剧透:部分解决(见最后)。以下是使用 Python 嵌入的代码示例: #include int main(int argc, char** argv) { Py_SetPythonHome
python - python 中识别 python 数组或列表中最大累积差异的最快方法是什么？
假设我有以下列表，对应于及时的股票价格: prices = [1, 3, 7, 10, 9, 8, 5, 3, 6, 8, 12, 9, 6, 10, 13, 8, 4, 11] 我想确定以下总体上最
python - (Python) 通过单选按钮 python 更新背景
所以我试图在选择某个单选按钮时更改此框架的背景。我的框架位于一个类中，并且单选按钮的功能位于该类之外。 (这样我就可以在所有其他框架上调用它们。) 问题是每当我选择单选按钮时都会出现以下错误: co
python - python 中的字符串与正则表达式比较在 python 中失败
我正在尝试将字符串与 python 中的正则表达式进行比较，如下所示， #!/usr/bin/env python3 import re str1 = "Expecting property name
python - python 如何加载Boost.Python 库？
考虑以下原型(prototype) Boost.Python 模块，该模块从单独的 C++ 头文件中引入类“D”。 /* file: a/b.cpp */ BOOST_PYTHON_MODULE(c)
python - python 检查模块 python 的问题
如何编写一个程序来“识别函数调用的行号？” python 检查模块提供了定位行号的选项，但是， def di(): return inspect.currentframe().f_back.f_l
python - 系统 python 与用户 python
我已经使用 macports 安装了 Python 2.7，并且由于我的 $PATH 变量，这就是我输入 $ python 时得到的变量。然而，virtualenv 默认使用 Python 2.6，除
python - [Python] : Python re. 长字符串行的搜索速度优化
我只想问如何加快 python 上的 re.search 速度。我有一个很长的字符串行，长度为 176861(即带有一些符号的字母数字字符)，我使用此函数测试了该行以进行研究: def getExe
python - 编辑字符串 python 正则表达式 python
list1= [u'%app%%General%%Council%', u'%people%', u'%people%%Regional%%Council%%Mandate%', u'%ppp%%Ge
python - Python 映射中的副作用(Python "do" block )
这个问题在这里已经有了答案: Is it Pythonic to use list comprehensions for just side effects? (7 个答案) 关闭 4 个月前。告
python - 使用其值逻辑组合两个 python 列表 - Python
我想用 Python 将两个列表组合成一个列表，方法如下: a = [1,1,1,2,2,2,3,3,3,3] b= ["Sun", "is", "bright", "June","and" ,"Ju
python - Boost.Python python 链接错误
我正在运行带有最新 Boost 发行版 (1.55.0) 的 Mac OS X 10.8.4 (Darwin 12.4.0)。我正在按照说明 here构建包含在我的发行版中的教程 Boost-Pyth
python - 在 Python 中仅使用内置库制作一个基本的网络抓取工具 - Python
学习 Python，我正在尝试制作一个没有任何第 3 方库的网络抓取工具，这样过程对我来说并没有简化，而且我知道我在做什么。我浏览了一些在线资源，但所有这些都让我对某些事情感到困惑。 html 看起来

qq735679552

个人简介

我是一名优秀的程序员,十分优秀！

作者热门文章

滴滴打车优惠券免费领取

全站热门文章

首页

博学

6Ren·AI

商城

python 爬取马蜂窝景点翻页文字评论的实现

延伸 · 阅读

python处理csv数据的方法

使用tensorboard可视化loss和acc的实例

TensorFlow实现打印每一层的输出

python提取内容关键词的方法

Python比较两个图片相似度的方法

Python实现将n个点均匀地分布在球面上的方法

django 文件上传功能的相关实例代码(简单易懂)

tensorflow-gpu安装的常见问题及解决方案

使用Python抓取模板之家的CSS模板

Python 列表(List)操作方法详解