Python3实现爬取指定百度贴吧页面并保存页面数据生成本地文档的方法-6ren

Python3实现爬取指定百度贴吧页面并保存页面数据生成本地文档的方法

转载作者：qq735679552 更新时间：2022-09-28 22:32:09

CFSDN坚持开源创造价值，我们致力于搭建一个资源共享平台，让每一个IT人在这里找到属于你的精彩世界.

这篇CFSDN的博客文章Python3实现爬取指定百度贴吧页面并保存页面数据生成本地文档的方法由作者收集整理，如果你对这篇文章有兴趣，记得点赞哟.

分享给大家供大家参考，具体如下：Python3实现爬取指定百度贴吧页面并保存页面数据生成本地文档的方法。分享给大家供大家参考，具体如下:

首先我们创建一个python文件, tieba.py，我们要完成的是，输入指定百度贴吧名字与指定页面范围之后爬取页面html代码，我们首先观察贴吧url的规律，比如:

百度贴吧LOL吧第一页：http://tieba.baidu.com/f?kw=lol&ie=utf-8&pn=0 。

第二页： http://tieba.baidu.com/f?kw=lol&ie=utf-8&pn=50 。

第三页： http://tieba.baidu.com/f?kw=lol&ie=utf-8&pn=100 。

发现规律了吧，贴吧中每个页面不同之处，就是url最后的pn的值，其余的都是一样的，我们可以抓住这个规律（kw表示贴吧名，采用url编码）.

清楚了url规则，我们便可以利用urllib进行批量式数据爬取，代码如下:

 
    ? 
   
         # -*- coding:utf-8 -*- 
        
         from 
         urllib  
         import 
         request as urllib2 
        
         from 
         urllib  
         import 
         parse 
        
         import 
         random 
        
         def 
         loadPage(url, page): 
        
         ''' 
        
         根据url获取服务器响应文件 
        
         url:需要爬取的url 
        
         ''' 
        
         print 
         ( 
         '---------正在下载页面%d-------' 
         % 
         page) 
        
         ua_list  
         = 
         [ 
        
         "Mozilla/5.0 (Macintosh; Intel Mac OS X 10.6; rv2.0.1) Gecko/20100101 Firefox/4.0.1" 
         , 
        
         "Mozilla/5.0 (Windows NT 6.1; rv2.0.1) Gecko/20100101 Firefox/4.0.1" 
         , 
        
         "Opera/9.80 (Macintosh; Intel Mac OS X 10.6.8; U; en) Presto/2.8.131 Version/11.11" 
         , 
        
         "Opera/9.80 (Windows NT 6.1; U; en) Presto/2.8.131 Version/11.11" 
         , 
        
         "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_7_0) AppleWebKit/535.11 (KHTML, like Gecko) Chrome/17.0.963.56 Safari/535.11" 
        
         ] 
        
         header  
         = 
         random.choice(ua_list) 
        
         request  
         = 
         urllib2.Request(url) 
        
         request.add_header( 
         'User-Agent' 
         , header) 
        
         response  
         = 
         urllib2.urlopen(request) 
        
         html  
         = 
         response.read() 
        
         return 
         html 
        
         def 
         write(html, page): 
        
         ''' 
        
         将html文件写入本地 
        
         :param html: 服务器响应文件内容 
        
         :return: 
        
         ''' 
        
         data  
         = 
         html 
        
         file_name  
         = 
         'tieba{}.txt' 
         . 
         format 
         (page) 
        
         print 
         ( 
         '---------正在保存文件%s-------' 
         % 
         file_name) 
        
         # 运用with open as语句使代码更加简洁 避免写异常处理和文件关闭语句 
        
         with  
         open 
         (file_name, 
         'w' 
         ,encoding 
         = 
         'utf-8' 
         ) as  
         file 
         : 
        
         file 
         .write(data.decode()) 
        
         print 
         ( 
         '---------success!---------' 
         ) 
        
         def 
         tiebaSpider(url, kw, begin, end): 
        
         ''' 
        
         爬取贴吧信息 
        
         ''' 
        
         words  
         = 
         { 
        
         'kw' 
         :kw 
        
         } 
        
         kw  
         = 
         parse.urlencode(words) 
        
         url  
         = 
         url  
         % 
         (kw) 
        
         for 
         page  
         in 
         range 
         (begin, end  
         + 
         1 
         ): 
        
         pn  
         = 
         ((page 
         - 
         1 
         ) 
         * 
         50 
         ) 
        
         ful_url  
         = 
         url  
         + 
         str 
         (pn) 
        
         html  
         = 
         loadPage(url, page) 
        
         write(html, page) 
        
         if 
         __name__  
         = 
         = 
         '__main__' 
         : 
        
         kw  
         = 
         input 
         ( 
         '请输入爬取贴吧名:' 
         ) 
        
         beginPage  
         = 
         int 
         ( 
         input 
         ( 
         '请输入起始页:' 
         )) 
        
         endPage  
         = 
         int 
         ( 
         input 
         ( 
         '请输入结束页:' 
         )) 
        
         url  
         = 
         r 
         'http://tieba.baidu.com/f?%s&pn=' 
        
         tiebaSpider(url, kw, beginPage, endPage)

控制台结果如下:

请输入爬取贴吧名:河南请输入起始页:1 请输入结束页:3 ---------正在下载页面1------- ---------正在保存文件tieba1.txt------- ---------success!--------- ---------正在下载页面2------- ---------正在保存文件tieba2.txt------- ---------success!--------- ---------正在下载页面3------- ---------正在保存文件tieba3.txt------- ---------success!--------- Process finished with exit code 0 。

希望本文所述对大家Python程序设计有所帮助.

原文链接：https://blog.csdn.net/wangbowj123/article/details/79123789 。

最后此篇关于Python3实现爬取指定百度贴吧页面并保存页面数据生成本地文档的方法的文章就讲到这里了,如果你想了解更多关于Python3实现爬取指定百度贴吧页面并保存页面数据生成本地文档的方法的内容请搜索CFSDN的文章或继续浏览相关文章，希望大家以后支持我的博客！。

文章推荐：女生英文网名女王范最新 Unbridled is my faith

文章推荐： Node.js 之父 Ryan Dahl 成立 Deno 公司，不影响开源

文章推荐：小清新简单两字女生网名堇年

文章推荐：从优秀到卓越：成为DevOps专家的7项软技能

jquery - 如果隐藏字段值更改，则应启用“保存”按钮。如果输入相同的值，则应再次禁用“保存”按钮
我尝试根据表单元素的更改禁用/启用保存按钮。但是，当通过弹出按钮选择更改隐藏输入字段值时，保存按钮不受影响。下面是我的代码。我正在尝试序列化旧的表单值并与更改后的表单值进行比较。但我猜隐藏的字段值无
python - 保存 django mongoengine 模型实例时无效的 EmbeddedDocumentField 项(保存()失败)
我正在尝试保存模型的实例，但我得到了 Invalid EmbeddedDocumentField item (1) 其中 1 是项目的 ID(我认为)。模型定义为 class Graph(Docum
iphone - 以 72 dpi 保存 UIImage(Retina 模拟器以 144 dpi 保存)
我有一个非常奇怪的问题......在我的 iPhone 应用程序中，用户可以打开相机胶卷中的图像，在我的示例中 1920 x 1080 像素 (72 dpi) 的壁纸。现在，想要将图像的宽度调整为例
Primefaces 保存/通过过滤数据表结果列表
目前，我正在使用具有排序/过滤功能的数据表成功地从我的数据库中显示图像元数据。在我的数据表下方，我使用第三方图像覆盖流( http://www.jacksasylum.eu/ContentFlow/
Javascript 保存、删除和重新加载输入值
我的脚本有问题。我想按此顺序执行以下步骤: 1. 保存输入字段中的文本。 2. 删除输入字段中的所有文本。 3. 在输入字段中重新加载之前删除的相同文本。我的脚本的问题是 ug()- 函数在我的文本
Laravel 保存/更新多对多关系
任何人都可以帮助我如何保存多对多关系吗？我有任务，用户可以有很多任务，任务可以有很多用户(多对多)，我想要实现的是，在更新表单中，管理员可以将多个用户分配给特定任务。这是通过 html 多选输入来完成
Tensorflow 保存/恢复批量归一化
我在 Tensorflow 中训练了一个具有批归一化的模型。我想保存模型并恢复它以供进一步使用。批量归一化是通过完成的 def batch_norm(input, phase): retur
唯一/保存/更新的Grails问题
我遇到了 grails 的问题。我有一个看起来像这样的域: class Book { static belongsTo = Author String toString() { tit
JavaScript - 保存、存储和更新数组
所以我正在开发一个应用程序，一旦用户连接(通过 soundcloud)，就会出现以下对象: {userid: userid, username: username, genre: genre, fol
Angular 保存/恢复组件状态
我正在开发一个具有多选项卡布局的 Angular 7 应用程序。每个选项卡都包含一个组件，该组件可以引用其他嵌套组件。当用户选择一个新的/另一个选项卡时，当前选项卡上显示的组件将被销毁(我不仅仅是隐
Java JTextPane 保存
我尝试使用 JEditorPane 进行一些简单的文本格式化，但随着知识的增长，我发现 JTextPane 更容易实现并且更强大。我的问题是如何将 JTextPane 中的格式化文本保存到文件？它应
Docker:保存 - 不产生输出
使用 Docker 相当新。我为 Oracle 11g Full 提取了一个图像。创建了一个数据库并将应用程序安装到容器中。正确配置后，我提交了生成 15GB 镜像的容器。测试了该图像的新容器，
ios - 将核心数据值传递到文本字段中以进行编辑/保存
我是使用 Xcode 和 swift 的新手，仍在学习中。我在将核心数据从实体传递到文本字段/标签时遇到问题，然后用户可以选择编辑和保存记录。我的目标是，当用户从 friendslistViewCon
java - 保存/加载具有依赖关系的对象的可靠方法？
我正在用 Java 编写 Android 游戏，我需要一种可靠的方法来快速保存和加载应用程序状态。这个问题似乎适用于大多数 OO 语言。了解我需要保存的内容:我正在使用策略模式来控制我的游戏实体。我
c++ - 保存/加载结构数组是个好主意吗？
我想知道使用 fstream 加载/保存某种结构类型的数组是否是个好主意。注意，我说的是加载/保存到二进制文件。我应该加载/保存独立变量，例如 int、float、boolean 而不是结构吗？我这么
c++ - 保存 QNetworkReply
我希望能够将 QNetworkReply 保存到 QString/QByteArray。在我看到的示例中，它们总是将流保存到另一个文件。目前我的代码看起来像这样，我从主机那里得到一个字符串，我想做的
Android 保存 Canvas
我正在创建一个绘图应用程序。我有一个带有 Canvas 的自定义 View ，它根据用户输入绘制线条: class Line { float startX, startY, stopX, stop
android - 保存 Intent
我有 3 个 Activity 第一个 Activity 调用第二个 Activity ，第二个 Activity 调用第三个 Activity 。第二个 Activity 使用第一个 Activi
ios - 保存 cookies ？
我想知道如何在 Xcode 中保存 cookie。我想使用从一个网页获取的 cookie 并使用它访问另一个网页。我使用下面的代码登录该网站，我想保存从该连接获得的 cookie，以便在我建立另一个连
ios - 保存/编辑重复日历事件的最佳方法
我有一个 SQLite 数据库存储我的所有日历事件，建模如下: TimerEvent *Attributes -date -dateForMark -reminder *Relat

qq735679552

个人简介

我是一名优秀的程序员,十分优秀！

作者热门文章

滴滴打车优惠券免费领取

全站热门文章

首页

博学

6Ren·AI

商城

Python3实现爬取指定百度贴吧页面并保存页面数据生成本地文档的方法