- ubuntu12.04环境下使用kvm ioctl接口实现最简单的虚拟机
- Ubuntu 通过无线网络安装Ubuntu Server启动系统后连接无线网络的方法
- 在Ubuntu上搭建网桥的方法
- ubuntu 虚拟机上网方式及相关配置详解
CFSDN坚持开源创造价值,我们致力于搭建一个资源共享平台,让每一个IT人在这里找到属于你的精彩世界.
这篇CFSDN的博客文章Python3实现爬取指定百度贴吧页面并保存页面数据生成本地文档的方法由作者收集整理,如果你对这篇文章有兴趣,记得点赞哟.
分享给大家供大家参考,具体如下:Python3实现爬取指定百度贴吧页面并保存页面数据生成本地文档的方法。分享给大家供大家参考,具体如下:
首先我们创建一个python文件, tieba.py,我们要完成的是,输入指定百度贴吧名字与指定页面范围之后爬取页面html代码,我们首先观察贴吧url的规律,比如:
百度贴吧LOL吧第一页:http://tieba.baidu.com/f?kw=lol&ie=utf-8&pn=0 。
第二页: http://tieba.baidu.com/f?kw=lol&ie=utf-8&pn=50 。
第三页: http://tieba.baidu.com/f?kw=lol&ie=utf-8&pn=100 。
发现规律了吧,贴吧中每个页面不同之处,就是url最后的pn的值,其余的都是一样的,我们可以抓住这个规律(kw表示贴吧名,采用url编码).
清楚了url规则,我们便可以利用urllib进行批量式数据爬取,代码如下:
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
|
# -*- coding:utf-8 -*-
from
urllib
import
request as urllib2
from
urllib
import
parse
import
random
def
loadPage(url, page):
'''
根据url获取服务器响应文件
url:需要爬取的url
'''
print
(
'---------正在下载页面%d-------'
%
page)
ua_list
=
[
"Mozilla/5.0 (Macintosh; Intel Mac OS X 10.6; rv2.0.1) Gecko/20100101 Firefox/4.0.1"
,
"Mozilla/5.0 (Windows NT 6.1; rv2.0.1) Gecko/20100101 Firefox/4.0.1"
,
"Opera/9.80 (Macintosh; Intel Mac OS X 10.6.8; U; en) Presto/2.8.131 Version/11.11"
,
"Opera/9.80 (Windows NT 6.1; U; en) Presto/2.8.131 Version/11.11"
,
"Mozilla/5.0 (Macintosh; Intel Mac OS X 10_7_0) AppleWebKit/535.11 (KHTML, like Gecko) Chrome/17.0.963.56 Safari/535.11"
]
header
=
random.choice(ua_list)
request
=
urllib2.Request(url)
request.add_header(
'User-Agent'
, header)
response
=
urllib2.urlopen(request)
html
=
response.read()
return
html
def
write(html, page):
'''
将html文件写入本地
:param html: 服务器响应文件内容
:return:
'''
data
=
html
file_name
=
'tieba{}.txt'
.
format
(page)
print
(
'---------正在保存文件%s-------'
%
file_name)
# 运用with open as语句使代码更加简洁 避免写异常处理和文件关闭语句
with
open
(file_name,
'w'
,encoding
=
'utf-8'
) as
file
:
file
.write(data.decode())
print
(
'---------success!---------'
)
def
tiebaSpider(url, kw, begin, end):
'''
爬取贴吧信息
'''
words
=
{
'kw'
:kw
}
kw
=
parse.urlencode(words)
url
=
url
%
(kw)
for
page
in
range
(begin, end
+
1
):
pn
=
((page
-
1
)
*
50
)
ful_url
=
url
+
str
(pn)
html
=
loadPage(url, page)
write(html, page)
if
__name__
=
=
'__main__'
:
kw
=
input
(
'请输入爬取贴吧名:'
)
beginPage
=
int
(
input
(
'请输入起始页:'
))
endPage
=
int
(
input
(
'请输入结束页:'
))
url
=
r
'http://tieba.baidu.com/f?%s&pn='
tiebaSpider(url, kw, beginPage, endPage)
|
控制台结果如下:
请输入爬取贴吧名:河南 请输入起始页:1 请输入结束页:3 ---------正在下载页面1------- ---------正在保存文件tieba1.txt------- ---------success!--------- ---------正在下载页面2------- ---------正在保存文件tieba2.txt------- ---------success!--------- ---------正在下载页面3------- ---------正在保存文件tieba3.txt------- ---------success!--------- Process finished with exit code 0 。
希望本文所述对大家Python程序设计有所帮助.
原文链接:https://blog.csdn.net/wangbowj123/article/details/79123789 。
最后此篇关于Python3实现爬取指定百度贴吧页面并保存页面数据生成本地文档的方法的文章就讲到这里了,如果你想了解更多关于Python3实现爬取指定百度贴吧页面并保存页面数据生成本地文档的方法的内容请搜索CFSDN的文章或继续浏览相关文章,希望大家以后支持我的博客! 。
我尝试根据表单元素的更改禁用/启用保存按钮。但是,当通过弹出按钮选择更改隐藏输入字段值时,保存按钮不受影响。 下面是我的代码。我正在尝试序列化旧的表单值并与更改后的表单值进行比较。但我猜隐藏的字段值无
我正在尝试保存模型的实例,但我得到了 Invalid EmbeddedDocumentField item (1) 其中 1 是项目的 ID(我认为)。 模型定义为 class Graph(Docum
我有一个非常奇怪的问题......在我的 iPhone 应用程序中,用户可以打开相机胶卷中的图像,在我的示例中 1920 x 1080 像素 (72 dpi) 的壁纸。 现在,想要将图像的宽度调整为例
目前,我正在使用具有排序/过滤功能的数据表成功地从我的数据库中显示图像元数据。在我的数据表下方,我使用第三方图像覆盖流( http://www.jacksasylum.eu/ContentFlow/
我的脚本有问题。我想按此顺序执行以下步骤: 1. 保存输入字段中的文本。 2. 删除输入字段中的所有文本。 3. 在输入字段中重新加载之前删除的相同文本。 我的脚本的问题是 ug()- 函数在我的文本
任何人都可以帮助我如何保存多对多关系吗?我有任务,用户可以有很多任务,任务可以有很多用户(多对多),我想要实现的是,在更新表单中,管理员可以将多个用户分配给特定任务。这是通过 html 多选输入来完成
我在 Tensorflow 中训练了一个具有批归一化的模型。我想保存模型并恢复它以供进一步使用。批量归一化是通过 完成的 def batch_norm(input, phase): retur
我遇到了 grails 的问题。我有一个看起来像这样的域: class Book { static belongsTo = Author String toString() { tit
所以我正在开发一个应用程序,一旦用户连接(通过 soundcloud),就会出现以下对象: {userid: userid, username: username, genre: genre, fol
我正在开发一个具有多选项卡布局的 Angular 7 应用程序。每个选项卡都包含一个组件,该组件可以引用其他嵌套组件。 当用户选择一个新的/另一个选项卡时,当前选项卡上显示的组件将被销毁(我不仅仅是隐
我尝试使用 JEditorPane 进行一些简单的文本格式化,但随着知识的增长,我发现 JTextPane 更容易实现并且更强大。 我的问题是如何将 JTextPane 中的格式化文本保存到文件?它应
使用 Docker 相当新。 我为 Oracle 11g Full 提取了一个图像。创建了一个数据库并将应用程序安装到容器中。 正确配置后,我提交了生成 15GB 镜像的容器。 测试了该图像的新容器,
我是使用 Xcode 和 swift 的新手,仍在学习中。我在将核心数据从实体传递到文本字段/标签时遇到问题,然后用户可以选择编辑和保存记录。我的目标是,当用户从 friendslistViewCon
我正在用 Java 编写 Android 游戏,我需要一种可靠的方法来快速保存和加载应用程序状态。这个问题似乎适用于大多数 OO 语言。 了解我需要保存的内容:我正在使用策略模式来控制我的游戏实体。我
我想知道使用 fstream 加载/保存某种结构类型的数组是否是个好主意。注意,我说的是加载/保存到二进制文件。我应该加载/保存独立变量,例如 int、float、boolean 而不是结构吗?我这么
我希望能够将 QNetworkReply 保存到 QString/QByteArray。在我看到的示例中,它们总是将流保存到另一个文件。 目前我的代码看起来像这样,我从主机那里得到一个字符串,我想做的
我正在创建一个绘图应用程序。我有一个带有 Canvas 的自定义 View ,它根据用户输入绘制线条: class Line { float startX, startY, stopX, stop
我有 3 个 Activity 第一个 Activity 调用第二个 Activity ,第二个 Activity 调用第三个 Activity 。 第二个 Activity 使用第一个 Activi
我想知道如何在 Xcode 中保存 cookie。我想使用从一个网页获取的 cookie 并使用它访问另一个网页。我使用下面的代码登录该网站,我想保存从该连接获得的 cookie,以便在我建立另一个连
我有一个 SQLite 数据库存储我的所有日历事件,建模如下: TimerEvent *Attributes -date -dateForMark -reminder *Relat
我是一名优秀的程序员,十分优秀!