详解Python解决抓取内容乱码问题（decode和encode解码）-6ren

详解Python解决抓取内容乱码问题（decode和encode解码）

转载作者：qq735679552 更新时间：2022-09-28 22:32:09

29

4

CFSDN坚持开源创造价值，我们致力于搭建一个资源共享平台，让每一个IT人在这里找到属于你的精彩世界.

这篇CFSDN的博客文章详解Python解决抓取内容乱码问题（decode和encode解码）由作者收集整理，如果你对这篇文章有兴趣，记得点赞哟.

1、乱码问题描述。

经常在爬虫或者一些操作的时候，经常会出现中文乱码等问题，如下。

详解Python解决抓取内容乱码问题（decode和encode解码）

原因是源网页编码和爬取下来后的编码格式不一致。

2、利用encode与decode解决乱码问题。

字符串在python内部的表示是unicode编码，在做编码转换时，通常需要以unicode作为中间编码，即先将其他编码的字符串解码（decode）成unicode，再从unicode编码（encode）成另一种编码.

decode的作用是将其他编码的字符串转换成unicode编码，如str1.decode(‘gb2312')，表示将gb2312编码的字符串str1转换成unicode编码.

encode的作用是将unicode编码转换成其他编码的字符串，如str2.encode(‘utf-8')，表示将unicode编码的字符串str2转换成utf-8编码.

decode中写的就是想抓取的网页的编码，encode即自己想设置的编码。

代码如下。

 
    ? 
   
         #!/usr/bin/env python 
        
         # -*- coding:utf-8 -*- 
        
         # author: xulinjie time:2017/10/22 
        
         import 
         urllib2 
        
         request 
         = 
         urllib2.request(r 
         'http://nhxy.zjxu.edu.cn/' 
         ) 
        
         res 
         = 
         urllib2.urlopen(request).read() 
        
         res  
         = 
         res.decode( 
         'gb2312' 
         ).encode( 
         'utf-8' 
         ) 
         / 
         / 
         解决乱码 
        
         wfile 
         = 
         open 
         (r 
         './1.html' 
         ,r 
         'wb' 
         ) 
        
         wfile.write(res) 
        
         wfile.close() 
        
         print 
         res

或者。

 
    ? 
   
         #!/usr/bin/env python 
        
         # -*- coding:utf-8 -*- 
        
         # author: xulinjie time:2017/10/22 
        
         import 
         urllib2 
        
         request 
         = 
         urllib2.request(r 
         'http://nhxy.zjxu.edu.cn/' 
         ) 
        
         res 
         = 
         urllib2.urlopen(request).read() 
        
         res 
         = 
         res.decode( 
         'gb2312' 
         ) 
        
         res 
         = 
         res.encode( 
         'utf-8' 
         ) 
        
         wfile 
         = 
         open 
         (r 
         './1.html' 
         ,r 
         'wb' 
         ) 
        
         wfile.write(res) 
        
         wfile.close() 
        
         print 
         res

但是还要注意：如果一个字符串已经是unicode了，再进行解码则将出错，因此通常要对其编码方式是否为unicode进行判断。

isinstance(s, unicode)#用来判断是否为unicode 。

用非unicode编码形式的str来encode会报错。

所以最终可靠代码:

 
    ? 
   
         #!/usr/bin/env python 
        
         # -*- coding:utf-8 -*- 
        
         # author: xulinjie time:2017/10/22 
        
         import 
         urllib2 
        
         request 
         = 
         urllib2.request(r 
         'http://nhxy.zjxu.edu.cn/' 
         ) 
        
         res 
         = 
         urllib2.urlopen(request).read() 
        
         if 
         isinstance 
         (res,  
         unicode 
         ): 
        
         res 
         = 
         res.encode( 
         'utf-8' 
         ) 
        
         else 
         : 
        
         res 
         = 
         res.decode( 
         'gb2312' 
         ).encode( 
         'utf-8' 
         ) 
        
         wfile 
         = 
         open 
         (r 
         './1.html' 
         ,r 
         'wb' 
         ) 
        
         wfile.write(res) 
        
         wfile.close() 
        
         print 
         res

详解Python解决抓取内容乱码问题（decode和encode解码）

3、如何找到需要抓取的目标网页的编码格式。

1、查看网页源代码。

详解Python解决抓取内容乱码问题（decode和encode解码）

如果源代码中没有charset编码格式显示可以用下面的方法。

2、检查元素，查看response headers 。

详解Python解决抓取内容乱码问题（decode和encode解码）

以上所述是小编给大家介绍的python解决抓取内容乱码问题（decode和encode解码）详解整合，希望对大家有所帮助，如果大家有任何疑问请给我留言，小编会及时回复大家的。在此也非常感谢大家对我网站的支持！。

原文链接：https://blog.csdn.net/w_linux/article/details/78370218 。

最后此篇关于详解Python解决抓取内容乱码问题（decode和encode解码）的文章就讲到这里了,如果你想了解更多关于详解Python解决抓取内容乱码问题（decode和encode解码）的内容请搜索CFSDN的文章或继续浏览相关文章，希望大家以后支持我的博客！。

29

4

0

文章推荐： OpenCV-Python实现多模板匹配

文章推荐： SpringMVC 参数绑定相关知识总结

文章推荐： OpenCV-Python使用分水岭算法实现图像的分割与提取

文章推荐：详解python读取和输出到txt

Golang 中的 Json 解码/解码
我有以下 json: {"results": [{"columns":["room_id","player_name","player_ip"], "types":["integer","text
json - Golang 解码/解码 JSON 中的无效 unicode
我在 go 中获取格式不一致的 JSON 文件。例如，我可以有以下内容: {"email": "\"blah.blah@blah.com\""} {"email": "robert@gmail.com
javascript - JavaScript 中的 JSON 编码/解码 base64 编码/解码
JavaScript中有JSON编码/解码base64编码/解码函数吗？最佳答案是的，btoa() 和 atob() 在某些浏览器中可以工作: var enc = btoa("this is so
Encog之一 - 解码
我在其中一个项目中使用了 Encog，但在解码 One-Of Class 时卡住了。该字段的规范化操作之一是 NormalizationAction.OneOf，它具有三个输出。当我评估时，我想解码预
R:序列化不完全匹配的文本的base64编码/解码
在我的 previous question关于使用 serialize() 创建对象的 CSV 我从 jmoy 那里得到了一个很好的答案，他推荐了我的序列化文本的 base64 编码。这正是我要找的。
解码 JPEG 文件时跨浏览器不兼容？
有些事情让我感到困惑 - 为什么 this image在每个浏览器中显示不同？ IE9(和 Windows 照片查看器)中的图像: Firefox(和 Photoshop)中的图像: Chrome(和
java - JAXB 解码
是否可以在不知道它的类型( JAXBContext.newInstance(clazz) )的情况下解码一个类，或者什么是测试即将到来的正确方法？我确实收到了从纯文本中解码的消息 - 字符串传入的
OpenSSL Base64 解码
我正在尝试使用 openSSL 库进行 Base64 解码，然后使用 CMS 来验证签名。下面的代码总是将缓冲区打印为 NULL。 char signed_data[] = "MIIO"; int
iphone - 如何对选择器的引用进行编码/解码？
我有一个带有 SEL 类型实例变量的类，它是对选择器的引用。在encodeWithCoder/initWithCoder中，如何编码/解码这种类型的变量？最佳答案您可以使用 NSStringFro
javascript - 解码 ReadableByteStreams
var url = 'http://www.googleapis.com/customsearch/v1?q=foo&searchType=image'; window.fetch(url) .t
android - 在Android中支持对视频文件进行编码/解码
我想知道Android 2.2、2.3和3,4支持的音频/视频格式列表。我也想知道哪些Android版本支持视频编码和解码。我经历了this link，但是关于编码和解码我并不清楚。任何人的回答都是
Encog One Of - 解码
我在其中一个项目中使用 Encog，但在解码 One-Of 类时遇到了困难。该字段的规范化操作之一是 NormalizationAction.OneOf，它具有三个输出。当我评估时，我想解码预测值。如
java - 解码 XML
我正在尝试解码现有的 xml 文件，以便我可以正确处理数据，但 XML 结构看起来很奇怪。下面是 xml 示例以及我创建的对象。 11 266 AA1001 1
Unicode URL 解码
对 unicode 字符进行 URL 编码的常用方法是将其拆分为 2 %HH 代码。 (\u4161 => %41%61) 但是，unicode在解码时是如何区分的呢？您如何知道 %41%61 是 \
Java 解码 JSON
我正在尝试将 json 字符串解码为 Map。我知道有很多这样的问题，但我需要非常具体的格式。例如，我有 json 字符串: { "map": { "a": "b",
SQL 解码 - 选择和位置
我有一个查询，我认为需要像这样(解码会更大) SELECT firstName, lastName, decode(mathMrk, 80, 'A', mathMrk) as decodeMat
PHP 仅对数字和字符进行字符串编码/解码
我知道PHP函数encode()和decode()，它们对我来说工作得很好，但我想在url中传递编码字符串，但encode确实返回特殊字符，如“=”、“”' “等等...... 这显然会破坏我的脚本，
Java - Base64 解码
我必须解码 Basic bW9uTG9naW46bW9uTW90RGVQYXNz 形式的 http 请求的授权 header 当我解码它时online ，我得到了正确的结果 monLogin:monM
java - 哪个Java库提供base64编码/解码？
这个问题已经有答案了: Decode Base64 data in Java (21 个回答) 已关闭 8 年前。我想知道使用哪个库进行 Base64 编码/解码？我需要此功能足够稳定以供生产使用。
java - 解码 [] 字节我只得到字符��
我正在尝试从 Arduino BT 解码 []byte，我的连接完美，问题是当我尝试解码数组时。我得到的只是这个字符�(发送的字节数相同)我认为问题出在解码上。我尝试使用 ASCII 字符集，但仍然存

首页

博学

6Ren·AI

商城

详解Python解决抓取内容乱码问题（decode和encode解码）