url-encoding - python url unquote后跟unicode解码-6ren

url-encoding - python url unquote后跟unicode解码

转载作者：行者123 更新时间：2023-12-04 00:02:36

26

4

我有一个 unicode 字符串，如 '%C3%A7%C3%B6asd+fjkls%25asd'我想解码这个字符串。
我用过 urllib.unquote_plus(str)但它工作错了。

预期:çöasd+fjkls%asd

结果:Ã§Ã¶asd fjkls%asd

双编码 utf-8 字符( %C3%A7 和 %C3%B6 )解码错误。
我的 python 版本是 Linux 发行版下的 2.7。
获得预期结果的最佳方法是什么？

最佳答案

您有 3 或 4 或 5 个问题……但是 repr()和 unicodedata.name()是你的 friend 吗？它们明确地向您展示您所获得的内容，而不会因使用不同控制台编码的人传达 print fubar 的结果而产生混淆。 .

总结:要么 (a) 您从一个 unicode 对象开始并对其应用 unquote 函数，要么 (b) 您从一个 str 对象开始并且您的控制台编码不是 UTF-8。

如果如您所说，您从一个 unicode 对象开始:

>>> s0 = u'%C3%A7%C3%B6asd+fjkls%25asd'
>>> print repr(s0)
u'%C3%A7%C3%B6asd+fjkls%25asd'

这是一个偶然的废话。如果您申请 urllibX.unquote_YYYY()对此，您会得到另一个无意义的 unicode 对象( u'\xc3\xa7\xc3\xb6asd+fjkls%asd' )，打印时会导致您显示的症状。您应该立即将原始 unicode 对象转换为 str 对象:

>>> s1 = s0.encode('ascii')
>>> print repr(s1)
'%C3%A7%C3%B6asd+fjkls%25asd'

那么你应该取消引用它:

>>> import urllib2
>>> s2 = urllib2.unquote(s1)
>>> print repr(s2)
'\xc3\xa7\xc3\xb6asd+fjkls%asd'

查看它的前 4 个字节，它是用 UTF-8 编码的。如果你这样做 print s2 ，如果您的控制台需要 UTF-8，它看起来没问题，但如果它需要 ISO-8859-1(又名 latin1)，您将看到有症状的垃圾(第一个字符将是 A-波浪号)。让我们暂时停止这个想法并将其转换为 Unicode 对象:

>>> s3 = s2.decode('utf8')
>>> print repr(s3)
u'\xe7\xf6asd+fjkls%asd'

并检查它以查看我们实际得到了什么:

>>> import unicodedata
>>> for c in s3[:6]:
...     print repr(c), unicodedata.name(c)
...
u'\xe7' LATIN SMALL LETTER C WITH CEDILLA
u'\xf6' LATIN SMALL LETTER O WITH DIAERESIS
u'a' LATIN SMALL LETTER A
u's' LATIN SMALL LETTER S
u'd' LATIN SMALL LETTER D
u'+' PLUS SIGN

看起来像你说的你期望的那样。现在我们来解决在您的控制台上显示它的问题。注意:当你看到“cp850”时不要 panic ；我正在便携地执行此操作，并且恰好在 Windows 上的命令提示符中执行此操作。

>>> import sys
>>> sys.stdout.encoding
'cp850'
>>> print s3
çöasd+fjkls%asd

注意:unicode 对象是使用 sys.stdout.encoding 显式编码的。幸运的是 s3 中的所有 unicode 字符可以在该编码中表示(以及 cp1252 和 latin1)。

关于url-encoding - python url unquote后跟unicode解码，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/5139249/

26

4

0

文章推荐： authorization - 使用 cancan 防止访问 Controller

文章推荐： jsp - 在 JSTL EL 中获取当前日期并对其进行算术运算

encoding - 理论: "Lexical Encoding"
我使用术语“词法编码”是因为我没有更好的编码。与字母相反，单词可以说是交流的基本单位。 Unicode 尝试为所有已知字母表的每个字母分配一个数值。对一种语言来说是字母，对另一种语言来说是字形。 U
encoding - 如何 “save with encoding”
我在UTF-8中有csv文件，我想将其保存在西里尔字母(Windows 1251)中...在中，我仅找到Atom -重新打开，并使用ctrl+shift+u编码在 Sublime Text 3 中，
encoding - "encoding-agnostic"的定义是什么？
在lua 5.3引用手册中，我们可以看到: Lua is also encoding-agnostic; it makes no assumptions about the contents of a
encoding - 变化 : Accept-Encoding overkill?
看完后how gzip compression works它让我思考。如果源和代理服务器 (CDN) 都支持 gzip，则添加 Vary: Accept-Encoding头需要吗？最佳答案 Vary
encoding - URL缩短: What's the best encoding to use?
我正在向我的项目添加一项功能，我们将生成指向我们网站内部内容的链接，并且我们希望这些链接尽可能短，因此我们将制作自己的“URL 缩短器”。我想知道生成的短网址的最佳编码/字母表是什么。这很大程度上是
encoding - HTTP Accept-Encoding 并发送未编码的数据
我构建了一个用于压缩 HTTP 输出的模块。阅读spec ，我在以下几件事上没有发现明显的区别: 接受编码: 是否应将其视为与 Accept-Encoding: * 相同，还是视为不存在 header
json.Marshal 与 Encoder.Encode
在下面的代码中: package main import ( "bytes" "encoding/json" "fmt" ) type Student struct {
perl - Encode::encode 是否修改/删除原始字符串？
这个问题在这里已经有了答案: Why does encode delete the argument? (1 个回答) 6年前关闭。 Encode::encode 的文档说: encode $octe
encode - 安卓媒体编解码器 : how to request a key frame when encoding
在Android4.1中，实时编码应用中经常会请求关键帧。但是如何使用 MediaCodec 对象呢？当前的 Android4.2 SDK 似乎不支持它。最佳答案您可以通过在排队输入缓冲区时指定
character-encoding - 如何解码乱码编码: Special Character Encoding
我有 CSV 格式的数据，这些数据在字符编码方面被严重打乱，可能在不同的软件应用程序(LibreOffice Calc、Microsoft、Excel、Google Refine、自定义 PHP/My
perl - 使用 Encode::encode 和 "utf8"
您可能知道，在 Perl 中，“utf8”意味着 Perl 对 UTF-8 的宽松理解，它允许使用技术上不是 UTF-8 中有效代码点的字符。相比之下，“UTF-8”(或“utf-8”)是 Perl
org.geotools.ysld.encode.YsldEncoder.encode()方法的使用及代码示例
本文整理了Java中org.geotools.ysld.encode.YsldEncoder.encode()方法的一些代码示例，展示了YsldEncoder.encode()的具体用法。这些代码示例
encoding - 访问错误: invalid UTF-8 encoding ${FFD8FFE0}
现在还没有任何关于红色的书，因为它太新了。因此，我正在尝试遵循一本旧的 Rebol 书，并从中挽救我能得到的东西。我发现一些命令，例如 read，由于文件编码的原因，我无法执行代码。 save %
encoding - 错误: unmappable character for encoding UTF-8
错误:无法映射用于编码 UTF-8 的字符。由于版权特征，我收到此错误。我使用的是 Netbeans 7.2。 /** * � 2006 * * This class was generate
encoding - 访问错误: invalid UTF-8 encoding ${FFD8FFE0}
现在还没有任何关于红色的书，因为它太新了。因此，我正在尝试遵循一本旧的 Rebol 书，并从中挽救我能得到的东西。我发现一些命令，例如 read，由于文件编码的原因，我无法执行代码。 save %
encoding - 错误: unmappable character for encoding UTF-8
错误:无法映射用于编码 UTF-8 的字符。由于版权特征，我收到此错误。我使用的是 Netbeans 7.2。 /** * � 2006 * * This class was generate
Java Base64 Encode 函数和PHP Base64 Encode 函数一样吗？
我正在尝试使用客户端提供的值在 PHP 中测试 Soap Security header 。他们提供的值(value)如... wTAmCL9tmg6KNpeAQOYubw== ...并说这是一个
java.lang.ClassNotFoundException : org. owasp.encoder.Encode
这个问题已经有答案了: ClassNotFoundException/NoClassDefFoundError in my Java web application (3 个回答) 已关闭 8 年前。
http - Encoding.ASCII VS Encoding.UTF8 错误
世界!我正在使用 .Net Framework 4 System.Net.Sockets.TcpClient 编写简单的 HTML 服务器。我在 StringBuilder html 中有 HTML
php - SOAP 错误 : Encoding: Violation of encoding rules?
我正在尝试使用 Yii 来提供网络服务。自动生成的 wsdl 如下。我可以从命令行成功使用 Web 服务，但是通过 Web 浏览器，我得到了 SOAP-ERROR: Encoding: Violati

首页

博学

6Ren·AI

商城

url-encoding - python url unquote后跟unicode解码