Perl:utf8::decode 与 Encode::decode-6ren

Perl:utf8::decode 与 Encode::decode

转载作者：行者123 更新时间：2023-12-04 12:14:05

27

4

我得到了一些有趣的结果，试图辨别使用 Encode::decode("utf8", $var) 之间的区别。和 utf8::decode($var) .我已经发现，在一个变量上多次调用前者最终会导致错误“无法在...处解码带有宽字符的字符串”，而后一种方法会很高兴地运行任意多次，只是返回 false。

我无法理解的是 length函数根据您用于解码的方法返回不同的结果。出现问题是因为我正在处理来自外部文件的“双重编码”utf8 文本。为了演示这个问题，我创建了一个文本文件“test.txt”，其中一行包含以下 Unicode 字符:U+00e8、U+00ab、U+0086、U+000a。这些 Unicode 字符是 Unicode 字符 U+8acb 和换行符的双重编码。该文件以 UTF8 编码到磁盘。然后我运行以下 perl 脚本:

#!/usr/bin/perl                                                                                                                                          
use strict;
use warnings;
require "Encode.pm";
require "utf8.pm";

open FILE, "test.txt" or die $!;
my @lines = <FILE>;
my $test =  $lines[0];

print "Length: " . (length $test) . "\n";
print "utf8 flag: " . utf8::is_utf8($test) . "\n";
my @unicode = (unpack('U*', $test));
print "Unicode:\n@unicode\n";
my @hex = (unpack('H*', $test));
print "Hex:\n@hex\n";

print "==============\n";

$test = Encode::decode("utf8", $test);
print "Length: " . (length $test) . "\n";
print "utf8 flag: " . utf8::is_utf8($test) . "\n";
@unicode = (unpack('U*', $test));
print "Unicode:\n@unicode\n";
@hex = (unpack('H*', $test));
print "Hex:\n@hex\n";

print "==============\n";

$test = Encode::decode("utf8", $test);
print "Length: " . (length $test) . "\n";
print "utf8 flag: " . utf8::is_utf8($test) . "\n";
@unicode = (unpack('U*', $test));
print "Unicode:\n@unicode\n";
@hex = (unpack('H*', $test));

print "Hex:\n@hex\n";

这给出了以下输出:

长度:7
utf8 标志:
统一码:
195 168 194 171 194 139 10
十六进制:
c3a8c2abc28b0a
===============
长度:4
UTF8 标志:1
统一码:
232 171 139 10
十六进制:
c3a8c2abc28b0a
===============
长度:2
UTF8 标志:1
统一码:
35531 10
十六进制:
e8ab8b0a

这是我所期望的。长度原来是 7，因为 perl 认为 $test 只是一系列字节。解码一次后，perl 知道 $test 是一系列 utf8 编码的字符(即 perl 不是返回 7 个字节的长度，而是返回 4 个字符的长度，即使 $test 在内存中仍然是 7 个字节)。在第二次解码之后， $test 包含解释为 2 个字符的 4 个字节，这是我所期望的，因为 Encode::decode 采用 4 个代码点并将它们解释为 utf8 编码的字节，从而产生 2 个字符。奇怪的是，当我修改代码以调用 utf8::decode 时(将所有 $test = Encode::decode("utf8", $test); 替换为 utf8::decode($test))

这给出了几乎相同的输出，只是长度的结果不同:

长度:7
utf8 标志:
统一码:
195 168 194 171 194 139 10
十六进制:
c3a8c2abc28b0a
===============
长度:4
UTF8 标志:1
统一码:
232 171 139 10
十六进制:
c3a8c2abc28b0a
===============
长度:4
UTF8 标志:1
统一码:
35531 10
十六进制:
e8ab8b0a

似乎 perl 在解码之前首先计算字节数(如预期的那样)，然后在第一次解码后计算字符数，然后在第二次解码后再次计算字节数(不是预期的)。为什么会发生这种转变？我对这些解码功能如何工作的理解有偏差吗？

谢谢，马特

最佳答案

您不应该使用 utf8 中的函数语用模块。 Its documentation这么说:

Do not use this pragma for anything else than telling Perl that your script is written in UTF-8.

Always use the Encode module ，另见问题 Checklist for going the Unicode way with Perl . unpack太低级了，它甚至没有给你错误检查。

您错误地假设八进制 E8 AB 86 0A是 UTF-8 的结果双编码 字符 諆和 newline .这是 的表示单 UTF-8 编码 这些字符中。也许你身边的整个困惑源于那个错误。
length被不恰本地重载，在某些时候它决定了字符的长度，或者八位字节的长度。使用更好的工具，例如 Devel::Peek .

#!/usr/bin/env perl
use strict;
use warnings FATAL => 'all';
use Devel::Peek qw(Dump);
use Encode qw(decode);

my $test = "\x{00e8}\x{00ab}\x{0086}\x{000a}";
# or read the octets without implicit decoding from a file, does not matter

Dump $test;
#  FLAGS = (PADMY,POK,pPOK)
#  PV = 0x8d8520 "\350\253\206\n"\0

$test = decode('UTF-8', $test, Encode::FB_CROAK);
Dump $test;
#  FLAGS = (PADMY,POK,pPOK,UTF8)
#  PV = 0xc02850 "\350\253\206\n"\0 [UTF8 "\x{8ac6}\n"]

关于Perl:utf8::decode 与 Encode::decode，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/4339377/

27

4

0

文章推荐： .net - 我可以在 4.0 应用程序中引用 .NET 3.5 .DLL 吗？

文章推荐： C程序将空格分隔的输入字符串转换为int数组

文章推荐： silverlight - Silverlight 的类似 Firebug 的免费工具

encoding - 理论: "Lexical Encoding"
我使用术语“词法编码”是因为我没有更好的编码。与字母相反，单词可以说是交流的基本单位。 Unicode 尝试为所有已知字母表的每个字母分配一个数值。对一种语言来说是字母，对另一种语言来说是字形。 U
encoding - 如何 “save with encoding”
我在UTF-8中有csv文件，我想将其保存在西里尔字母(Windows 1251)中...在中，我仅找到Atom -重新打开，并使用ctrl+shift+u编码在 Sublime Text 3 中，
encoding - "encoding-agnostic"的定义是什么？
在lua 5.3引用手册中，我们可以看到: Lua is also encoding-agnostic; it makes no assumptions about the contents of a
encoding - 变化 : Accept-Encoding overkill?
看完后how gzip compression works它让我思考。如果源和代理服务器 (CDN) 都支持 gzip，则添加 Vary: Accept-Encoding头需要吗？最佳答案 Vary
encoding - URL缩短: What's the best encoding to use?
我正在向我的项目添加一项功能，我们将生成指向我们网站内部内容的链接，并且我们希望这些链接尽可能短，因此我们将制作自己的“URL 缩短器”。我想知道生成的短网址的最佳编码/字母表是什么。这很大程度上是
encoding - HTTP Accept-Encoding 并发送未编码的数据
我构建了一个用于压缩 HTTP 输出的模块。阅读spec ，我在以下几件事上没有发现明显的区别: 接受编码: 是否应将其视为与 Accept-Encoding: * 相同，还是视为不存在 header
json.Marshal 与 Encoder.Encode
在下面的代码中: package main import ( "bytes" "encoding/json" "fmt" ) type Student struct {
perl - Encode::encode 是否修改/删除原始字符串？
这个问题在这里已经有了答案: Why does encode delete the argument? (1 个回答) 6年前关闭。 Encode::encode 的文档说: encode $octe
encode - 安卓媒体编解码器 : how to request a key frame when encoding
在Android4.1中，实时编码应用中经常会请求关键帧。但是如何使用 MediaCodec 对象呢？当前的 Android4.2 SDK 似乎不支持它。最佳答案您可以通过在排队输入缓冲区时指定
character-encoding - 如何解码乱码编码: Special Character Encoding
我有 CSV 格式的数据，这些数据在字符编码方面被严重打乱，可能在不同的软件应用程序(LibreOffice Calc、Microsoft、Excel、Google Refine、自定义 PHP/My
perl - 使用 Encode::encode 和 "utf8"
您可能知道，在 Perl 中，“utf8”意味着 Perl 对 UTF-8 的宽松理解，它允许使用技术上不是 UTF-8 中有效代码点的字符。相比之下，“UTF-8”(或“utf-8”)是 Perl
org.geotools.ysld.encode.YsldEncoder.encode()方法的使用及代码示例
本文整理了Java中org.geotools.ysld.encode.YsldEncoder.encode()方法的一些代码示例，展示了YsldEncoder.encode()的具体用法。这些代码示例
encoding - 访问错误: invalid UTF-8 encoding ${FFD8FFE0}
现在还没有任何关于红色的书，因为它太新了。因此，我正在尝试遵循一本旧的 Rebol 书，并从中挽救我能得到的东西。我发现一些命令，例如 read，由于文件编码的原因，我无法执行代码。 save %
encoding - 错误: unmappable character for encoding UTF-8
错误:无法映射用于编码 UTF-8 的字符。由于版权特征，我收到此错误。我使用的是 Netbeans 7.2。 /** * � 2006 * * This class was generate
encoding - 访问错误: invalid UTF-8 encoding ${FFD8FFE0}
现在还没有任何关于红色的书，因为它太新了。因此，我正在尝试遵循一本旧的 Rebol 书，并从中挽救我能得到的东西。我发现一些命令，例如 read，由于文件编码的原因，我无法执行代码。 save %
encoding - 错误: unmappable character for encoding UTF-8
错误:无法映射用于编码 UTF-8 的字符。由于版权特征，我收到此错误。我使用的是 Netbeans 7.2。 /** * � 2006 * * This class was generate
Java Base64 Encode 函数和PHP Base64 Encode 函数一样吗？
我正在尝试使用客户端提供的值在 PHP 中测试 Soap Security header 。他们提供的值(value)如... wTAmCL9tmg6KNpeAQOYubw== ...并说这是一个
java.lang.ClassNotFoundException : org. owasp.encoder.Encode
这个问题已经有答案了: ClassNotFoundException/NoClassDefFoundError in my Java web application (3 个回答) 已关闭 8 年前。
http - Encoding.ASCII VS Encoding.UTF8 错误
世界!我正在使用 .Net Framework 4 System.Net.Sockets.TcpClient 编写简单的 HTML 服务器。我在 StringBuilder html 中有 HTML
php - SOAP 错误 : Encoding: Violation of encoding rules?
我正在尝试使用 Yii 来提供网络服务。自动生成的 wsdl 如下。我可以从命令行成功使用 Web 服务，但是通过 Web 浏览器，我得到了 SOAP-ERROR: Encoding: Violati

首页

博学

6Ren·AI

商城

Perl:utf8::decode 与 Encode::decode