gpt4 book ai didi

android - 如何使用 perl 存储和显示 ISO-8859-1 和 UTF8 字符

转载 作者:可可西里 更新时间:2023-11-01 07:57:17 25 4
gpt4 key购买 nike

我对此很陌生,这对大多数人来说可能很容易,但我已经为此苦苦挣扎了好几天。

我正在使用 perl 编写网络爬虫,网络爬虫将使用 LWP 和一些简单的正则表达式提取某些信息。

这些信息保存在mySQL数据库中,将在android设备上使用。然而,当我测试网络爬虫时,我发现一些信息是使用 HTML 数字编码(#20856 ; 華 ;)的中文(典华),而一些信息使用 iso-8859-1 编码(Zhífú)。我使用PERL HTML::Entities库解决了中文部分,当我将控制台设置为utf8时可以显示。但是,其他字母(Zhífú)只能在iso-8859-1 中显示。如果我尝试用 utf8 显示它,它将变成 Zh�f�。我的问题是:

  1. 如何确定它使用哪种编码,以及如何以不同方式显示它?
  2. 能不能直接存到mySQL里,还是先把信息处理一下(说错了请指正,我的理解是mySQL默认语言是utf8)。
  3. 当我在 Android 设备上显示它时,这会导致某种问题吗?

非常感谢。

最佳答案

(Zhífú) can only be displayed in iso-8859-1. If I try to display it in utf8, it will become Zh�f�.

这完全是错误的。您可以在 iso-8859-1 和 UTF-8 终端/应用程序/任何内容中显示“Zhífú”。事实上,你看到“Zhífú”就证明它可以用UTF-8显示,因为这是一个UTF-8的网页。如果您收到“Zh�f�”,那是因为您在将字符串提供给终端/应用程序/任何需要 UTF-8 的内容之前没有使用 UTF-8 对字符串进行编码。

总之,进入正题。我假设您存储的是文本,而不是 HTML。

解码每一个输入!编码每个输出!那么没问题。

         From the web
5a 68 c3 ad 66 c3 ba
|
decode Done for you by ->decoded_content (LWP::UA)
| or by ->content (WWW::Mech)
v

Decoded text Manipulate as desired
Zhífú

|
encode Done for you by DBI
|
v
Database
5a 68 c3 83 c2 ad 66 c3 83 c2 ba

事实上,->decoded_content 应该已经为您完成了解码,DBI 应该已经为您完成了编码,所以我不明白您为什么遇到麻烦有了这个。

当您从数据库中读取数据并输出到屏幕上时也是如此。

5a 68 c3 83 c2 ad 66 c3 83 c2 ba
Database
|
decode Done for you by DBI if you use
| the ..._utf8 flag for your driver
v

Decoded text Manipulate as desired
Zhífú

|
encode use open ':std', ':locale';
|
v
Screen
5a 68 c3 83 c2 ad 66 c3 83 c2 ba

关于android - 如何使用 perl 存储和显示 ISO-8859-1 和 UTF8 字符,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/7358714/

25 4 0
Copyright 2021 - 2024 cfsdn All Rights Reserved 蜀ICP备2022000587号
广告合作:1813099741@qq.com 6ren.com