mysql - MySQL中的unicode字段在哪里出错？-6ren

mysql - MySQL中的unicode字段在哪里出错？

转载作者：行者123 更新时间：2023-11-29 01:34:20

24

4

我的MySQL数据库中有一个包含字符串的字段表。
MySQL版本是5.0.51a。表的默认字符集是“utf8”。
许多字符串都有unicode字符，如\xae和\u21222（分别是注册符号和商标符号）。
例如，假设我有一行的字段值为：

"Bing® Blang™ Blaow"

mysql命令行客户机的默认字符集是“latin1”。
如果我从命令行在mysql客户机程序中发出一个SELECT语句，而不指定字符集，则标题的输出如下所示：

"Bing® Blang Blaow"

（R）符号正确，但（TM）符号丢失。如果我将这个字符串从控制台剪切并粘贴到TextMate中，就会出现（TM）符号，但它位于单词“Blang”中g的中间位置。
我认为g的后半部分只是TextMate中的一个显示错误（尽管如果有人能提供更多的细节那就太好了，但这并不是真正重要的部分）。
在剪切和粘贴行为之后，我从its-there推断出的主要问题是数据在数据库中，但是某些字符集设置有问题。
如果我在命令行中重写mysql客户机的默认编码，如下所示：

mysql --default-character-set=utf8

然后执行相同的选择，字符串将显示为：

"BingÂ® BlangÂ™ Blaow"

也就是说，（R）和（TM）符号都出现在正确的位置，但都前面是unicode字符xae，它是一个A，顶部有一个扬抑符。
（顺便说一下，当我使用python将数据提取出来并显示在web页面上时，数据也是这样显示的，这就是我真正的问题所在）。
不管怎样，这是怎么回事？我们最近所做的一切都尽可能地使用了UTF8，但其中一些行可能是在更改之前插入的，这意味着它们将使用latin1默认值。。。然而，这两种编码似乎都不能产生正确的结果？
如果在切换到utf8之前，当表上的默认编码是latin1时插入了行，那么编码被切换（通过alter table..），那么编码实际上是否已经更新？其中一个编码现在应该工作了吗？unicode会不会不再踢我的屁股？

最佳答案

这里有很多问题：
关于角色
表示文本包含字符U+AE和U+2122（分别为？和？）。然而，结果暗示文本中有U+99作为“Blang”之后的字符：当您将MySQL设置为输出UTF8时，您会看到这个“the™”--这是U+99的UTF8序列，显示在将这个字节流解释为Windows-1252的终端上。
U+99可能不是您想要的：在Unicode中，这是一个没有图形表示的扩展控制字符。恰好在Windows-1252中，0x99是商标符号（U+2122）的编码。
（请注意，当您选择Latin1时，MySQL和大多数web浏览器都有使用Windows-1252的常见“坏”行为。叹气。）
可能是什么问题
你的终端没有在正确的字符集中运行。它显然是在Windows-1252中运行的。
程序应该用UTF-8连接到数据库。如您所发现的，您可以在命令行中执行该操作，或者在执行其他操作之前在数据库句柄中执行SET NAMES utf8_general_ci;语句。一些其他的数据库api可能有其他的方法来实现这一点，但是对于所有的SQL引擎没有通用的方法。SET NAMES ...是MySQL特有的，但设置了所有必需的字符集变量（共有三个！）马上。
将数据插入数据库的进程正在接受用户输入，但在插入之前无法将其从Windows-1252正确转换为UTF-8。这就是你把U+99输入数据库的方法。因为我不知道你是怎么得到这些数据的，所以我不知道该修复什么，但是有几种可能性：
如果数据来自网页表单，请确保表单所在的页面以UTF-8格式提供服务，并正确标记为UTF-8格式（通过MIME类型和<meta>标记）。此外，请确保<form>标记没有指定不同的字符集。
转换数据时，请确保使用iconv或类似的库将输入字符集转换为UTF-8。即使您认为输入是拉丁语1，也不要尝试手动执行此操作（例如，将每个字节零扩展为16位，然后声明这是UTF-16，这对Windwos-1252不起作用！）。请绝对确保您知道源数据的字符集。特别是，一定要知道它是Latin1还是Windows-1252。
不用转换用户输入，您可以在用户输入的字符集中连接到数据库，然后插入从用户获得的原始字节数据。但是，您必须确保仅以这种方式执行插入：如果其他行的数据不能在该字符集中表示，则从具有用户有效字符集的数据中读取数据将丢失信息。可以设置MySQL连接，以便在一个字符集中发出语句并在另一个字符集中读取结果。。。但这并不是为胆小的人准备的，未来的程序员可能会疯狂地试图理解代码为什么会这样做。
如果，当您使用Python拉出数据并将其显示在web页面中时，您看到了字符串“then”，那么这表示您将数据正确地作为UTF-8从数据库中拉出，但随后将其放入一个未正确标识为UTF-8的web页面中。可能它只是默认为Latin1，正如上面提到的，它将真正是Windows-1252。
尽管如此，即使修复了显示，也要注意数据库中有错误的数据，因为U+99实际上不是UTF-8列中的商标符号。如果数据是Windows-1252，则需要通过读取所有数据并将U+80到U+9F范围内的任何字符替换为它们可能是的字符来清理数据。如果您不确定数据最初的字符集是什么——那么这些数据只是垃圾。
关于更改表的字符集
在插入数据后转换字符集和表的排序规则将转换列，但是，当然，任何已经插入的数据都已经丢失了原始字符集不能表示的任何字符。
请注意ALTER TABLE foo CONVERT TO CHARACTER SET ...和ALTER TABLE foo CHARACTER SET ...之间的区别，后者只更改表的默认字符集，并且不会更改任何列，即使它们在创建时设置为默认值。（MySQL只在列创建时使用默认值，它不记得给定的列是“默认”的，而不是保持与表的默认值同步。）

关于mysql - MySQL中的unicode字段在哪里出错？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/1242471/

24

4

0

文章推荐： php - 通过 jQuery Ajax 传递 PHP 数组

文章推荐： ios - AVPlayer seekToTime 方法在 iOS 9 上停止工作

文章推荐： sql - INSERT INTO..SELECT..ON DUPLICATE KEYS 不明确的 id

mysql修改记录时update操作字段=字段+字符串
在有些场景下，我们需要对我们的varchar类型的字段做修改，而修改的结果为两个字段的拼接或者一个字段+字符串的拼接。如下所示，我们希望将xx_role表中的name修改为name+id。
MySQL SUM IF 字段 b = 字段 a
SELECT incMonth as Month, SUM( IF(item_type IN('typ1', 'typ2') AND incMonth = Month, 1, 0 ) )AS
java - 如果直接从内存读取 volatile 字段，那么从哪里读取非 volatile 字段？
我最近读到 volatile 字段是线程安全的，因为 When we use volatile keyword with a variable, all the threads read its va
python - 在数据库中已有数据之后添加的 UUID 字段。有没有办法为现有数据填充 UUID 字段？
我在一些模型中添加了一个 UUID 字段，然后使用 South 进行了迁移。我创建的任何新对象都正确填充了 UUID 字段。但是，我所有旧数据的 UUID 字段为空。有没有办法为现有数据填充 UUI
php - 左连接中的两个表都有 id 字段。尝试从第一个数据库中提取 id 字段，但获取第二个数据库
刚刚将我的网站从 mysql_ 更新为 mysqli，并破坏了之前正常运行的查询。我试图从旋转中提取 id，因为它每次都会增加 1，但我不断获取玩家 id，有人可以告诉我我做错了什么吗？我尝试了将
mysql - 如何使用 MySQL 将一个表中的一列(字段)复制到另一个表的空列(字段)，这两个表都是同一数据库的一部分？
我在 Mac OS X 上使用带有 Sequel Pro 的 MySQL。我想将一个表中的一个字段(即名为“GAME_DY”的列)复制到另一个名为“DAY_ID”的表的空字段中。两个表都是同一数据库的
java - 为序列化设置一个 transient 字段，但为 JPA 设置非 transient 字段
问题: 是否有可能有一个字段被 JPA 保留但被序列化跳过？可以实现相反的效果(JPA 跳过字段而序列化则不会)，如果使用此功能，那么相反的操作肯定会很有用。类似这样的事情: @Entity cl
php - 无重复(分组依据)字段 1 循环，字段 2 位于水平线
假设我有一个名为“dp”的表 Year | Month | Payment| Payer_ID | Payment_Recipient | 2008/2009 | July
c - 我在 IP header 中找不到 DSCP 字段，只有已弃用的 TOS 字段
我将尝试通过我的 Raspberry Pi 接入点保证一些 QoS。开始之前，我先动手:我阅读了有关 tcp、udp 和 ip header 的内容。在IP header description我看
dart - 什么时候应该在 dart 中使用 final 字段、工厂构造函数或带有 getter 的私有(private)字段？
如果你能弄清楚如何重命名这个问题，我愿意接受建议。在 Dart 语言中，可以编写一个带有 final 字段的类。这些是只能设置的字段构造函数前 body 跑。这可以在声明中(通常用于类中的静态常量)
javascript - jquery:使用两个带有两个字段(字段 1、字段 2 + 1 天)的日期选择器，例如 booking.com
你怎么样？我有两个带有两个字段的日期选择器我希望当用户选择 (From) 时，第二个字段 (TO) 将是 next day 。比如 booking.com 例如:当用户选择From 01-01-2
mysql - 将字段从 T1 字段 A 复制到 T2 字段 A where(if or when) T1 field B = T2 field B (mysql)
我想我已经看到了这个问题的一些答案，这些答案可能与我需要的相差不远，但我对 mysql 的了解还不够确定，所以我会根据我的具体情况提出问题。我有一个包含多个表的数据库，为此，如果“image”表上的
mySQL在单个查询中多次使用相同的表/字段
我在 mySQL 数据库中有 2 个表: customers ============ customer_id (1, 2 ) customer_name (john, mark) orders ==
数据库归档与基于时间段的表/字段
我正在开发一个员工目标 Web 应用程序。领导/经理在与团队成员讨论后为他们设定目标。这是一年/半年/季度，具体取决于组织遵循的评估周期。现在的问题是添加基于时间段的字段或存档上一季度/年度数据的
Sitecore 字段，用于从媒体库中选择多个文件并能够上传文件
我正在寻找允许内容编辑器从媒体库中选择多个文件的东西，这些文件将在渲染中列出。他们还需要能够上传文件和搜索。它必须在页面编辑器(版本 8 中称为体验编辑器)中工作。到目前为止我所考虑的: 一堆文件字
r - 创建 "other"字段
现在，我有以下由 original.df %.% group_by(Category) %.% tally() %.% arrange(desc(n)) 创建的 data.frame。 DF 5),
潘塔霍。将登录的错误消息放入字符串/字段
我想知道是否有一些步骤/解决方案可以处理错误消息并将它们放入 Pentaho 工具中的某个字符串或字段中？例如，如果连接到数据库时发生某些错误，则将该消息从登录到字符串/字段。最佳答案我们在作业的
iPhone如何制作 "To"字段，如短信应用程序
如何制作像短信应用程序一样的“收件人”字段？例如，右侧有一个“+”按钮，当添加某人时，名称将突出显示并可单击，如圆角矩形等。有没有内置的框架？最佳答案不，但请参阅 Three20 的 TTMess
delphi - 列出记录的元素\字段
是否可以获取记录的元素或字段的列表通过类型信息类似于类的已发布属性的列表吗？谢谢！最佳答案取决于您的delphi版本，如果您使用的是delphi 2010或更高版本，则可以使用“新rtti”
带有外键列表的 SQLite 字段
我正在构建一个 SQLite 数据库来保存我的房地产经纪人的列表。我已经能够使用外键来识别每个代理的列表，但我想在每个代理的记录中创建一个列表；从代理商和列表之间的一对一关系转变为一对多关系。看这里

首页

博学

6Ren·AI

商城

mysql - MySQL中的unicode字段在哪里出错？