gpt4 book ai didi

php - 如何获取 utf-8 字符串中给定字符的代码点编号?

转载 作者:搜寻专家 更新时间:2023-10-31 22:14:56 27 4
gpt4 key购买 nike

我想获取给定 UTF-8 字符串的 UCS-2 代码点。例如“你好”这个词应该变成像“0068 0065 006C 006C 006F”这样的东西。请注意,字符可以来自任何语言,包括东亚语言等复杂脚本。

因此,问题归结为“将给定字符转换为其 UCS-2 代码点”

但是怎么办?拜托,任何形式的帮助都将非常非常感谢,因为我很赶时间。


作为答案发布的提问者回复的转录

感谢您的回复,但需要在 PHP v 4 或 5 而不是 6 中完成。

该字符串将是来自表单字段的用户输入。

我想实现 utf8to16 或 utf8decode 之类的 PHP 版本

function get_ucs2_codepoint($char)
{
// calculation of ucs2 codepoint value and assign it to $hex_codepoint
return $hex_codepoint;
}

你能帮我用 PHP 还是用上面提到的版本的 PHP 来完成?

最佳答案

使用现有的实用程序,例如 iconv ,或您正在使用的语言附带的任何库。

如果您坚持推出自己的解决方案,请阅读 UTF-8格式。基本上,每个代码点存储为 1-4 个字节,具体取决于代码点的值。范围如下:

  • U+0000 — U+007F: 1 字节: 0xxxxxxx
  • U+0080 — U+07FF:2 个字节:110xxxxx 10xxxxxx
  • U+0800 — U+FFFF:3 个字节:1110xxxx 10xxxxxx 10xxxxxx
  • U+10000 — U+10FFFF:4字节:11110xxx 10xxxxxx 10xxxxxx 10xxxxxx

其中每个 x 是一个数据位。因此,您可以通过查看第一个字节来判断每个代码点由多少字节组成:如果它以 0 开头,则它是一个 1 字节的字符。如果它以 110 开头,则它是一个 2 字节的字符。如果它以 1110 开头,则它是一个 3 字节的字符。如果以 11110 开头,则为 4 字节字符。如果它以 10 开头,则它是多字节字符的非初始字节。如果以 11111 开头,则为无效字符。

一旦你弄清楚了字符中有多少字节,这只是一个小问题。另请注意,UCS-2 不能表示 U+FFFF 以上的字符。

由于您没有指定语言,这里有一些示例 C 代码(省略了错误检查):

wchar_t utf8_char_to_ucs2(const unsigned char *utf8)
{
if(!(utf8[0] & 0x80)) // 0xxxxxxx
return (wchar_t)utf8[0];
else if((utf8[0] & 0xE0) == 0xC0) // 110xxxxx
return (wchar_t)(((utf8[0] & 0x1F) << 6) | (utf8[1] & 0x3F));
else if((utf8[0] & 0xF0) == 0xE0) // 1110xxxx
return (wchar_t)(((utf8[0] & 0x0F) << 12) | ((utf8[1] & 0x3F) << 6) | (utf8[2] & 0x3F));
else
return ERROR; // uh-oh, UCS-2 can't handle code points this high
}

关于php - 如何获取 utf-8 字符串中给定字符的代码点编号?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/7636885/

27 4 0
Copyright 2021 - 2024 cfsdn All Rights Reserved 蜀ICP备2022000587号
广告合作:1813099741@qq.com 6ren.com