gpt4 book ai didi

java - 在 Java 中显示 UTF-8 表情符号

转载 作者:行者123 更新时间:2023-12-03 08:43:52 25 4
gpt4 key购买 nike

假设我有 😈(魔鬼)表情符号。

在 4 字节 UTF-8 中,它的表示方式如下:\u00f0\u009f\u0098\u0088

但是,在 Java 中,它只能正确打印,如下所示:\ud83d\ude08

如何从第一个转换为第二个?

更新2

MNEMO 的答案要简单得多,并且回答了我的问题,因此最好采用他的解决方案。

更新

感谢巴兹尔· boolean 克 (Basil Bourque) 的撰写。这非常有趣。

我在这里找到了一个很好的引用:https://github.com/pRizz/Unicode-Converter/blob/master/conversionfunctions.js (特别是convertUTF82Char()函数)。

对于将来路过这里的任何人来说,Java 中的情况如下:

public static String fromCharCode(int n) {
char c = (char)n;
return Character.toString(c);
}

public static String decToChar(int n) {
// converts a single string representing a decimal number to a character
// note that no checking is performed to ensure that this is just a hex number, eg. no spaces etc
// dec: string, the dec codepoint to be converted
String result = "";
if (n <= 0xFFFF) {
result += fromCharCode(n);
} else if (n <= 0x10FFFF) {
n -= 0x10000;
result += fromCharCode(0xD800 | (n >> 10)) + fromCharCode(0xDC00 | (n & 0x3FF));
} else {
result += "dec2char error: Code point out of range: " + decToHex(n);
}

return result;
}

public static String decToHex(int n) {
return Integer.toHexString(n).toUpperCase();
}

public static String convertUTF8_toChar(String str) {
// converts to characters a sequence of space-separated hex numbers representing bytes in utf8
// str: string, the sequence to be converted
var outputString = "";
var counter = 0;
var n = 0;

// remove leading and trailing spaces
str = str.replaceAll("/^\\s+/", "");
str = str.replaceAll("/\\s+$/", "");
if (str.length() == 0) {
return "";
}

str = str.replaceAll("/\\s+/g", " ");

var listArray = str.split(" ");
for (var i = 0; i < listArray.length; i++) {
int b = parseInt(listArray[i], 16); // alert('b:'+dec2hex(b));
switch (counter) {
case 0:
if (0 <= b && b <= 0x7F) { // 0xxxxxxx
outputString += decToChar(b);
} else if (0xC0 <= b && b <= 0xDF) { // 110xxxxx
counter = 1;
n = b & 0x1F;
} else if (0xE0 <= b && b <= 0xEF) { // 1110xxxx
counter = 2;
n = b & 0xF;
} else if (0xF0 <= b && b <= 0xF7) { // 11110xxx
counter = 3;
n = b & 0x7;
} else {
outputString += "convertUTF82Char: error1 " + decToHex(b) + "! ";
}
break;
case 1:
if (b < 0x80 || b > 0xBF) {
outputString += "convertUTF82Char: error2 " + decToHex(b) + "! ";
}
counter--;
outputString += decToChar((n << 6) | (b - 0x80));
n = 0;
break;
case 2:
case 3:
if (b < 0x80 || b > 0xBF) {
outputString += "convertUTF82Char: error3 " + decToHex(b) + "! ";
}
n = (n << 6) | (b - 0x80);
counter--;
break;
}
}

return outputString.replaceAll("/ $/", "");
}

几乎是买一赠一的副本,但它实现了我的目标。

最佳答案

SMILING FACE WITH HORNS字符 (😈) 被分配给 code point十进制 128,520 (1F608 hexadecimal ) 在 Unicode 中.

您可以选择如何用一系列 octets 来表示该数字。 。

  • UTF-8是使用 1-4 个八位字节以可变长度表示该数字的一种方法。
    • UTF-8 正在成为许多领域的主导编码。
    • 根据我的经验,Java 源代码文件通常以 UTF-8 编写,正如所讨论的 here .
  • UTF-16是另一种方式,也是可变长度的,但使用 2 个八位位组或 4 个八位位组。
    • Java 语言 uses UTF-16内部。
    • 正如 here 所讨论的,UTF-8 通常优于 UTF-16。 .

在大多数文本编辑器中,您只需将单个字符 😈 粘贴到源代码中即可。当写入 UTF-8 文件时,编辑器将创建必要的八位字节系列。

将此字符写入文本文件或以其他方式序列化为八位字节流时​​,您可以选择使用 UTF-8 或 UTF-16。请参阅:

以下是一些试验。您可以使用 hex editor 检查生成的文件。查看八位字节。

UTF-8

此代码生成一个 UTF-8 编码的文件。我们找到四个八位位组,十六进制值 F0 9F 98 88,十进制值 240 159 152 136。

您可以在 Oracle Java Tutorial 中找到讨论的代码。

注意我们如何为文件指定编码,StandardCharsets.UTF_8

Path file = Paths.get( "/Users/basilbourque/devil_utf-8.txt" );
Charset charset = StandardCharsets.UTF_8;
String s = "😈";
try ( BufferedWriter writer = Files.newBufferedWriter( file , charset ) )
{
writer.write( s , 0 , s.length() );
}
catch ( IOException e )
{
e.printStackTrace();
}

UTF-16

此代码生成一个 UTF-16 编码的文件。我们找到 6 个八位位组,其中 4 个八位位组代表我们的单个字符,加上 2 个八位位组的前缀 BOM (FEFF)。我们的四个八位位组的十进制数是 216 061 222 008,十六进制数是 D8 3D DE 08。

与上面相同的代码,但我们切换了 CharsetStandardCharsets.UTF_16

Path file = Paths.get( "/Users/basilbourque/devil_utf-16.txt" );
Charset charset = StandardCharsets.UTF_16;
String s = "😈";
try ( BufferedWriter writer = Files.newBufferedWriter( file , charset ) )
{
writer.write( s , 0 , s.length() );
}
catch ( IOException e )
{
e.printStackTrace();
}

关于 Unicode 和编码

要了解 Unicode 和编码的基础知识,请阅读帖子 The Absolute Minimum Every Software Developer Absolutely, Positively Must Know About Unicode and Character Sets (No Excuses!) .

关于java - 在 Java 中显示 UTF-8 表情符号,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/62125628/

25 4 0
Copyright 2021 - 2024 cfsdn All Rights Reserved 蜀ICP备2022000587号
广告合作:1813099741@qq.com 6ren.com