- c - 在位数组中找到第一个零
- linux - Unix 显示有关匹配两种模式之一的文件的信息
- 正则表达式替换多个文件
- linux - 隐藏来自 xtrace 的命令
我知道这个问题可能非常初级。如果这是显而易见的事情,请原谅。考虑以下程序:
#include <stdio.h>
int main(void) {
// this is a string in English
char * str_1 = "This is a string.";
// this is a string in Russian
char * str_2 = "Это строковая константа.";
// iterator
int i;
// print English string as a string
printf("%s\n", str_1);
// print English string byte by byte
for(i = 0; str_1[i] != '\0'; i++) {
printf(" %c ",(char) str_1[i]);
}
printf("\n");
// print numerical values of English string byte by byte
for(i = 0; str_1[i] != '\0'; i++) {
printf("%03d ",(int) str_1[i]);
}
printf("\n");
// print Russian string as a string
printf("%s\n", str_2);
// print Russian string byte by byte
for(i = 0; str_2[i] != '\0'; i++) {
printf(" %c ",(char) str_2[i]);
}
printf("\n");
// print numerical values of Russian string byte by byte
for(i = 0; str_2[i] != '\0'; i++) {
printf("%03d ",(int) str_2[i]);
}
printf("\n");
return(0);
}
输出:
This is a string.
T h i s i s a s t r i n g .
084 104 105 115 032 105 115 032 097 032 115 116 114 105 110 103 046
Это строковая константа.
▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ ▒ .
-48 -83 -47 -126 -48 -66 032 -47 -127 -47 -126 -47 -128 -48 -66 -48 -70 -48 -66 -48 -78 -48 -80 -47 -113 032 -48 -70 -48 -66 -48 -67 -47 -127 -47 -126 -48 -80 -48 -67 -47 -126 -48 -80 046
可以看出,英语 (ASCII) 字符串可以打印为字符串或使用数组索引访问并逐字符(逐字节)打印,但俄语字符串(我相信编码为 UTF-8)可以打印为字符串但不能逐字符访问。
我知道原因是在这种情况下,俄语字符使用两个字节而不是一个字节进行编码。
我想知道是否有任何简单的方法通过正确声明数据类型或以某种方式标记字符串来使用标准 C 库函数逐字符打印 Unicode 字符串(在本例中为两字节乘两字节)或者通过设置语言环境或其他方式。
我尝试在俄语字符串前面加上“u8”,即 char * str_2 = u8"..."
,但这并没有改变行为。我想避免使用宽字符来假设正在使用的语言,例如每个字符恰好两个字节。任何建议将不胜感激。
最佳答案
我认为 mblen()
, mbtowc()
, wctomb()
, mbstowcs()
和 wcstombs()
来自 <stdlib.h>
的功能部分相关。您可以使用 mblen()
查看字符串中每个字符由多少字节组成,例如。
另一个很少使用的头文件和函数是<locale.h>
。和 setlocale()
.
这是对您的代码的改编:
#include <assert.h>
#include <locale.h>
#include <stdio.h>
#include <stdlib.h>
#include <string.h>
static inline void ntbs_hex_dump(const char *pc_ntbs)
{
unsigned char *ntbs = (unsigned char *)pc_ntbs;
for (int i = 0; ntbs[i] != '\0'; i++)
printf(" %.2X ", ntbs[i]);
putchar('\n');
}
static inline void ntbs_chr_dump(const char *pc_ntbs)
{
unsigned char *ntbs = (unsigned char *)pc_ntbs;
for (int i = 0; ntbs[i] != '\0'; i++)
printf(" %c ", ntbs[i]);
putchar('\n');
}
int main(void)
{
char *loc = setlocale(LC_ALL, "");
printf("Locale: %s\n", loc);
char *str_1 = "This is a string.";
char *str_2 = "Это строковая константа.";
printf("English:\n");
printf("%s\n", str_1);
ntbs_chr_dump(str_1);
ntbs_hex_dump(str_1);
printf("Russian:\n");
printf("%s\n", str_2);
ntbs_chr_dump(str_2);
ntbs_hex_dump(str_2);
char *mbp = str_2;
while (*mbp != '\0')
{
enum { MBS_LEN = 10 };
int mbl = mblen(mbp, strlen(mbp));
char mbs[MBS_LEN];
assert(mbl < MBS_LEN - 1 && mbl > 0);
// printf("mbl = %d\n", mbl);
memmove(mbs, mbp, mbl);
mbs[mbl] = '\0';
printf(" %s ", mbs);
mbp += mbl;
}
putchar('\n');
return(0);
}
setlocale()
很重要,至少在我开发和测试它的 macOS Sierra 10.12.2(带有 GCC 6.3.0)上是这样。没有那个,mblen()
总是返回 1
,代码中没有任何好处。
我从中得到的输出是:
Locale: en_US.UTF-8
English:
This is a string.
T h i s i s a s t r i n g .
54 68 69 73 20 69 73 20 61 20 73 74 72 69 6E 67 2E
Russian:
Это строковая константа.
? ? ? ? ? ? ? ? ? ? ? ? ? ? ? ? ? ? ? ? ? ? ? ? ? ? ? ? ? ? ? ? ? ? ? ? ? ? ? ? ? ? .
D0 AD D1 82 D0 BE 20 D1 81 D1 82 D1 80 D0 BE D0 BA D0 BE D0 B2 D0 B0 D1 8F 20 D0 BA D0 BE D0 BD D1 81 D1 82 D0 B0 D0 BD D1 82 D0 B0 2E
Э т о с т р о к о в а я к о н с т а н т а .
稍加努力,代码可以更紧密地打印 UTF-8 数据的字节对。 D0 和 D1 前导字节对于 BMP(基本多语言平面)中的西里尔代码块 U+0400 .. U+04FF 的 UTF-8 编码是正确的。
只是为了您的娱乐值(value):BSD sed
拒绝处理输出,因为这些问号代表无效代码:sed: RE error: illegal byte sequence
.
关于c - 逐字符访问外语字符串,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/41540599/
关闭。这个问题是opinion-based 。目前不接受答案。 想要改进这个问题吗?更新问题,以便 editing this post 可以用事实和引文来回答它。 . 已关闭 4 年前。 Improv
PowerShell Web Access 允许您通过 Web 浏览器运行 PowerShell cmdlet。它显示了一个基于 Web 的控制台窗口。 有没有办法运行 cmdlet 而无需在控制台窗
我尝试在无需用户登录的情况下访问 Sharepoint 文件。 我可以通过以下任一方式获取访问 token 方法一: var client = new RestClient("https://logi
我目前正在尝试通过 Chrome 扩展程序访问 Google 服务。我的理解是,对于 JS 应用程序,Google 首选的身份验证机制是 OAuth。我的应用目前已成功通过 OAuth 向服务进行身份
假设我有纯抽象类 IHandler 和派生自它的类: class IHandler { public: virtual int process_input(char input) = 0; };
我有一个带有 ThymeLeaf 和 Dojo 的 Spring 应用程序,这给我带来了问题。当我从我的 HTML 文件中引用 CSS 文件时,它们在 Firebug 中显示为中止。但是,当我通过在地
这个问题已经有答案了: JavaScript property access: dot notation vs. brackets? (17 个回答) 已关闭 6 年前。 为什么这不起作用? func
我想将所有流量重定向到 https,只有 robot.txt 应该可以通过 http 访问。 是否可以为 robot.txt 文件创建异常(exception)? 我的 .htaccess 文件: R
我遇到了 LinkedIn OAuth2: "Unable to verify access token" 中描述的相同问题;但是,那里描述的解决方案并不能解决我的问题。 我能够成功请求访问 toke
问题 我有一个暴露给 *:8080 的 Docker 服务容器. 我无法通过 localhost:8080 访问容器. Chrome /curl无限期挂断。 但是如果我使用任何其他本地IP,我就可以访
我正在使用 Google 的 Oauth 2.0 来获取用户的 access_token,但我不知道如何将它与 imaplib 一起使用来访问收件箱。 最佳答案 下面是带有 oauth 2.0 的 I
我正在做 docker 入门指南:https://docs.docker.com/get-started/part3/#recap-and-cheat-sheet-optional docker-co
我正在尝试使用静态 IP 在 AKS 上创建一个 Web 应用程序,自然找到了一个带有 Nginx ingress controller in Azure's documentation 的解决方案。
这是我在名为 foo.js 的文件中的代码。 console.log('module.exports:', module.exports) console.log('module.id:', modu
我试图理解访问键。我读过https://docs.aws.amazon.com/general/latest/gr/aws-sec-cred-types.html#access-keys-and-se
我正在使用 MGTwitterEngine"将 twitter 集成到我的应用程序中。它在 iOS 4.2 上运行良好。当我尝试从任何 iOS 5 设备访问 twitter 时,我遇到了身份验证 to
我试图理解访问键。我读过https://docs.aws.amazon.com/general/latest/gr/aws-sec-cred-types.html#access-keys-and-se
我正在使用以下 API 列出我的 Facebook 好友。 https://graph.facebook.com/me/friends?access_token= ??? 我想知道访问 token 过
401 Unauthorized - Show headers - { "error": { "errors": [ { "domain": "global", "reas
我已经将我的 django 应用程序部署到 heroku 并使用 Amazon s3 存储桶存储静态文件,我发现从 s3 存储桶到 heroku 获取数据没有问题。但是,当我测试查看内容存储位置时,除
我是一名优秀的程序员,十分优秀!