- c - 在位数组中找到第一个零
- linux - Unix 显示有关匹配两种模式之一的文件的信息
- 正则表达式替换多个文件
- linux - 隐藏来自 xtrace 的命令
范围从 32 到 126 的 ASCII 是可打印的。 127 是 DEL
,此后被认为是 extended characters .
为了检查它们是如何存储在 std::string
中的,我写了一个测试程序:
int main ()
{
string s; // ASCII
s += "!"; // 33
s += "A"; // 65
s += "a"; // 97
s += "â"; // 131
s += "ä"; // 132
s += "Ã "; // 133
cout << s << endl; // Print directly
for(auto i : s) // Print after iteration
cout << i;
cout << "\ns.size() = " << s.size() << endl; // outputs 9!
}
上面代码中可见的特殊字符实际上看起来不同,这些可以在 online example 中看到(在 vi 中也可见)。
在字符串 s
中,前 3 个正常字符按预期各占 1 个字节。接下来的 3 个扩展字符每个占用 2 个字节。
问题:
s
时,它是如何计算出对于普通字符它必须递增 1 次而对于扩展字符它必须递增 2 次!?[注意:这也可能适用于 C 和其他语言。]
最佳答案
- Despite being an ASCII (within range of 0 to 256), why those 3 extended characters take 2 bytes of space?
如果您将“作为 ASCII”定义为仅包含 [0, 256) 范围内的字节,那么所有数据都是 ASCII:[0, 256) 与一个字节能够表示的范围相同,因此所有数据用字节表示的是ASCII,根据你的定义。
问题是您的定义不正确,并且您对数据类型的确定方式的看法不正确;字节序列表示的数据类型不是由这些字节决定的。相反,数据类型是字节序列外部的元数据。 (这并不是说不可能检查字节序列并从统计上确定它可能是哪种数据。)
让我们检查您的代码,牢记以上内容。我从您的源代码的两个版本中提取了相关片段:
s += "â"; // 131
s += "ä"; // 132
s += "â"; // 131
s += "ä"; // 132
您将这些源代码片段视为在浏览器中呈现的文本,而不是原始二进制数据。您将这两件事呈现为“相同”数据,但实际上它们并不相同。上图是两个不同的字符序列。
然而,这两个文本元素序列有一些有趣的地方:其中一个在使用某种编码方案编码为字节时,在编码时由与另一个文本元素序列相同的字节序列表示使用不同的编码方案转换为字节。也就是说,磁盘上的相同字节序列可能代表两个不同的文本元素序列,取决于编码方案!换句话说,为了弄清楚字节序列是什么意思,我们必须知道它是什么类型的数据,因此需要知道使用什么解码方案。
这就是可能发生的事情。在 vi 中你写道:
s += "â"; // 131
s += "ä"; // 132
您的印象是 vi 会使用扩展 ASCII 表示这些字符,因此使用字节 131 和 132。但这是不正确的。 vi 没有使用扩展的 ASCII,而是使用不同的方案 (UTF-8) 表示这些字符,该方案恰好使用两个字节来表示这些字符中的每一个。
后来,当您在不同的编辑器中打开源代码时,该编辑器错误地假定该文件是扩展的 ASCII 文件并照此显示。由于扩展 ASCII 对每个字符使用一个字节,因此它使用两个字节 vi 来表示每个字符,并为每个字节显示一个字符。
最重要的是,您认为源代码使用的是扩展 ASCII 是错误的,因此您假设这些字符将由值为 131 和 132 的单个字节表示是不正确的。
- When we iterate through the s using range based loop, how is it figured out that for normal characters it has to increment 1 time and for extended characters 2 times!?
您的程序没有这样做。在您的 ideone.com 示例中,字符打印正常,因为独立打印出代表这些字符的两个字节可以显示该字符。这是一个清楚说明这一点的示例:live example .
std::cout << "Printed together: '";
std::cout << (char)0xC3;
std::cout << (char)0xA2;
std::cout << "'\n";
std::cout << "Printed separated: '";
std::cout << (char)0xC3;
std::cout << '/';
std::cout << (char)0xA2;
std::cout << "'\n";
Printed together: 'â'
Printed separated: '�/�'
“�”字符是遇到无效编码时显示的字符。
如果您问如何编写执行此操作的程序,答案是使用了解所用编码细节的代码。要么获得一个理解 UTF-8 的库,要么自己阅读 UTF-8 规范。
您还应该记住,这里使用 UTF-8 只是因为此编辑器和编译器默认使用 UTF-8。如果你用不同的编辑器编写相同的代码并用不同的编译器编译它,编码可能完全不同;假设代码是 UTF-8 可能与您之前假设代码是扩展 ASCII 一样错误。
关于c++ - 为什么扩展的 ASCII(特殊)字符需要 2 个字节才能存储?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/28966141/
#include using namespace std; class C{ private: int value; public: C(){ value = 0;
这个问题已经有答案了: What is the difference between char a[] = ?string?; and char *p = ?string?;? (8 个回答) 已关闭
关闭。此题需要details or clarity 。目前不接受答案。 想要改进这个问题吗?通过 editing this post 添加详细信息并澄清问题. 已关闭 7 年前。 此帖子已于 8 个月
除了调试之外,是否有任何针对 c、c++ 或 c# 的测试工具,其工作原理类似于将独立函数复制粘贴到某个文本框,然后在其他文本框中输入参数? 最佳答案 也许您会考虑单元测试。我推荐你谷歌测试和谷歌模拟
我想在第二台显示器中移动一个窗口 (HWND)。问题是我尝试了很多方法,例如将分辨率加倍或输入负值,但它永远无法将窗口放在我的第二台显示器上。 关于如何在 C/C++/c# 中执行此操作的任何线索 最
我正在寻找 C/C++/C## 中不同类型 DES 的现有实现。我的运行平台是Windows XP/Vista/7。 我正在尝试编写一个 C# 程序,它将使用 DES 算法进行加密和解密。我需要一些实
很难说出这里要问什么。这个问题模棱两可、含糊不清、不完整、过于宽泛或夸夸其谈,无法以目前的形式得到合理的回答。如需帮助澄清此问题以便重新打开,visit the help center . 关闭 1
有没有办法强制将另一个 窗口置于顶部? 不是应用程序的窗口,而是另一个已经在系统上运行的窗口。 (Windows, C/C++/C#) 最佳答案 SetWindowPos(that_window_ha
假设您可以在 C/C++ 或 Csharp 之间做出选择,并且您打算在 Windows 和 Linux 服务器上运行同一服务器的多个实例,那么构建套接字服务器应用程序的最明智选择是什么? 最佳答案 如
你们能告诉我它们之间的区别吗? 顺便问一下,有什么叫C++库或C库的吗? 最佳答案 C++ 标准库 和 C 标准库 是 C++ 和 C 标准定义的库,提供给 C++ 和 C 程序使用。那是那些词的共同
下面的测试代码,我将输出信息放在注释中。我使用的是 gcc 4.8.5 和 Centos 7.2。 #include #include class C { public:
很难说出这里问的是什么。这个问题是含糊的、模糊的、不完整的、过于宽泛的或修辞性的,无法以目前的形式得到合理的回答。如需帮助澄清此问题以便重新打开它,visit the help center 。 已关
我的客户将使用名为 annoucement 的结构/类与客户通信。我想我会用 C++ 编写服务器。会有很多不同的类继承annoucement。我的问题是通过网络将这些类发送给客户端 我想也许我应该使用
我在 C# 中有以下函数: public Matrix ConcatDescriptors(IList> descriptors) { int cols = descriptors[0].Co
我有一个项目要编写一个函数来对某些数据执行某些操作。我可以用 C/C++ 编写代码,但我不想与雇主共享该函数的代码。相反,我只想让他有权在他自己的代码中调用该函数。是否可以?我想到了这两种方法 - 在
我使用的是编写糟糕的第 3 方 (C/C++) Api。我从托管代码(C++/CLI)中使用它。有时会出现“访问冲突错误”。这使整个应用程序崩溃。我知道我无法处理这些错误[如果指针访问非法内存位置等,
关闭。这个问题不符合Stack Overflow guidelines .它目前不接受答案。 我们不允许提问寻求书籍、工具、软件库等的推荐。您可以编辑问题,以便用事实和引用来回答。 关闭 7 年前。
已关闭。此问题不符合Stack Overflow guidelines 。目前不接受答案。 要求我们推荐或查找工具、库或最喜欢的场外资源的问题对于 Stack Overflow 来说是偏离主题的,因为
我有一些 C 代码,将使用 P/Invoke 从 C# 调用。我正在尝试为这个 C 函数定义一个 C# 等效项。 SomeData* DoSomething(); struct SomeData {
这个问题已经有答案了: Why are these constructs using pre and post-increment undefined behavior? (14 个回答) 已关闭 6
我是一名优秀的程序员,十分优秀!