Ruby 编码 ASCII_8BIT 和扩展 ASCII-6ren

Ruby 编码 ASCII_8BIT 和扩展 ASCII

转载作者：太空宇宙更新时间：2023-11-03 17:19:53

24

4

关于`ASCII_8BIT`

Encoding::ASCII_8BIT is a special encoding that is usually used for a byte string, not a character string. But as the name insists, its characters in the range of ASCII are considered as ASCII characters. This is useful when you use ASCII-8BIT characters with other ASCII compatible characters.

来源:ruby-doc.org/core-2.6.4

上下文

我想使用 ASCII_8BIT，因为我需要对 0x00 (0d00) 和 0xff (0d255) 之间的所有字符进行编码，所以 ASCII (0-127) 加上扩展 ASCII (128-255)。ASCII(编码，US-ASCII)是一种 7 位编码，只能识别 ASCII(字符集)字符 (0-127)。顾名思义，我期望 ASCII_8BIT 会将其扩展到 8 位以添加对 128-255 的支持。

问题

当我使用 chr 时，编码自动设置为 ASCII_8BIT，但是当我将 char 直接放在 128-255 (0x80-0xff) 之间的字符串中，然后询问编码是什么时，我得到的是 UTF-8，如果我尝试将其转换为 ASCII_8BIT 时出现错误。

irb(main):014:0> 0x8f.chr
=> "\x8F"
irb(main):015:0> 0x8f.chr.encoding
=> #<Encoding:ASCII-8BIT>
irb(main):016:0> "\x8f".encode(Encoding::ASCII_8BIT)
Traceback (most recent call last):
        5: from /usr/bin/irb:23:in `<main>'
        4: from /usr/bin/irb:23:in `load'
        3: from /usr/lib/ruby/gems/2.6.0/gems/irb-1.0.0/exe/irb:11:in `<top (required)>'
        2: from (irb):16
        1: from (irb):16:in `encode'
Encoding::InvalidByteSequenceError ("\x8F" on UTF-8)
irb(main):021:0> "\x8F".encoding
=> #<Encoding:UTF-8>

ruby 核心是否存在错误？我需要能够对 8 之间的所有内容进行编码

ASCII 8BIT 的另一个名称是 BINARY，因为如前引述所述，它应该能够编码任何字节。

irb(main):035:0> Encoding::ASCII_8BIT.names
=> ["ASCII-8BIT", "BINARY"]

其他编码

请告诉我使用另一种编码不是问题的答案，除非它是一种真正映射所有 255 个扩展 ASCII 字符的编码。

我不想使用 UTF-8，因为编码是多字节而不是单字节。
ISO/IEC 8859-1(Latin1，8 位)仅包含 191 个字符(ASCII + 63 个字符)

One notable way in which ISO character sets differ from code pages is that the character positions 128 to 159, corresponding to ASCII control characters with the high-order bit set, are specifically unused and undefined in the ISO standards, though they had often been used for printable characters in proprietary code pages, a breaking of ISO standards that was almost universal. Ref. Extended ASCII- ISO 8859 and proprietary adaptations
Windows-1252(CP-1252，8 位)不包含所有 255 个字符和扩展 ASCII 的不同映射

可用的 ruby 编码:

irb(main):036:0> Encoding.name_list
=> ["ASCII-8BIT", "UTF-8", "US-ASCII", "UTF-16BE", "UTF-16LE", "UTF-32BE", "UTF-32LE", "UTF-16", "UTF-32", "UTF8-MAC", "EUC-JP", "Windows-31J", "Big5", "Big5-HKSCS", "Big5-UAO", "CP949", "Emacs-Mule", "EUC-KR", "EUC-TW", "GB2312", "GB18030", "GBK", "ISO-8859-1", "ISO-8859-2", "ISO-8859-3", "ISO-8859-4", "ISO-8859-5", "ISO-8859-6", "ISO-8859-7", "ISO-8859-8", "ISO-8859-9", "ISO-8859-10", "ISO-8859-11", "ISO-8859-13", "ISO-8859-14", "ISO-8859-15", "ISO-8859-16", "KOI8-R", "KOI8-U", "Shift_JIS", "Windows-1250", "Windows-1251", "Windows-1252", "Windows-1253", "Windows-1254", "Windows-1257", "BINARY", "IBM437", "CP437", "IBM737", "CP737", "IBM775", "CP775", "CP850", "IBM850", "IBM852", "CP852", "IBM855", "CP855", "IBM857", "CP857", "IBM860", "CP860", "IBM861", "CP861", "IBM862", "CP862", "IBM863", "CP863", "IBM864", "CP864", "IBM865", "CP865", "IBM866", "CP866", "IBM869", "CP869", "Windows-1258", "CP1258", "GB1988", "macCentEuro", "macCroatian", "macCyrillic", "macGreek", "macIceland", "macRoman", "macRomania", "macThai", "macTurkish", "macUkraine", "CP950", "Big5-HKSCS:2008", "CP951", "IBM037", "ebcdic-cp-us", "stateless-ISO-2022-JP", "eucJP", "eucJP-ms", "euc-jp-ms", "CP51932", "EUC-JIS-2004", "EUC-JISX0213", "eucKR", "eucTW", "EUC-CN", "eucCN", "GB12345", "CP936", "ISO-2022-JP", "ISO2022-JP", "ISO-2022-JP-2", "ISO2022-JP2", "CP50220", "CP50221", "ISO8859-1", "ISO8859-2", "ISO8859-3", "ISO8859-4", "ISO8859-5", "ISO8859-6", "Windows-1256", "CP1256", "ISO8859-7", "ISO8859-8", "Windows-1255", "CP1255", "ISO8859-9", "ISO8859-10", "ISO8859-11", "TIS-620", "Windows-874", "CP874", "ISO8859-13", "ISO8859-14", "ISO8859-15", "ISO8859-16", "CP878", "MacJapanese", "MacJapan", "ASCII", "ANSI_X3.4-1968", "646", "UTF-7", "CP65000", "CP65001", "UTF-8-MAC", "UTF-8-HFS", "UCS-2BE", "UCS-4BE", "UCS-4LE", "CP932", "csWindows31J", "SJIS", "PCK", "CP1250", "CP1251", "CP1252", "CP1253", "CP1254", "CP1257", "UTF8-DoCoMo", "SJIS-DoCoMo", "UTF8-KDDI", "SJIS-KDDI", "ISO-2022-JP-KDDI", "stateless-ISO-2022-JP-KDDI", "UTF8-SoftBank", "SJIS-SoftBank", "locale", "external", "filesystem", "internal"]

用于比较 python 编码 https://docs.python.org/3/library/codecs.html#standard-encodings

注意事项

通过阅读Extended ASCII - Multi-byte character encodings似乎唯一真正的扩展 ASCII 编码是 UTF-8 但它是 Multi-byte 。似乎也不存在真正的扩展 ASCII 单字节编码。

从字节的角度来看，我可以使用此处所说的任何 8 位(单字节)编码 Extended ASCII - Usage in computer-readable languages

all ASCII bytes (0x00 to 0x7F) have the same meaning in all variants of extended ASCII,

但问题是像 ISO-8859-1 这样的实现特别未定义一些字符范围，因此会以错误结束。

irb(main):009:0> (0..255).map { |c| c.chr}.join.encode(Encoding::ISO_8859_1)
Traceback (most recent call last):
        6: from /usr/bin/irb:23:in `<main>'
        5: from /usr/bin/irb:23:in `load'
        4: from /usr/lib/ruby/gems/2.6.0/gems/irb-1.0.0/exe/irb:11:in `<top (required)>'
        3: from (irb):9
        2: from (irb):9:in `rescue in irb_binding'
        1: from (irb):9:in `encode'
Encoding::UndefinedConversionError ("\x80" to UTF-8 in conversion from ASCII-8BIT to UTF-8 to ISO-8859-1)

更新 - force_encoding

我找到了字符串方法force_encoding .

irb(main)> a = "\x8f"
=> "\x8F"
irb(main)> a.encoding
=> #<Encoding:UTF-8>
irb(main)> a.encode(Encoding::ASCII_8BIT)
Traceback (most recent call last):
        5: from /usr/bin/irb:23:in `<main>'
        4: from /usr/bin/irb:23:in `load'
        3: from /usr/lib/ruby/gems/2.6.0/gems/irb-1.0.0/exe/irb:11:in `<top (required)>'
        2: from (irb):42
        1: from (irb):42:in `encode'
Encoding::InvalidByteSequenceError ("\x8F" on UTF-8)
irb(main)> a.force_encoding(Encoding::ASCII_8BIT)
=> "\x8F"
irb(main):040:0> a.encoding
=> #<Encoding:ASCII-8BIT>

使用 force_encoding 而不是 encode 有什么危险？只是如果我不小心传递了一个多字节字符，它会被转换为多个单字节字符吗？因此，如果确保传递给应用程序的所有字符都在扩展的 ASCII 范围(单字节)内但不安全并且如果将某些 UTF-8 字符传递给应用程序将导致静默转换问题，那么这并不危险。

irb(main):044:0> "\ud087".force_encoding(Encoding::ASCII_8BIT)
=> "\xED\x82\x87"
irb(main):045:0> "\ud087".bytes
=> [237, 130, 135]

更新-答案

@mu-is-too-short 的回答和@ForeverZer0 的评论暗示我应该使用 pack 和 unpack 来处理原始字节。

所以与其使用编码和变通方法不如使用它

pattern = 'A' * 2606 + "\x8F\x35\x4A\x5F" + 'C' * 390
pattern.force_encoding(Encoding::ASCII_8BIT)

我应该直接使用bytes

pattern = ['A'.ord] * 2606 + [0x8F, 0x35, 0x4A, 0x5F] + ['C'.ord] * 390
pattern = pattern.pack('C*')

或者这个更容易阅读的语法

pattern = 'A'.bytes * 2606 + "\x8F\x35\x4A\x5F".bytes + 'C'.bytes * 390
pattern = pattern.pack('C*')

最佳答案

无论字节是否为有效的 UTF-8，字符串文字(通常)都是 UTF-8 编码的。因此:

"\x8f".encoding

即使字符串不是有效的 UTF-8，也说 UTF-8。你应该安全地使用 String#force_encoding但是如果你真的想使用原始字节，你可能会更好地使用整数数组并使用 Array#pack将它们混合成字符串:

[ 0x8f, 0x11, 0x06, 0x23, 0xff, 0x00 ].pack('C*')
# "\x8F\x11\x06#\xFF\x00" 
[ 0x8f, 0x11, 0x06, 0x23, 0xff, 0x00 ].pack('C*').encoding
# #<Encoding:ASCII-8BIT> 
[ 0x8f, 0x11, 0x06, 0x23, 0xff, 0x00 ].pack('C*').bytes
# [143, 17, 6, 35, 255, 0]

结果应该是相同的，但是，IMO，这是明确使用二进制数据(即原始字节)，使您的意图明确，并且应该避免任何编码问题。

还有 String#unpack如果您正在读取的字节存在已知结构并且您想破解它。

关于Ruby 编码 ASCII_8BIT 和扩展 ASCII，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/58001068/

24

4

0

文章推荐： ruby-on-rails - 检查是否传递了 ruby 关键字参数(RUBY)

文章推荐： C# 类无需初始化(或调用)即可工作

文章推荐： python - 如何格式化正则表达式

文章推荐： c# - ASP.NET MVC - 从 View 中的 URL 获取参数值

ruby - Ruby:Ruby Socket对象中的remote_address/local_address存放在哪里？
以下是一个非常简单的ruby服务器。 require 'socket' local_socket = Socket.new(:INET, :STREAM) local_addr = Socket.
ruby - 启动没有前缀 "Ruby"的 Ruby
我正在使用 OS X(使用 bash)，并且是 unix 的新手。我想知道是否可以修改一些文件以便运行 ruby 程序，我不需要“ruby file.rb”，而是可以运行“ruby.rb”。有理
ruby - ruby 如何完成这项任务(Ruby 中不区分大小写的字符串搜索和替换)？
我在用 Ruby 替换字符串时遇到一些问题。我的原文:人之所为不如兽之所为。我想替换为:==What== human does is not like ==what== animal does.
ruby - 从 Ruby 程序执行 Ruby 程序的最佳方式是什么？
我想在一个循环中从 Ruby 脚本做这样的事情: 写一个文件a.rb(每次迭代都会改变) 执行系统(ruby 'a.rb') a.rb 将带有结果的字符串写入文件“results” a.rb 完成并且
ruby-on-rails - Ruby on Rails - 需要为应用程序使用旧版本的 ruby
我的问题是尝试创建一个本地服务器，以便我可以理解由我的新团队开发的应用程序。我的问题是我使用的是 Ruby 2.3.3，而 Gemfile 需要 2.3.1。我无法编辑 Gemfile，因为我被告知很
ruby - 如何为用 Ruby 编写的 Ruby 命令行实用程序提供配置文件？
我有一个使用 GLI 框架用 Ruby 编写的命令行实用程序。我想在我的主目录中配置我的命令行实用程序，使用 Ruby 本身作为 DSL 来处理它(类似于 Gemfile 或 Rakefile)。我
ruby - 什么时候 Ruby 类不是那个 Ruby 类？
我的 Rails 应用 Controller 中有这段代码: def delete object = model.datamapper_class.first(:sourced_id =>
ruby - 您建议使用哪种 Ruby 解析器来解析 Ruby 源代码？
我正在寻找的解析器应该: 对 Ruby 解析友好，规则设计优雅，产生用户友好的解析错误，用户文档的数量应该比计算器示例多， UPD:允许在编写语法时省略可选的空格。快速解析不是一个重要的特性。
ruby - 有哪些设计良好的 Ruby 项目适合学习 Ruby 编码方式？
我刚开始使用 Ruby，听说有一种“Ruby 方式”编码。除了 Ruby on Rails 之外，还有哪些项目适合学习并被认可且设计良好？最佳答案 Prawn被明确地创建为不仅是一个该死的好 PDF
ruby - 如何创建无需在终端中调用 "Ruby"即可运行的 Ruby 应用程序？
我知道之前有人问过类似的问题，但是我该如何构建一个无需在前面输入“ruby”就可以在终端中运行的 Ruby 文件呢？这里的最终目标是创建一个命令行工具包类型的东西。现在，为了执行我希望用户能够执行的
ruby - 有没有更好的方法来判断一个 ruby 是否在另一个 ruby 中散列？
例如哈希a是{:name=>'mike',:age=>27,:gender=>'male'}哈希 b 是 {:name=>'mike'} 我想知道是否有更好的方法来判断 b 哈希是否在 a 哈希内，而
ruby - Ruby 和 Ruby on Rails 中的三层架构
我是一名决定学习 Ruby 和 Ruby on Rails 的 ASP.NET MVC 开发人员。我已经有所了解并在 RoR 上创建了一个网站。在 ASP.NET MVC 上开发，我一直使用三层架构:
ruby - 通过 MacVim (!ruby) 执行时如何运行正确版本的 Ruby
最近我看到 Gary Bernhardt 展示了他用来在 vim 中执行 Ruby 代码的 vim 快捷方式。捷径是 :map ,t :w\|:!ruby %. 似乎这个方法总是执行系统 Rub
ruby - 如果 Ruby 的所有实现都被编译成字节码，Ruby 真的是一种解释型语言吗？
在为 this question about Blue Ruby 选择的答案中，查克说: All of the current Ruby implementations are compiled to
ruby-on-rails - Ruby:如何对 Ruby 数组进行分组？
我有一个 Ruby 数组 > list = Request.find_all_by_artist("Metallica").map(&:song) => ["Nothing else Matters"
ruby-on-rails - Ruby:Ruby 中的舍入 float
我在四舍五入时遇到问题。我有一个 float ，我想将其四舍五入到小数点后的百分之一。但是，我只能使用 .round ，它基本上将它变成一个 int，意思是 2.34.round # => 2. 有没
ruby-on-rails - ruby/ruby on rails 内存泄漏检测
我使用 ruby on rails 编写了一个小型 Web 应用程序，它的主要目的是上传、存储和显示来自 xml(文件最多几 MB)文件的结果。运行大约 2 个月后，我注意到 mongrel 进程
ruby - 转换奇怪的字符 - Ruby
我们如何用 Ruby 转换像这样的字符串: 𝑙𝑎𝑡𝑜𝑟𝑟𝑒 收件人: Latorre 最佳答案 s = "𝑙𝑎𝑡𝑜𝑟𝑟𝑒" => "𝑙𝑎𝑡𝑜𝑟𝑟𝑒" s.u
ruby - Ruby 变量前的感叹号
通过 ruby monk 时，他们偶尔会从左侧字段中抛出一段语法不熟悉的代码: def compute(xyz) return nil unless xyz xyz.map {|a,
ruby - 返回字符串中的最高和最低数字 : Ruby
不确定我做错了什么，但我似乎弄错了。问题是，给你一串空格分隔的数字，你必须返回最大和最小的数字。注意:所有数字都是有效的 Int32，不需要验证它们。输入字符串中始终至少有一个数字。输出字符串必须

首页

博学

6Ren·AI

商城