- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我正在努力用 C 将 32 位 float 转换为 16 位 float 。
我理解规范化、反规范化等概念。
但我没能理解下面的结果。
此转换符合 IEEE 754 标准。 (使用舍入到偶数模式)
32bit floating point
00110011 01000000 00000000 00000000
converted 16bit floating point
00000000 00000001
这就是我采取的步骤。
给定32位 float 的符号位为0,exp字段为102,其余为小数位字段。
所以 exp 字段 102 必须是 -127 偏差,所以它变成 -25,如下所示。
// since exp field is not zero, there will be leading 1.
1.1000000 00000000 00000000 * 2^(-25)
将上述数字转换为半精度 float 时,我们必须在指数上加上偏差(15)以对 exp 字段进行编码。
所以 exp 字段是 -10。
由于编码后的exp域小于0,给定的32位 float 无法成功表达为半精度 float 。
所以我认为半精度浮点位模式将如下所示
00000000 00000000
但是为什么 00000000 00000001
?
我看过很多上传到stackoverflow上的文章,但它们只是代码示例,并没有真正处理内部行为。
有人可以反驳我的误解吗?
最佳答案
要获得 -10 的偏置指数,您需要通过将尾数位右移 11 来创建一个非规范化数字(指数字段中为 0)。这将为您提供 00000 00000 11000... 对于尾数位,然后将其四舍五入为 00000 00001——可能的最小非范数。
一个 IEEE fp 数有一个 1 位符号、一个 n 位指数字段和一个 m 位尾数字段。对于 n 位指数字段,全 1 值表示 Inf 或 Nan,全 0 值表示代数或零(取决于尾数位)。因此只有 1..2n-2 范围内的指数对归一化数字有效。
因此,当您计算“归一化和有偏差”指数时,如果它 ≤ 0,则您需要生成一个非范数(或零)。标准化数字的值为
-1S(1.0 + 2-mM)2E-bias
(其中 M 是尾数字段中被视为无符号整数的值,m 是尾数位数——有些描述将其写为 1.M)。 denorm 的值为
-1S(0.0 + 2-mM)21-偏置
也就是说,指数与偏置指数值 1 相同,但是“隐藏位”(添加到尾数顶部的额外位)被视为 0 而不是 1。因此要转换您的具有-10的(偏置)指数的归一化数为denorm,您需要将尾数(包括通常不存储的隐藏1位)移动1 - -10位(即11位)以获得尾数你想要的 denorm 值。由于这将始终移动至少一位(对于任何≤ 0 的偏置指数),它会将 0 移动到隐藏位位置,与尾数的非范数含义相匹配。如果指数足够小,它将完全移出尾数,为您提供 0 尾数(即零)。但是在您的特定情况下,即使它完全移出了 10 个(以 fp16 格式表示)位,保护位仍然是 1,因此它四舍五入为 1。
关于将单精度 float 转换为半精度 float ,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/58250512/
关于这个话题已经说了很多,但是我找不到我的问题的确切答案。 JavaScript 无法准确表示 0.1 等小数,这是可以理解的。 例如,由于乘法运算期间发生舍入误差,这是正确的: 0.1 * 3 ==
在 zig 中,可以使用“{d}”以十进制表示法打印浮点值。这将自动以全精度打印该值。有没有办法指定位数?是针对每个值,还是作为某种全局设置? 最佳答案 这将限制小数点后的位数,四舍五入和零填充: f
我正在进行的项目需要高精度。减法时我遇到的问题在这里说明: >> 1-0.9999999999999999 ans = 1.1102e-16 >> 1-0.99999999999999999 ans
是否可以使变量本身的精度成为将在运行时定义的变量? 说,如果我尝试编译: SUBROUTINE FOO( VARIABLE, PRECISION_VALUE ) IMPLICI
我正在查询 SQLite 数据库以获取纬度/经度详细信息。 SELECT * FROM tblMain where latitude > -33.866 and latitude 151.20
我一直使用下划线将整数定义为 Fortran 中的特定类型。 下面是一段代码,用于演示 1_8 的含义,例如: program main implicit none integer(2)
我正在寻找一种方法来告诉 pint 要打印多少个有效数字。例如,当我输入以下内容时: import pint ureg = pint.UnitRegistry() print(3*ureg.m /9)
我正在从事一个项目,目标是从山上追踪动物。在第一个实地考察季中,我们使用了 OpenTags 和经过校准的摄像头,虽然可以正常工作,但需要大量的处理/校准,而且至关重要的是,当系统出现问题时无法提供任
在 JavaScript 中有没有一种方法可以确定一个数除以另一个数是否会得到整数?就像 18.4/0.002 给我们 9200,但是 18.4/0.1 给我们 183.99999999999997。
我正在尝试使用 Big.js 在 javascript 中完成此计算 r = (a * b)/ sqrt( ( a*sin(θ) )^2 + ( b*cos(θ) )^2 ) 我也试过 math.js
我有这个片段着色器代码,它在 iOS 模拟器(非视网膜)和 iPad2(非视网膜)之间显示不同: highp vec2 textCoord; textCoord.x = gl_Fr
这个问题在这里已经有了答案: C++ calculating more precise than double or long double (2 个答案) 关闭 6 年前。 是否有任何浮点类型在小
我似乎一直困惑的三个问题: 为什么代码是 x & ~077比这行代码 x & 0177700 更好。是因为精度损失较小吗? 为什么此代码对于设置数字中的第 5 位不正确? num = num + 0x
这个问题在这里已经有了答案: 关闭 10 年前。 Possible Duplicate: Precision of Floating Point 我正在尝试使用一些 float 来计算概率,但我的最
由于微 Controller 的精度,我定义了一个包含两个 float 比率的符号,而不是直接写结果。 #define INTERVAL (0.01F/0.499F) 代替 #defi
我试图比较这 3 种搜索算法,起初我使用 time.h 库但没有任何反应,输出始终是 0.00000 秒。现在我试图在循环中使用一些计数器。但我在这里也有问题, 任何人都可以帮我处理代码吗? 这是我的
char buf[10]; int counter, x = 0; snprintf (buf, sizeof buf , "%.100d%n", x, &counter); printf("Coun
我注意到在评估向量时对我来说是不可预测的行为。直接执行它与在循环中进行索引似乎是完全不同的。谁能帮我解决这个问题?我知道可能在它如何进行每个操作中都有解释,所以我需要一些关于如何查找它的键 多谢指教提
我想在我的应用程序中使用精确的 gps 定位。所以我遵循了一个简单的教程(LocationManager 的基本用法,明确要求 GPS 提供商,要求更新 0 ms,0 m)并创建了一个应用程序。我对更
float 在 1.0f 和 0.0f 之间有多少位精度,这样每个值都可以唯一表示? 例如,如果第一个小数 float 不能表示 0.13f,答案就是 float 只有一位精度。 最佳答案 std::
我是一名优秀的程序员,十分优秀!