c++ - 为什么没有 2 字节浮点并且已经存在实现？

转载作者：行者123 更新时间：2023-12-02 04:29:38

假设我确实内存不足并且想要较小的范围(类似于 short 与 int)。着色器语言已经支持 half 具有一半精度的浮点类型(不仅仅是来回转换值在 -1 和 1 之间，即返回一个像这样的 float :shortComingIn/maxRangeOfShort)。是否已经存在 2 字节 float 的实现？

我也有兴趣了解为什么没有 2 字节 float 的任何(历史？)原因。

最佳答案

TL;DR:16 位 float 确实存在，并且有各种软件和硬件实现

目前有 2 种常见的标准 16 位浮点格式:IEEE-754 binary16 和 Google 的 bfloat16。由于它们是标准化的，显然任何了解规范的人都可以编写实现。一些例子:

或者如果你不想使用它们，你也可以设计一个不同的16位浮点格式并实现它

<小时/>

一般不使用 2 字节 float ，因为即使 float 的精度也不足以进行正常操作，并且默认情况下应始终使用 double ，除非您受到以下限制带宽或缓存大小。在 C 和类 C 语言中使用时，浮点文字在不带后缀的情况下也是 double 的。参见

但是less-than-32-bit floats do exist 。它们主要用于存储目的，例如在图形中，每像素 96 位(每 channel 32 位 * 3 个 channel )太浪费了，并且将转换为正常的 32 位 float 计算(某些特殊硬件除外)。各种10, 11, 14-bit float types存在于OpenGL中。许多 HDR 格式对每个 channel 使用 16 位浮点，而 Direct3D 9.0 以及 Radeon R300 和 R420 等一些 GPU 则采用 24 位浮点格式。 compilers in some 8-bit microcontrollers 也支持 24 位 float 像PIC其中 32 位浮点支持成本太高。 8 位或更窄的浮点类型用处不大，但由于其简单性，它们经常在计算机科学类(class)中教授。另外，ARM's instruction encoding中还使用了一个小浮子。对于小浮点立即数。

IEEE 754-2008 revision正式添加了 16 位浮点格式，又名 binary16 或 half-precision ，带有 5 位指数和 11 位尾数

一些编译器支持 IEEE-754 二进制 16，但主要用于转换或向量化运算，而不是用于计算(因为它们不够精确)。例如ARM的工具链有__fp16可以在 2 种变体之间进行选择:IEEE 和替代，具体取决于您是否需要更多范围或 NaN/inf 表示。 GCC和 Clang还支持 __fp16 以及标准化名称 _Float16。请参阅How to enable __fp16 type on gcc for x86_64

最近由于AI的兴起，另一种格式叫做bfloat16 ( brain floating-point format )，这是 IEEE-754 二进制 32 的前 16 位的简单截断变得常见

The motivation behind the reduced mantissa is derived from Google's experiments that showed that it is fine to reduce the mantissa so long it's still possible to represent tiny values closer to zero as part of the summation of small differences during training. Smaller mantissa brings a number of other advantages such as reducing the multiplier power and physical silicon area.

float32: 24²=576 (100%)

float16: 11²=121 (21%)

bfloat16: 8²=64 (11%)

许多编译器如 GCC和 ICC现在还获得了支持 bfloat16 的能力

有关 bfloat16 的更多信息:

如果 bfloat16 不够用，还会出现一种名为 TensorFloat 的新 19 位类型。

关于c++ - 为什么没有 2 字节浮点并且已经存在实现？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/58429479/

文章推荐： java - 如何在mybatis中为Set指定typeHandler？

文章推荐： facebook-graph-api - 图谱 API 未返回 total_video_views

文章推荐： java - 使用 selenium webdriver 切换元素

文章推荐： python-sphinx - Sphinx 是否支持 MathML(通过 mathjax 扩展)？

java - 自定义 JPA 实现//现有的无 SQL JPA 实现
背景: 我最近一直在使用 JPA，我为相当大的关系数据库项目生成持久层的轻松程度给我留下了深刻的印象。我们公司使用大量非 SQL 数据库，特别是面向列的数据库。我对可能对这些数据库使用 JPA 有一
java - 未由 S3FileSystem FileSystem 实现 Hadoop Jar 实现
我已经在我的 maven pom 中添加了这些构建配置，因为我希望将 Apache Solr 依赖项与 Jar 捆绑在一起。否则我得到了 SolarServerException: ClassNotF
c# - 实现 "Inherit"(实现)通用接口(interface)的接口(interface)？
interface ITurtle { void Fight(); void EatPizza(); } interface ILeonardo : ITurtle {
java - 任何 JPA 实现(或更广泛的 Java ORM 实现)是否支持可更新游标
我希望可用于 Java 的对象/关系映射 (ORM) 工具之一能够满足这些要求: 使用 JPA 或 native SQL 查询获取大量行并将其作为实体对象返回。允许在行(实体)中进行迭代，并在对当前
generics - 如果我为 B 实现 From ，是否也会为 Vec 实现 From>？
好像没有，因为我有实现From for 的代码, 我可以转换 A到 B与 .into() , 但同样的事情不适用于 Vec .into()一个Vec . 要么我搞砸了阻止实现派生的事情，要么这不应该发

c# - 在 C# 中，如果 A 实现 IX 并且 B 继承自 A ，是否必然遵循 B 实现 IX？
在 C# 中，如果 A 实现 IX 并且 B 继承自 A ，是否必然遵循 B 实现 IX？如果是，是因为 LSP 吗？之间有什么区别吗: 1. Interface IX; Class A : IX;

OpenVG 实现？
就目前而言，这个问题不适合我们的问答形式。我们希望答案得到事实、引用资料或专业知识的支持，但这个问题可能会引发辩论、争论、投票或扩展讨论。如果您觉得这个问题可以改进并可能重新打开，visit the

performance - 实现 (^)
我正在阅读标准haskell库的(^)的实现代码: (^) :: (Num a, Integral b) => a -> b -> a x0 ^ y0 | y0 a -> b ->a expo x0

博弈树的C++实现
我将把国际象棋游戏表示为 C++ 结构。我认为，最好的选择是树结构(因为在每个深度我们都有几个可能的移动)。这是一个好的方法吗？ struct TreeElement{ SomeMoveType

字符串匹配alg的c++实现
我正在为用户名数据库实现字符串匹配算法。我的方法采用现有的用户名数据库和用户想要的新用户名，然后检查用户名是否已被占用。如果采用该方法，则该方法应该返回带有数据库中未采用的数字的用户名。例子: “贾

图算法的C++实现
我正在尝试实现 Breadth-first search algorithm , 为了找到两个顶点之间的最短距离。我开发了一个 Queue 对象来保存和检索对象，并且我有一个二维数组来保存两个给定顶点

Python A* 实现
我目前正在 ika 中开发我的 Python 游戏，它使用 python 2.5 我决定为 AI 使用 A* 寻路。然而，我发现它对我的需要来说太慢了(3-4 个敌人可能会落后于游戏，但我想供应 4-

DHT的C++实现
我正在寻找 Kademlia 的开源实现C/C++ 中的分布式哈希表。它必须是轻量级和跨平台的(win/linux/mac)。它必须能够将信息发布到 DHT 并检索它。最佳答案 OpenDHT是

C++实现
我在一本书中读到这一行:-“当我们要求 C++ 实现运行程序时，它会通过调用此函数来实现。” 而且我想知道“C++ 实现”是什么意思或具体是什么。帮忙!？最佳答案 “C++ 实现”是指编译器加上链接

背包分支定界的C++实现
我正在尝试使用分支定界的 C++ 实现这个背包问题。此网站上有一个 Java 版本:Implementing branch and bound for knapsack 我试图让我的 C++ 版本打印

FNV哈希的C#实现
在很多情况下，我需要在 C# 中访问合适的哈希算法，从重写 GetHashCode 到对数据执行快速比较/查找。我发现 FNV 哈希是一种非常简单/好/快速的哈希算法。但是，我从未见过 C# 实现的

LRU缓存替换策略及C#实现
目录 LRU缓存替换策略核心思想不适用场景算法基本实现算法优化

大角度非迭代的空间坐标旋转C#实现
1. 绪论在前面文章中提到空间直角坐标系相互转换，测绘坐标转换时，一般涉及到的情况是：两个直角坐标系的小角度转换。这个就是我们经常在测绘数据处理中，WGS-84坐标系、54北京坐标系

实现.Net7下的数据库定时检查
在软件开发过程中，有时候我们需要定时地检查数据库中的数据，并在发现新增数据时触发一个动作。为了实现这个需求，我们在 .Net 7 下进行一次简单的演示. PeriodicTimer .

查找算法之二分查找的C++实现
二分查找二分查找算法，说白了就是在有序的数组里面给予一个存在数组里面的值key，然后将其先和数组中间的比较，如果key大于中间值，进行下一次mid后面的比较，直到找到相等的，就可以得到它的位置。

行者123

个人简介
我是一名优秀的程序员,十分优秀！

作者热门文章

html - 出于某种原因，IE8 对我的 Sass 文件中继承的 html5 CSS 不友好？

JMeter 在响应断言中使用 span 标签的问题

html - 在 :hover and :active? 上具有不同效果的 CSS 动画

html - 相对于居中的 html 内容固定的 CSS 重复背景？

滴滴打车优惠券免费领取

全站热门文章

跟着8.6kStar的开源数据库，搞RAG！

manim边学边做--同伦变换

深入理解Servlet：从基础概念到高级特性与实战应用

VisualStudio-API调试与测试工具之HTTP文件

经典区间线段树详解：从原理到实践

DevNowxNotion

.NET周刊【12月第3期2024-12-15】

JVM简介—3.JVM的执行子系统

leetcode05回文字符串

Promise/A+规范-中文版本

首页

博学

6Ren·AI

商城

c++ - 为什么没有 2 字节浮点并且已经存在实现？

TL;DR:16 位 float 确实存在，并且有各种软件和硬件实现