database - 如何在 R 中读取 MNIST 数据库？-6ren

database - 如何在 R 中读取 MNIST 数据库？

转载作者：太空狗更新时间：2023-10-30 01:43:04

24

4

我目前正在做一个案例研究，我需要为 MNIST database 工作.
this site 中的文件据说是 IDX 文件格式。我尝试使用记事本和写字板等基本文本编辑器查看这些文件，但没有成功。
预计它们将采用高端格式，我尝试了以下操作:

to.read = file("t10k-images.idx3-ubyte", "rb")
readBin(to.read, integer(), n=100, endian = "high")

我得到了一些数字作为输出，但它们对我来说没有任何意义。

谁能解释一下如何在 R 中读取 MNIST 数据库文件以及如何解释这些数字？谢谢。

最佳答案

endian="big"，不是"high":

> to.read = file("~/Downloads/t10k-images-idx3-ubyte", "rb")

魔数(Magic Number):

> readBin(to.read, integer(), n=1, endian="big")
[1] 2051

图片数量:

> readBin(to.read, integer(), n=1, endian="big")
[1] 10000

行数:

> readBin(to.read, integer(), n=1, endian="big")
[1] 28

列数:

> readBin(to.read, integer(), n=1, endian="big")
[1] 28

数据来了:

> readBin(to.read, integer(), n=1, endian="big")
[1] 0
> readBin(to.read, integer(), n=1, endian="big")
[1] 0

根据网站上的训练集图像数据描述。

现在你只需要循环并将 28*28 字节的 block 读入矩阵。

重新开始:

 > to.read = file("~/Downloads/t10k-images-idx3-ubyte", "rb")

跳过标题:

> readBin(to.read, integer(), n=4, endian="big")
[1]  2051 10000    28    28

应该真正从 header 中读取 28,28，但在此处进行了硬编码:

 > m = matrix(readBin(to.read,integer(), size=1, n=28*28, endian="big"),28,28)
 > image(m)

可能需要转置或翻转矩阵，我认为它是一个倒置的“7”。

par(mfrow=c(5,5))
par(mar=c(0,0,0,0))
for(i in 1:25){m = matrix(readBin(to.read,integer(), size=1, n=28*28, endian="big"),28,28);image(m[,28:1])}

让你:

enter image description here

哦，谷歌引导我到:http://www.inside-r.org/packages/cran/darch/docs/readMNIST这可能有用。

关于database - 如何在 R 中读取 MNIST 数据库？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/21521571/

24

4

0

文章推荐： database - 在数据库中表示用户角色的更好方法

文章推荐： python: sys.argv[0] 在官方文档中的意思

文章推荐： python:检查IP或DNS

文章推荐： python - 执行源代码时忽略 ImportError

python - 学习 MNIST 后对非 MNIST 图像进行分类
我的机器学习算法已经学习了 MNIST 数据库中的 70000 张图像。我想在 MNIST 数据集中未包含的图像上对其进行测试。但是，我的预测函数无法读取我的测试图像的数组表示。如何在外部图像上测试
python - 制作自己的 MNIST 数据集(与 MNIST 格式相同)
我正在尝试创建我自己的 MNIST 数据版本。我已将训练和测试数据转换为以下文件； test-images-idx3-ubyte.gz test-labels-idx1-ubyte.gz train-
python - 无法在 Windows 上使用 python-mnist 包加载 MNIST 数据
我通过 pip 在我的 Windows 设备上安装了 python-mnist 包，正如 Github 文档中所述，方法是在我的 Anaconda 终端中输入以下命令: pip install pyt
一小时学会TensorFlow2之Fashion Mnist
描述 Fashion Mnist 是一个类似于 Mnist 的图像数据集. 涵盖 10 种类别的 7 万 (6 万训练集 + 1 万测试集) 个不同商品的图片. Tensor
tensorflow - MNIST 识别手写文字
该模型现在只能使用 tf. 识别单个字母。我怎样才能让它识别连续的字母单词？最佳答案手写数字识别。 ... MNIST 是一个广泛用于手写数字分类任务的数据集。它由 70,000 个标记为 28x
image - MNIST 图像是什么图像格式？
我已经从 MNIST 训练集中解压了第一张图像，并且可以访问 (28,28) 矩阵。 [[ 0 0 0 0 0 0 0 0 0 0 0 0 0 0
python - MNIST 数据反规范化不会给我返回相同的结果
这是我学习的一部分。我知道标准化确实有助于提高准确性，因此将 mnist 值除以 255。这会将所有像素除以 255，因此 28*28 的所有像素的值将在 0.0 到 1.0 范围内. 现在我厌倦了将
numpy - MNIST 中每个数字代表什么？
我已成功将 MNIST 数据下载到扩展名为 .npy 的文件中。当我打印第一张图像的几列时。我得到以下结果。这里每个数字代表什么？ a= np.load("training_set.npy") pri
TensorFlow - MNIST 数据中的训练准确性没有提高
我用tensorflow写了一个程序来处理Kaggle的数字识别问题。程序可以正常运行，但训练准确率总是很低，大约10%，如下: step 0, training accuracy 0.11 step
python - MNIST 数据集中的图像是如何转换的？
在 cnn_mnist.py例如，脚本首先加载训练和测试数据，如您从 120 行到 124 行中看到的那样。当我打印 print(train_data.shape) 时，我得到 (55000, 784
python - 神经网络 MNIST
我研究神经网络有一段时间了，用python和numpy做了一个实现。我用 XOR 做了一个非常简单的例子，它运行良好。所以我想我更进一步尝试 MNIST 数据库。这是我的问题。我正在使用具有 784
python - MNIST:试图获得高精度
我目前正在研究手写数字识别问题。首先，我针对 MNIST 数据集测试了示例手写数字。我的准确率为 53%，我需要 90% 以上的准确率。以下是我迄今为止为提高准确性所做的尝试。创建了我自己的数
python - 如何在我自己的数据集图像上测试 mnist
我正在尝试使用我自己的数字图像数据集测试 mnist。我为此写了一个 python 脚本，但它给出了一个错误。错误在代码的第 16 行。实际上我无法发送图像进行测试。给我一些建议。提前致谢。 imp
python - Mnist 数据图像和标签不匹配
我知道这可能是一个愚蠢的问题，但我真的不明白为什么。下面是我尝试从训练数据中打印单个图像和具有相同索引的标签的代码 import matplotlib.pyplot as plt from tenso
python - MNIST 手写数字
我尝试使用以下数据集在 python 中制作一个能够识别手写数字的脚本:http://deeplearning.net/data/mnist/mnist.pkl.gz . 关于这个问题和我试图实现的算
java - MNIST 的缩减图像
我正在尝试解决 Android 设备上的 MNIST 分类问题。我已经有一个经过训练的模型，现在我希望能够识别照片上的单个数字。拍完照片后，我会进行一些预处理，然后再将图像传递给模型。这是原始图像的
由浅入深学习TensorFlow MNIST 数据集
MNIST 数据集介绍 MNIST 包含 0~9 的手写数字, 共有 60000 个训练集和 10000 个测试集. 数据的格式为单通道 28*28 的灰度图. LeNet 模型
python - 为什么导入 mnist 数字数据集时总是漏掉一个子图？
我想导入 mnist digits 数字以在一个图中显示，并编写这样的代码， import keras from keras.datasets import mnist import matplotl
ocr - 去偏斜 MNIST 数据集
我目前正在研究数字手写识别问题。我发现很多state-of-art算法对mnist dateset采用了一些预处理方法，比如deskewing和jittering(我不知道'jittering'是什么
python - 对 MNIST 数据集进行标准化和缩放的正确方法
我到处找，但找不到我想要的。基本上，MNIST 数据集具有像素值在范围 [0, 255] 内的图像。 .人们说，一般来说，最好做到以下几点: 将数据缩放到 [0,1]范围。将数据标准化为具有零均值和

首页

博学

6Ren·AI

商城

database - 如何在 R 中读取 MNIST 数据库？