python - 未从混洗数据集中选择 Keras ImageDataGenerator 验证拆分-6ren

python - 未从混洗数据集中选择 Keras ImageDataGenerator 验证拆分

转载作者：行者123 更新时间：2023-12-02 19:23:48

24

4

如何将我的图像数据集随机拆分为训练和验证数据集？更具体地说，Keras ImageDataGenerator 函数中的 validation_split 参数不会将我的图像随机拆分为训练和验证，而是从未打乱的数据集中切分验证样本。

最佳答案

在 Keras 的 ImageDataGenerator 中指定 validation_split 参数时，拆分会在数据打乱之前执行，以便仅获取最后的 x 个样本。问题是最后一个被选作验证的数据样本可能不代表训练数据，因此它可能会失败。当您的图像数据存储在一个公共(public)目录中且每个子文件夹都按类命名时，这是一个特别常见的死胡同。已在多个帖子中指出:

Choose random validation data set

As you mentioned, Keras simply takes the last x samples of the dataset, so if you want to keep using it, you need to shuffle your dataset in advance.

The training accuracy is very high, while the validation accuracy is very low?

please check if you have shuffled the data before training. Because the validation splitting in keras is performed before shuffle, so maybe you have chosen an unbalanced dataset as your validation set, thus you got the low accuracy.

Does 'validation split' randomly choose validation sample?

The validation data is picked as the last 10% (for instance, if validation_split=0.9) of the input. The training data (the remainder) can optionally be shuffled at every epoch (shuffle argument in fit). That doesn't affect the validation data, obviously, it has to be the same set from epoch to epoch.

This answer指向 sklearn train_test_split() 作为解决方案，但我想提出一个不同的解决方案，以保持 keras 工作流程的一致性。

随着split-folders package 你可以随机将你的主要数据目录分成训练、验证和测试(或只是训练和验证)目录。类特定的子文件夹会自动复制。

输入文件夹应具有以下格式:

input/
    class1/
        img1.jpg
        img2.jpg
        ...
    class2/
        imgWhatever.jpg
        ...
    ...

为了给你这个:

output/
    train/
        class1/
            img1.jpg
            ...
        class2/
            imga.jpg
            ...
    val/
        class1/
            img2.jpg
            ...
        class2/
            imgb.jpg
            ...
    test/            # optional
        class1/
            img3.jpg
            ...
        class2/
            imgc.jpg
            ...

来自文档:

import split_folders

# Split with a ratio.
# To only split into training and validation set, set a tuple to `ratio`, i.e, `(.8, .2)`.
split_folders.ratio('input_folder', output="output", seed=1337, ratio=(.8, .1, .1)) # default values

# Split val/test with a fixed number of items e.g. 100 for each set.
# To only split into training and validation set, use a single number to `fixed`, i.e., `10`.
split_folders.fixed('input_folder', output="output", seed=1337, fixed=(100, 100), oversample=False) # default values

通过这种新的文件夹安排，您可以轻松地使用 keras 数据生成器将您的数据划分为训练和验证，并最终训练您的模型。

import tensorflow as tf
import split_folders
import os

main_dir = '/Volumes/WMEL/Independent Research Project/Data/test_train/Data'
output_dir = '/Volumes/WMEL/Independent Research Project/Data/test_train/output'

split_folders.ratio(main_dir, output=output_dir, seed=1337, ratio=(.7, .3))

train_datagen = tf.keras.preprocessing.image.ImageDataGenerator(
    rescale=1./224)

train_generator = train_datagen.flow_from_directory(os.path.join(output_dir,'train'),
                                                    class_mode='categorical',
                                                    batch_size=32,
                                                    target_size=(224,224),
                                                    shuffle=True)

validation_generator = train_datagen.flow_from_directory(os.path.join(output_dir,'val'),
                                                        target_size=(224, 224),
                                                        batch_size=32,
                                                        class_mode='categorical',
                                                        shuffle=True) # set as validation data

base_model = tf.keras.applications.ResNet50V2(
    input_shape=IMG_SHAPE,
    include_top=False,
    weights=None)

maxpool_layer = tf.keras.layers.GlobalMaxPooling2D()
prediction_layer = tf.keras.layers.Dense(4, activation='softmax')

model = tf.keras.Sequential([
    base_model,
    maxpool_layer,
    prediction_layer
])

opt = tf.keras.optimizers.Adam(lr=0.004)
model.compile(optimizer=opt,
              loss=tf.keras.losses.CategoricalCrossentropy(),
              metrics=['accuracy'])

model.fit(
    train_generator,
    steps_per_epoch = train_generator.samples // 32,
    validation_data = validation_generator,
    validation_steps = validation_generator.samples // 32,
    epochs = 20)

关于python - 未从混洗数据集中选择 Keras ImageDataGenerator 验证拆分，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/62662194/

24

4

0

文章推荐： bash - 如何编写杀死Docker容器的脚本？

文章推荐： ExtJS — 组织 app/下的文件

文章推荐： php - Javascript - 转义特定字符

文章推荐： docker - Docker安全检查

keras - keras 和 tf.keras 模型之间的兼容性
我有兴趣在 tf.keras 中训练一个模型，然后用 keras 加载它。我知道这不是高度建议，但我对使用 tf.keras 来训练模型很感兴趣，因为 tf.keras 更容易构建输入管道我想利用
keras - Keras 中的自定义损失函数结合了多个输出
我进行了大量搜索，但仍然无法弄清楚如何编写具有多个交互输出的自定义损失函数。我有一个神经网络定义为: def NeuralNetwork(): inLayer = Input((2,));
keras - 差异学习率 - Keras
我正在阅读一篇名为 Differential Learning Rates 的文章在 Medium 上，想知道这是否可以应用于 Keras。我能够找到在 pytorch 中实现的这项技术。这可以在 K
keras - Keras 如何评估测试集上的损失？
我正在实现一个神经网络分类器，以打印我正在使用的这个神经网络的损失和准确性: score = model.evaluate(x_test, y_test, verbose=False) model.m
keras - keras 模型输出形状中的方括号
我最近在查看模型摘要时遇到了这个问题。我想知道，[(None, 16)] 和有什么区别？和 (None, 16) ?为什么输入层有这样的输入形状？来源:model.summary() can't
keras - Keras 中基于输入数据的自定义损失函数
我正在尝试使用 Keras 创建自定义损失函数。我想根据输入计算损失函数并预测神经网络的输出。我尝试在 Keras 中使用 customloss 函数。我认为 y_true 是我们为训练提供的输出，
keras - keras 中二维元素的填充序列
我有一组样本，每个样本都是一组属性的序列(例如，一个样本可以包含 10 个序列，每个序列具有 5 个属性)。属性的数量总是固定的，但序列的数量(时间戳)可能因样本而异。我想使用这个样本集在 Keras
keras - Keras 中的类数量错误
Keras 在训练集和测试集文件夹中发现了错误数量的类。我有 3 节课，但它一直说有 4 节课。有人可以帮我吗？这里的代码: cnn = Sequential() cnn.add(Conv2D(32
keras - keras 自定义层中的持久变量
我想编写一个自定义层，在其中我可以在两次运行之间将变量保存在内存中。例如， class MyLayer(Layer): def __init__(self, out_dim = 51, **kwarg
keras - Keras:如何将学习率输出到张量板上
我添加了一个回调来降低学习速度： keras.callbacks.ReduceLROnPlateau(monitor='val_loss', factor=0.5, patience=100,
keras - keras lstm层中的多个内核是什么意思？
在 https://keras.io/layers/recurrent/我看到 LSTM 层有一个 kernel和一个 recurrent_kernel .它们的含义是什么？根据我的理解，我们需要 L
keras - 如何检查安装了哪个版本的 Keras？
问题与标题相同。我不想打开 Python，而是使用 MacOS 或 Ubuntu。最佳答案 Python 库作者将版本号放入 .__version__ 。您可以通过在命令行上运行以下命令来打印它:
keras - Keras 中的嵌入是什么？
Keras 文档并不清楚这实际上是什么。我知道我们可以用它来将输入特征空间压缩成更小的空间。但从神经设计的角度来看，这是如何完成的呢？它是一个自动编码器，RBM吗？最佳答案据我所知，嵌入层是一个简
keras - Keras 的中心损失
我想实现[http://ydwen.github.io/papers/WenECCV16.pdf]中解释的中心损失]在喀拉斯我开始创建一个具有 2 个输出的网络，例如: inputs = Input
keras - keras 中的多对一实现
我正在尝试实现多对一模型，其中输入是大小为的词向量d .我需要输出一个大小为的向量d 在 LSTM 结束时。在此 question ，提到使用(对于多对一模型) model = Sequenti
keras - Keras 中验证集的不同损失函数
我有不平衡的训练数据集，这就是我构建自定义加权分类交叉熵损失函数的原因。但问题是我的验证集是平衡的，我想使用常规的分类交叉熵损失。那么我可以在 Keras 中为验证集传递不同的损失函数吗？我的意思是用
keras - Keras 中输入数据的规范化
DL 中的一项常见任务是将输入样本归一化为零均值和单位方差。可以使用如下代码“手动”执行规范化: mean = np.mean(X, axis = 0) std = np.std(X, axis =
keras - Keras 中回调和进度条的准确性不匹配
我正在尝试学习 Keras 并使用 LSTM 解决分类问题。我希望能够绘制准确率和损失，并在训练期间更新图。为此，我正在使用 callback function . 由于某种原因，我在回调中收到的准
keras - 嵌入 Keras
在 Keras 内置函数中嵌入使用哪种算法？Word2vec？手套？其他？ https://keras.io/layers/embeddings/ 最佳答案简短的回答是都不是。本质上，GloVe 的
keras - keras 中的渐变裁剪
我有一个使用 Keras 完全实现的 LSTM RNN，我想使用梯度剪裁，梯度范数限制为 5(我正在尝试复制一篇研究论文)。在实现神经网络方面，我是一个初学者，我将如何实现？是否只是(我正在使用 r

首页

博学

6Ren·AI

商城

python - 未从混洗数据集中选择 Keras ImageDataGenerator 验证拆分