python - pytorch DataLoader 第一个时代非常慢-6ren

python - pytorch DataLoader 第一个时代非常慢

转载作者：行者123 更新时间：2023-12-03 15:04:30

当我创建一个 PyTorch DataLoader 并开始迭代时——我得到了一个非常慢的第一个纪元(x10--x30 比所有下一个纪元都慢)。此外，此问题仅出现在来自 Kaggle 的 Google 地标识别 2020 的训练数据集上。我无法在合成图像上重现此内容，此外，我尝试创建一个包含来自 GLR2020 的 500k 图像的文件夹，并且一切正常。在PyTorch论坛中发现了几个类似的问题，没有任何解决办法。

import argparse
import pandas as pd
import numpy as np
import os, sys
import multiprocessing, ray
import time
import cv2
import logging
import albumentations as albu
from torch.utils.data import Dataset, DataLoader

samples = 50000 # count of samples to speed up test
bs = 64 # batch size
dir = '/hdd0/datasets/ggl_landmark_recognition_2020/train' # directory with train data
all_files = pd.read_csv('/hdd0/datasets/ggl_landmark_recognition_2020/train.csv')
files = np.random.choice(all_files.id.values, 50000)
files = [os.path.join(_[0], _[1], _[2], _+'.jpg') for _ in files]

# augmentations
aug =  albu.Compose([albu.Resize(400, 400),
        albu.Rotate(limit=15),
        albu.ChannelDropout(p=0.1),
        albu.Normalize(),])

class ImgDataset:
    def __init__(self, path, files, augmentation = None):
        self.path = path
        self.files = {k:v for k, v in enumerate(files)}
        self.augmentation = augmentation

    def __len__(self):
        return len(self.files)

    def __getitem__(self, idx):
        img_name = self.files[idx]
        img = np.array(cv2.imread(os.path.join(self.path, img_name)))
        if self.augmentation is not None:
            return self.augmentation(image=img)['image']


dtset = ImgDataset(dir,files, aug)
torchloader = DataLoader(dataset= dtset, batch_size=64, num_worker=16, shuffle=True)
for _ in range(3):
   t1 = time.time()
   for idx, val in enumerate(torchloader):
       pass
   t2 = time.time()
   print(str(t2-t1) +' sec')

以下是 DataLoader 中不同 num_workers 执行速度的一些示例

#num_workers=0
273.1584792137146 sec
83.15653467178345 sec
83.67923021316528 sec

# num_workers = 8 
165.62366938591003 sec
10.405716896057129 sec
10.495309114456177 sec

# num_workers = 16
156.60744667053223 sec
8.051618099212646 sec
7.922858238220215 sec

看起来问题不在于 DataLoader，而在于数据集。当我在第一次“长”迭代后删除并重新初始化 DataLoader 对象时，一切仍然正常。当我重新初始化数据集时——长的第一次迭代再次出现。
此外，我在这个 epoch 期间通过 htop 跟踪了我的 CPU 利用率， num_workers 设置为 32，并且在第一个 epoch 期间，利用率非常低； 32 个核心中只有 1-2 个在工作，在其他时期 ~ 所有核心都在工作。

最佳答案

斯拉夫卡，
我没有下载整个 GLR2020 数据集，但我能够在我本地拥有的图像数据集(80000 张大约 400x400 大小的 jpg 图像)上观察到这种效果。
为了找出性能差异的原因，我尝试了以下操作:

将扩充减少到仅调整大小

刚刚测试ImgDataset.__getitem__()功能

ImgDataset.__getitem__()无增强

只需加载原始 jpg 图像并从数据集中传递它，甚至无需进行 numpy 转换。

事实证明，差异来自图像加载时间。 Python(或操作系统本身)实现了某种缓存，在以下测试中多次加载图像时会观察到这种缓存。

for i in range(5):    
    t0 = time.time()
    data = cv2.imread(filename)
    print (time.time() - t0)
    
0.03395271301269531
0.0010004043579101562
0.0010004043579101562
0.0010008811950683594
0.001001119613647461

仅从文件读取到变量时观察到相同

for i in range(5):    
    t0 = time.time()
    with open(filename, mode='rb') as file: 
        data = file.read()
    print (time.time() - t0)

0.036234378814697266
0.0028831958770751953
0.0020024776458740234
0.0031833648681640625
0.0028734207153320312

降低加载速度的一种方法是将数据保存在非常快的本地 SSD 上。如果大小允许，请尝试将部分数据集加载到 RAM 中并编写自定义数据加载器以从那里输入...
顺便说一句，根据我的发现，这种效果应该可以在任何数据集上重现 - 看看您是否使用了不同的驱动器或某些缓存。

关于python - pytorch DataLoader 第一个时代非常慢，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/63654232/

文章推荐： npm - 如何修复 ESLint 中的意外 token ？

文章推荐： python-3.x - 为什么 '2' <'1' == False 输出 False 在 python3 中？

Javascript CSS 时代
我想通过添加一个带有 transition = 0s 的类但更改颜色来使用 jQuery 运行 CSS 动画，然后立即删除该类(使用原始 transition = 2s)它逐渐变为原始颜色。下面是我
互联网+时代 H5自助建站能为企业做什么
　　最近两年，互联网+的概念可谓十分火爆。所谓“互联网+”，其实质就是把互联网大平台和各行各业进行有机结合，建立一个新的商业生态，对于传统企业来说，互联网+的第一步就是有一个企业网站，将自己推广出去
postgresql - 不同语言的 Postgres 时代
每天我都更喜欢 Postgres，今天我发现了函数“age”。它不仅选择年份，还选择月份和日期。太棒了! 46 years 10 mons 18 days 现在我想知道是否有一个函数可以定义“年”、“
java - 如何计算自定义纪元时间？不是 UNIX 时代
我正在秒内从服务器接收数据，我想将其转换为最新数据。但我收到的秒数不是自 UNIX 纪元 01/01/1970 以来，而是 01/01/2000。通常我会使用: SimpleDateForma
r - ODE 时代 Matlab 与 R
如果在 matlab 中使用可变时间步长求解器，例如 ODE45 - 我将为输出定义一个时间跨度，即 times = [0 50]，matlab 将返回不同时间步长的结果介于 0 和 50 之间。但
jodatime DateTime.getMillis 是 UTC，对吗？时代
因此，System.currentTimeMillis 以 UTC 时区返回毫秒。 DateTime.getmillis 是否与我所知道的几乎所有图书馆都一样，因为纪元总是在 UTC 中？ joda-
hadoop - 在 Hadoop 2.0 时代，名称节点和数据节点术语是否仍然有效？
Hadoop 2.0 引入了 YARN，取代了 Job Tracker 和 Task Tracker 的任务。 YARN 由资源管理器(调度器、应用程序管理器...)、节点管理器和应用程序管理器组成。
android - Android Architecture Components 时代 Toasts、Snackbars 等放在哪里
在 ViewModel 和 one activity multiple fragments 概念时代，Activity 与 Fragment 中放置 Toasts、Snackbars 有什么建议。很
android - 在哪里可以找到 Android "Fingerpaint"演示？ (Android Studio 时代)
许多 Android 讨论都集中在(显然是著名的)Fingerpaint 示例上: https://stackoverflow.com/a/16650524/294884 我从哪里得到它，与 Andr
facebook - 在后 FBML 时代，国际化 Facebook Canvas 应用程序 (iframe) 的最佳方式是什么？
在(最终)向我的 Facebook 应用程序添加一些分析并意识到英语在我的用户语言列表中排名靠后后，我开始研究 official docs on internationalization . 但是，文

行者123

个人简介

我是一名优秀的程序员,十分优秀！

作者热门文章

滴滴打车优惠券免费领取

全站热门文章

首页

博学

6Ren·AI

商城

python - pytorch DataLoader 第一个时代非常慢