multithreading - Perl 脚本随着进度变慢-6ren

multithreading - Perl 脚本随着进度变慢

转载作者：行者123 更新时间：2023-12-04 06:48:41

我编写了一个 Perl 脚本来编译显示，以便用户可以查看它们。有数千个这样的显示文件(DSET 文件)需要编译，这个过程需要相当长的时间(4-5 小时)。显示是使用外部可执行文件编译的(我没有关于此可执行文件内部工作的详细信息)。

作为加快进程的解决方案，我们决定并行运行此可执行文件的多个实例，以尝试大幅提高性能。

使用 16 个线程运行时，性能显着提高，现在需要大约 1 小时才能完成，而不是 4-5 小时，但仍然存在问题。随着脚本的进行，此可执行文件运行所需的时间会增加。

我对大约 1000 个 DSET 文件进行了测试，并随着 Perl 脚本的进行监视外部编译程序的执行时间。下面是执行时间随时间增加的图。

performance plot

如您所见，当脚本启动时，Perl 脚本需要大约 4 秒的时间来打开可执行文件、编译 DSET，然后关闭可执行文件。一旦脚本处理了大约 500 个 DSET，编译每个后续 DSET 所需的时间似乎会增加。当脚本接近尾声时，一些 DSET 文件需要长达 12 秒的时间来编译!

以下是每个线程执行的功能的示例:

# Build the displays
sub fgbuilder {
    my ($tmp_ddldir, $outdir, $eset_files, $image_files) = @_;

    # Get environment variables
    my $executable = $ENV{fgbuilder_executable};
    my $version    = $ENV{fgbuilder_version   };

    # Create the necessary directories
    my $tmp_imagedir = "$tmp_ddldir\\images";
    my $tmp_outdir   = "$tmp_ddldir\\compiled";
    make_path($tmp_ddldir, $tmp_imagedir, $tmp_outdir);

    # Copy the necessary files
    map { copy($_, $tmp_ddldir  ) } @{$eset_files };
    map { copy($_, $tmp_imagedir) } @{$image_files};

    # Take the next DSET off of the queue
    while (my $dset_file = $QUEUE->dequeue()) {

        # Copy the DSET to the thread's ddldir
        copy($dset_file, $tmp_ddldir);

        # Get the DSET name
        my $dset          = basename($dset_file);
        my $tmp_dset_file = "$tmp_ddldir\\$dset";

        # Build the displays in the DSET
        my $start = time;
        system $executable,
            '-compile' ,
            '-dset'    , $dset        ,
            '-ddldir'  , $tmp_ddldir  ,
            '-imagedir', $tmp_imagedir,
            '-outdir'  , $tmp_outdir  ,
            '-version' , $version     ;
        my $end = time;
        my $elapsed = $end - $start;

        $SEMAPHORE->down();
        open my $fh, '>>', "$ENV{fgbuilder_errordir}\\test.csv";
        print {$fh} "$PROGRESS,$elapsed\n";
        close $fh;
        $SEMAPHORE->up();

        # Remove the temporary DSET file
        unlink $tmp_dset_file;

        # Move all output files to the outdir
        recursive_move($tmp_outdir, $outdir);

        # Update the progress
        { lock $PROGRESS; $PROGRESS++; }
        my $percent = $PROGRESS/$QUEUE_SIZE*100;
        { local $| = 1; printf "\rBuilding displays ... %.2f%%", $percent; }
    }

    return;
}

每次通过循环时，它都会生成一个显示构建可执行文件的新实例，等待它完成，然后关闭该实例(这应该释放它正在使用的任何内存并解决我所看到的任何问题)。

这些线程中有 16 个并行运行，每个线程从队列中取出一个新的 DSET，编译它并将编译后的显示移动到输出目录。一旦显示被编译，它就会继续从队列中取出另一个 DSET 并重新启动该过程，直到队列用完为止。

几天来，我一直在挠头，试图弄清楚为什么它会变慢。在此过程中，我的 RAM 使用率稳定且没有增加，而且我的 CPU 使用率还没有达到最大值。对这里可能发生的事情的任何帮助或见解表示赞赏。

编辑

我编写了一个测试脚本来尝试测试问题是由磁盘 I/O 缓存问题引起的理论。在这个脚本中，我采用了与旧脚本相同的基本主体，并用我自己的任务替换了对可执行文件的调用。

这是我将可执行文件替换为:

    # Convert the file to hex (multiple times so it takes longer! :D)
    my @hex_lines = ();
    open my $ascii_fh, '<', $tmp_dset_file;
    while (my $line = <$ascii_fh>) {
        my $hex_line = unpack 'H*', $line;
        $hex_line = unpack 'H*', $hex_line;
        $hex_line = unpack 'H*', $hex_line;
        $hex_line = unpack 'H*', $hex_line;
        $hex_line = unpack 'H*', $hex_line;
        $hex_line = unpack 'H*', $hex_line;
        $hex_line = unpack 'H*', $hex_line;
        $hex_line = unpack 'H*', $hex_line;
        push @hex_lines, $hex_line;
    }
    close $ascii_fh;

    # Print to output files
    make_path($tmp_outdir);
    open my $hex_fh, '>', "$tmp_outdir\\$dset" or die "Failed to open file: $!";
    print {$hex_fh} @hex_lines;
    close $hex_fh;
    open $hex_fh, '>', "$tmp_outdir\\2$dset" or die "Failed to open file: $!";
    print {$hex_fh} @hex_lines;
    close $hex_fh;
    open $hex_fh, '>', "$tmp_outdir\\3$dset" or die "Failed to open file: $!";
    print {$hex_fh} @hex_lines;
    close $hex_fh;
    open $hex_fh, '>', "$tmp_outdir\\4$dset" or die "Failed to open file: $!";
    print {$hex_fh} @hex_lines;
    close $hex_fh;
    open $hex_fh, '>', "$tmp_outdir\\5$dset" or die "Failed to open file: $!";
    print {$hex_fh} @hex_lines;
    close $hex_fh;
    open $hex_fh, '>', "$tmp_outdir\\6$dset" or die "Failed to open file: $!";
    print {$hex_fh} @hex_lines;
    close $hex_fh;

我没有调用可执行文件并编译 DSET，而是将每个文件作为文本文件打开，而是进行一些简单的处理并将一些文件写入磁盘(我每次都将一些文件写入磁盘，因为可执行文件将多个文件写入它处理的每个 DSET 的磁盘)。然后我监控处理时间并绘制我的结果。

这是我的结果:

Processing time vs script progression

我确实相信我的另一个脚本的部分问题是磁盘 I/O 问题，但正如您在此处看到的，由于我故意创建的磁盘 I/O 问题，处理时间的增加不是逐渐的。它有一个突然的跳跃，然后结果变得相当不可预测。

在我之前的脚本中，您可以看到一些不可预测性，并且它正在写入大量文件，因此我毫不怀疑该问题至少部分是由磁盘 I/O 问题引起的，但这仍然无法解释为什么处理时间的增加是渐进的，并且似乎以恒定的速度增加。

我相信这里还有一些我们没有考虑的其他因素在起作用。

最佳答案

我认为你只是有磁盘碎片问题。鉴于您有多个线程不断创建和删除不同大小的新文件，最终磁盘空间变得非常碎片化。我不知道你在哪个操作系统下运行它，我猜它是 Windows。

您无法使用测试工具重现此问题的原因可能是由于您的外部编译器工具的行为 - 它可能会创建输出文件，然后在写入之间以不同的时间多次扩展其大小，这往往会创建重叠的文件它们在多线程中运行时的磁盘空间，尤其是在磁盘使用率相对较高的情况下，例如超过 70%。您测试似乎正在序列化文件创建，从而避免并发写入碎片。

可能的解决方案:

对磁盘驱动器进行碎片整理。只需将编译的文件复制到另一个分区/磁盘，删除它们并复制回来就足够了。

在几个不同的独立分区上运行您的外部编译器以避免碎片化。

确保您的文件系统有 50% 或更多的可用空间。

使用不太容易出现文件系统碎片的操作系统，例如Linux。

关于multithreading - Perl 脚本随着进度变慢，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/29970853/

文章推荐： logfile-analysis - 搜索巨大的日志文件

文章推荐： actionscript-3 - AS3 FTP 编程以及 Socket 和 ByteArray 类

文章推荐： multithreading - Coldfusion 对线程总数的限制

Powershell 脚本 - 脚本 - 我如何禁用它
我有 powershell 脚本。通过调度程序，我运行 bat 文件，该文件运行 PS1 文件。 BAT文件 Powershell.exe -executionpolicy remotesigned
Jquery - getScript 版本<脚本>..
什么更快？或者 $.getScript('../js/SOME.js', function (){ ... // with $.ajaxSetup({ cache: true });
linux - Bash 脚本 Shell 脚本
需要bash脚本来显示文件 #!/bin/bash my_ls() { # save current directory then cd to "$1" pushd "$1" >/dev/nu
ksh - Unix 脚本 - 需要提高性能的建议(shell 脚本)
我有一个输入 csv 文件，实际上我需要在输入文件中选择第 2 列和第 3 列值，并且需要转换两个值的时区(从 PT 到 CT)，转换后我需要替换转换后的时区值到文件。注意: 所有输入日期值都在太平
Bash 脚本 - 编写 init.d 脚本
我正在使用/etc/init.d/httpd 作为 init.d 脚本的模板。我了解文件中发生的所有内容，但以下行除外: LANG=$HTTPD_LANG daemon --pidfile=${pid
python - 将具有多个子选项的命令行选项传递给 python 脚本 -- shell 脚本
我有以下选择: python runscript.py -O start -a "-a "\"-o \\\"-f/dev/sda1 -b256k -Q8\\\" -l test -p maim\""
linux - 用于重命名文件的 Shell 脚本 - Shell 脚本
我对 shell 脚本完全陌生，但我需要编写一个 shell 脚本来检查文件是否存在，然后移动到另一个位置这是我写的: 一旦设备崩溃，我就会在/storage/sdcard1/1 中收集日志 #!/
linux - Bash 脚本 - Bash 脚本 - 编辑文件中文本的行
我正在使用 bash 脚本从文本文件中读取数据。数据: 04:31 Alex M.O.R.P.H. & Natalie Gioia - My Heaven http://goo.gl/rMOa2q
php - 按下按钮运行 php 脚本，该脚本会回显 javascript 脚本
这是单击按钮时运行的 javascript 的结尾 xmlObj.open ('GET', /ajax.php, true); xmlObj.send (''); } 所以这会执行根目录中的php脚本
linux - 重新激活 python 脚本 - Linux bash 脚本
关闭。这个问题需要debugging details .它目前不接受答案。编辑问题以包含 desired behavior, a specific problem or error, and th
python - Nodejs 脚本 fs.createReadStream 到 Python 脚本
我需要将文件转换为可读流以通过 api 上传，有一个使用 fs.createReadStream 的 Node js 示例。任何人都可以告诉我上述声明的 python 等价物是什么？例子 const
python - 从 shell 脚本 cron 调用 python 脚本
我有一个 shell 脚本 cron，它从同一目录调用 python 脚本，但是当这个 cron 执行时，我没有从我的 python 脚本中获得预期的输出，当我手动执行它时，我的 python 脚本的
javascript - 安全的 ajax 脚本(javascript 请求的 PHP 脚本)
如何使 XMLHttpRequest (ajax) 调用的 php 脚本安全。我的意思是，不让 PHP 文件通过直接 url 运行，只能通过脚本从我的页面调用(我不想向未登录的用户显示数据库结果，并
脚本 block 错误中的经典 asp 脚本 block 中的 javascript
我正在尝试添加以下内容我正在使用经典的 asp。但我不断收到的错误是“一个脚本 block 不能放在另一个脚本 block 内。”我尝试了此处的 document.write 技术:Javasc
php - 如何从一个 PHP 脚本(如批处理文件)中运行多个 PHP 脚本？
如何从另一个 PHP 脚本(如批处理文件)中运行多个 PHP 脚本？如果我了解 include 在做什么，我认为 include 不会起作用；因为我正在运行的每个文件都会重新声明一些相同的函数等。我想
html - 如何从 HTML5 脚本/文件/页面调用 Lua 脚本
我想创建具有动态内容的网页。我有一个 HTML 页面，我想从中调用一个 lua 脚本如何调用 lua 脚本？ ? ？从中检索数据？我可以做类似的事情吗: int xx = 0; xx
jquery - 表格行不会自动滚动。脚本 1 滚动，脚本 2 不滚动。为什么？
我删除了我的第一个问题，并重新编写了更多细节和附加 jSfiddle domos。我有一个脚本，它运行查询并返回数据，然后填充表。表中的行自动循环滚动。所有这些工作正常，并通过使用以下代码完成。然而
javascript - amp-script 未找到脚本哈希。 amp-脚本[脚本 ="hello-world"]
我尝试使用 amp 脚本，但收到此错误: “[amp-script] 脚本哈希未找到。amp-script[script="hello-world"].js 必须在元[name="amp-script
java - 从 Java 执行 Shell 脚本，具有读取操作的 Shell 脚本
我有一个读取输入的 Shell 脚本 #!/bin/bash echo "Type the year that you want to check (4 digits), followed by [E
arrays - Redis Lua 脚本 - 如何将数组作为参数传递给 nodejs 中的 Lua 脚本？
我正在从 nodejs 调用 Lua 脚本。我想传递一个数组作为参数。我在 Lua 中解析该数组时遇到问题。下面是一个例子: var script = 'local actorlist = ARGV

行者123

个人简介

我是一名优秀的程序员,十分优秀！

作者热门文章

滴滴打车优惠券免费领取

全站热门文章

首页

博学

6Ren·AI

商城

multithreading - Perl 脚本随着进度变慢