python - 有没有办法提高在 Windows 下使用 Fortran 中数组的速度，比如 Python numpy？-6ren

python - 有没有办法提高在 Windows 下使用 Fortran 中数组的速度，比如 Python numpy？

转载作者：行者123 更新时间：2023-12-03 21:58:07

26

4

很抱歉可能的重复。
关于问题。
与Windows下的GNU Fortran(9.2.0 MinGW.org GCC Build-20200227-1)相比，python 3.8.2中的numpy(1.18.2)为矩阵产品提供了非常高的模拟速度(快3倍)。我使用了命令 gfortran.exe test.f没有任何额外的选择。
有谁知道是什么导致了这种情况，是否可以提高 Fortran 中的模拟速度？
这是fortran代码:

program product_test
    INTEGER :: N,N_count,i,j,k,nc
    REAL*8 :: t1,t2
    REAL*8,dimension (:,:), allocatable :: a,b,c

    N = 200
    N_count = 10

    allocate ( a(N,N) )
    allocate ( b(N,N) )
    allocate ( c(N,N) ) 

    call RANDOM_NUMBER(a)
    call RANDOM_NUMBER(b)

    print *, 'Matrix Multiplication: C = A * B for size (',N,',',N,')'
    call CPU_TIME ( time_begin )
    do nc=1,N_count
        c = MATMUL(a,b)
    end do
    call CPU_TIME ( time_end )
    t2 = (time_end - time_begin)/N_count
    print *, 'Time of operation was ', t2, ' seconds'

end

这是输出:

Matrix Multiplication: C = A * B for size ( 200 , 200 )
Time of operation was 9.3749E-003 seconds

这是python 3代码:

import numpy as np
import time

N = 200
N_count = 10

a = np.random.rand(N,N)
b = np.random.rand(N,N)
c = np.zeros([N,N], dtype = float)


print('Matrix product in python (using numpy): c= a*b for size (',N,',',N,')')
start_time = time.time()
for nc in range(N_count):
    c = a@b
t2 = (time.time() - start_time)/N_count
print('Elapsed time = ',t2,'s')

这是输出:

Matrix product in python (using numpy): c= a*b for size ( 200 , 200 )
Elapsed time = 0.0031252 s

**附加测试。**根据“roygvib”和“Vladimir F”的评论，我已经用blas/lapack进行了测试: gfortran test.f -lopenblas -o test.exe或 gfortran test.f -ffast-math -o test.exe或 gfortran test.f -lblas -o test.exe或 gfortran test.f -llapack -o test.exe给我 的计算时间0.0063s 用于大小为 ( 200 x 200 ) 的方阵的矩阵乘法。
不幸的是，我删除了以前版本的 mingw，新的测试是在 GNU Fortran 下执行的(x86_64-posix-seh-rev0，由 MinGW-W64 项目 8.1.0 构建)。可能是我做错了什么，因为 -llapack 之间没有区别, -lblas , -lopenblas .对于时间测量，我使用了 SYSTEM_CLOCK正如“弗拉基米尔 F”所建议的那样。
现在，它更好了，但 numpy 仍然比 fortran 快(不是三倍而是两倍)。
跟随“Vladimir F”的最后一条评论，我发现与Python不同，Fortran主要使用一个逻辑核心(我的PC上有4个逻辑核心，带有intel i3 CPU)。因此，这是我的PC(Windows8.1)上未正确配置MinGW的问题。

最佳答案

使用 MATMUL或外部库，如 BLAS对于 Fortran 中的矩阵乘法，我们有很多关于矩阵乘法性能的问题

Fortran matrix multiplication performance in different optimization
performance of fortran matrix operations
How does BLAS get such extreme performance?

你应该先阅读它们。你永远不应该在一个简单的 for 循环中进行矩阵乘法，这总是很慢。矩阵乘法有特殊的算法。它们以有效的方式使用内存带宽，并使用矢量化指令(通常直接用汇编编写)。

许多 Fortran 编译器将允许您直接通过 MATMUL 调用 BLAS xGEMM。在 gfortran 中可以使用 -fexternal-blas roygvib 提到的。如果您对此有疑问，请直接调用 DGEMM。

某些 BLAS 实现能够使用多个线程。如果你尝试，你 绝不能使用 CPU_TIME 来测量速度，您必须使用 SYSTEM_CLOCK 或替代方法。

此外，您没有报告使用任何优化标志，如 -O3 .除非优化的外部库完成所有工作，否则这些对于任何体面的性能都是必要的。

关于python - 有没有办法提高在 Windows 下使用 Fortran 中数组的速度，比如 Python numpy？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/61089510/

26

4

0

文章推荐： r - 通过添加 0 扩展数据框

文章推荐： function - 调用函数时声明参数名称

文章推荐： c# - 为什么 typeof(T) != instance.getType()？

performance - 提高 FOR 循环的性能
我正在比较工作簿中的工作表。该工作簿有两张名为 PRE 和 POST 的工作表，每张工作表都有相同的 19 列。行数每天都不同，但特定一天的两张表的行数相同。该宏将 PRE 工作表中的每一行与 POS
JavaScript:提高 FOR 循环的性能以阻止浏览器锁定？
我有一个对象数组，我一次循环遍历该数组一个对象，然后进行几次检查以查看该数组中的每个对象是否满足特定条件，如果该对象满足此条件，则复制一个属性将此对象放入数组中(该属性还包含另一个对象)。 for(v
c++ - 提高 += 运算符性能
我正在编写一个必须非常快的应用程序。我使用 Qt 5.5 和 Qt Creator，Qt 的 64 位 MSVC2013 编译版本。我使用非常困倦的 CS 来分析我的应用程序，我看到占用最多独占时间
java - 提高 for-each 性能
我有以下 CountDownTimer 在我的 Android 应用程序中不断运行。 CountDownTimer timer_status; timer_status = new CountDown
python - 提高 sklearn 中随机森林回归器的性能
有一个优化问题，我必须调用随机森林回归器的预测函数数千次。 from sklearn.ensemble import RandomForestRegressor rfr = RandomForestR
.net - 提高 nHibernate 数据访问层的性能
我正在努力提高现有 Asp.Net Web 应用程序的数据访问层的性能。场景是。它是一个基于 Web 的 Asp.Net 应用程序。数据访问层使用 NHibernate 1.2 构建并作为 WCF
video - 提高 ffmpeg 视频捕获性能？
我在我的 Intel Edison 上运行 Debian，并尝试使用 ffmpeg 通过 USB 网络摄像头捕获视频。我正在使用的命令是: ffmpeg -f video4linux2 -i /dev
performance - 提高 VBA 中的循环效率
我有一个 For循环遍历整数 1 到 9 并简单地找到与该整数对应的最底部的条目(即 1,1,1,2,3,4,5 将找到第三个“1”条目)并插入一个空白行。我将数字与仅对应于此代码的应用程序的字符串“
sql - 提高 Postgresql 查询的性能
我有一个带有非规范化架构(1 个表)的 postgresql 数据库，其中包含大约 400 万个条目。现在我有这个查询: SELECT count(*) AS Total, (SELECT c
coq - 提高 coq 策略的失败级别
在 Ltac 中实现复杂的策略时，有一些 Ltac 命令或策略调用我预计会失败以及预期失败(例如终止 repeat 或导致回溯)。这些故障通常在故障级别 0 时引发。更高级别引发的故障“逃避”周
performance - 提高 Ansible 性能
我正在尝试提高 ansible playbook 的性能。我有一个测试剧本如下: --- - name: Test hosts: localhost connection: local g
reactjs - 提高 axios 获取下载速度
我正在使用 axios从 Azure 存储 Blob 下载文件 (~100MB)。 axios({ method: 'get', url: uri, onDownloadProgress:
performance - 提高 ClojureScript 程序的性能
我有一个 ClojureScript 程序，主要对集合执行数学计算。它是在惯用的、独立于主机的 Clojure 中开发的，因此很容易对其进行基准测试。令我惊讶的是(与答案对 Which is fast
performance - 提高 jetty 性能
我有一个程序必须在硬件允许的情况下尽快发出数千个 http 请求。在现实世界中，这些连接中的每一个都将连接到一个离散的服务器，但我已经编写了一个测试程序来帮助我模拟负载(希望如此)。我的程序使用 A
performance - 提高 Fortran 代码性能的提示和技巧
就目前而言，这个问题不适合我们的问答形式。我们希望答案得到事实、引用资料或专业知识的支持，但这个问题可能会引发辩论、争论、投票或扩展讨论。如果您觉得这个问题可以改进并可能重新打开，visit the
performance - 提高 Clojure 中点云边界框计算的性能
我正在计算 Clojure 中 3d 点云的边界框。点云表示为 Java 原始浮点数组，点云中的每个点都使用 4 个浮点存储，其中最后一个浮点未使用。像这样: [x0 y0 z0 u0 x1 y1
performance - 提高 magento 性能的最佳步骤是什么？
就目前而言，这个问题不适合我们的问答形式。我们希望答案得到事实、引用或专业知识的支持，但这个问题可能会引起辩论、争论、投票或扩展讨论。如果您觉得这个问题可以改进并可能重新打开，visit the he
r - 提高 R 光线着色器图像的分辨率
我正在尝试使用rayshader 包制作图像。我很高兴能够使用如下代码创建一个 png 文件: library(ggplot2) library(rayshader) example_plot <-
jquery - 提高 jQuery 模板性能
更新显然，jQuery 模板可以被编译，并且它有助于显示带有 if 语句的模板的性能 here . 但是如图here ，预编译的 jQuery 模板对我的情况没有多大作用，因为我的模板不包含逻辑
iphone - 提高 ScrollView 的性能
我是编程新手。我有一个启用分页的 ScrollView ，其中包含许多页面(最多十个)，并且在每个页面上都有一个自定义按钮。每个自定义按钮都有一个自定义图像。我在 Interface Builder

首页

博学

6Ren·AI

商城

python - 有没有办法提高在 Windows 下使用 Fortran 中数组的速度，比如 Python numpy？