- mongodb - 在 MongoDB mapreduce 中,如何展平值对象?
- javascript - 对象传播与 Object.assign
- html - 输入类型 ="submit"Vs 按钮标签它们可以互换吗?
- sql - 使用 MongoDB 而不是 MS SQL Server 的优缺点
在相对较小的项目中使用 Python 让我体会到这种语言的动态类型特性(无需声明代码来跟踪类型),这通常可以使开发过程更快、更轻松。但是,我觉得在更大的项目中,这实际上可能是一个障碍,因为代码运行速度比说它在 C++ 中的等价物要慢。但是话又说回来,将 Numpy 和/或 Scipy 与 Python 一起使用可能会让您的代码运行得与原生 C++ 程序一样快(其中 C++ 中的代码有时需要更长的时间来开发)。
我在阅读了 Justin Peel 对线程“Is Python faster and lighter than C++?”的评论后发布了这个问题,他在其中指出:“此外,那些说 Python 在处理严重数字时速度很慢的人并没有使用 Numpy 和 Scipy 模块。这些天,Python 在科学计算中真正起飞。当然,速度来自使用用 C 编写的模块或编写的库在 Fortran 中,但在我看来,这就是脚本语言的美妙之处。”或者正如 S. Lott 在关于 Python 的同一线程上所写的那样:“......因为它为我管理内存,所以我不必进行任何内存管理,从而节省了追踪核心泄漏的时间。”我还在“Benchmarking (python vs. c++ using BLAS) and (numpy)”上检查了一个与 Python/Numpy/C++ 相关的性能问题,J.F. Sebastian 写道:“......我的机器上的 C++ 和 numpy 没有区别。”
这两个线程都让我想知道对于使用 Numpy/Scipy 生成软件来分析“大数据”的 Python 程序员来说,了解 C++ 是否有任何真正的优势,其中性能显然非常重要(还有代码可读性和开发速度是必须的)?
注意:我对处理巨大的文本文件特别感兴趣。具有多列的 100K-800K 行的文本文件,Python 可能需要 5 分钟的时间来分析“仅”200K 行长的文件。
最佳答案
首先,如果您的大部分“工作”来自处理巨大的文本文件,这通常意味着您唯一有意义的速度瓶颈是磁盘 I/O 速度,而与编程语言无关。
至于核心问题,“回答”可能意见太丰富了,但我至少可以给你我自己的经验。多年来,我一直在编写 Python 来处理大数据(天气和环境数据)。我从来没有遇到过由于语言而导致的严重性能问题。
开发人员(包括我自己)往往忘记的一点是,一旦流程运行足够快,花时间让它运行得更快就是浪费公司资源。 Python(使用成熟的工具,如 pandas
/scipy
)运行速度足以满足要求,而且它的开发速度很快,所以在我看来,它是一种完全可以接受的“大数据”处理语言。
关于用于大数据分析的 Numpy/Scipy 与纯 C++ 的 Python,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/25049338/
我在使用 cx_freeze 和 scipy 时无法编译 exe。特别是,我的脚本使用 from scipy.interpolate import griddata 构建过程似乎成功完成,但是当我尝试
是否可以通过函数在 scipy 中定义一个稀疏矩阵,而不是列出所有可能的值?在文档中,我看到可以通过以下方式创建稀疏矩阵 There are seven available sparse matrix
SciPy为非线性最小二乘问题提供了两种功能: optimize.leastsq()仅使用Levenberg-Marquardt算法。 optimize.least_squares()允许我们选择Le
SciPy 中的求解器能否处理复数值(即 x=x'+i*x")?我对使用 Nelder-Mead 类型的最小化函数特别感兴趣。我通常是 Matlab 用户,我知道 Matlab 没有复杂的求解器。如果
我有看起来像这样的数据集: position number_of_tag_at_this_position 3 4 8 6 13 25 23 12 我想对这个数据集应用三次样条插值来插值标签密度;为此
所以,我正在处理维基百科转储,以计算大约 5,700,000 个页面的页面排名。这些文件经过预处理,因此不是 XML 格式。 它们取自 http://haselgrove.id.au/wikipedi
Scipy 和 Numpy 返回归一化的特征向量。我正在尝试将这些向量用于物理应用程序,我需要它们不被标准化。 例如a = np.matrix('-3, 2; -1, 0') W,V = spl.ei
基于此处提供的解释 1 ,我正在尝试使用相同的想法来加速以下积分: import scipy.integrate as si from scipy.optimize import root, fsol
这很容易重新创建。 如果我的脚本 foo.py 是: import scipy 然后运行: python pyinstaller.py --onefile foo.py 当我启动 foo.exe 时,
我想在我的代码中使用 scipy.spatial.distance.cosine。如果我执行类似 import scipy.spatial 或 from scipy import spatial 的操
Numpy 有一个基本的 pxd,声明它的 c 接口(interface)到 cython。是否有用于 scipy 组件(尤其是 scipy.integrate.quadpack)的 pxd? 或者,
有人可以帮我处理 scipy.stats.chisquare 吗?我没有统计/数学背景,我正在使用来自 https://en.wikipedia.org/wiki/Chi-squared_test 的
我正在使用 scipy.odr 拟合数据与权重,但我不知道如何获得拟合优度或 R 平方的度量。有没有人对如何使用函数存储的输出获得此度量有建议? 最佳答案 res_var Output 的属性是所谓的
我刚刚下载了新的 python 3.8,我正在尝试使用以下方法安装 scipy 包: pip3.8 install scipy 但是构建失败并出现以下错误: **Failed to build sci
我有 my own triangulation algorithm它基于 Delaunay 条件和梯度创建三角剖分,使三角形与梯度对齐。 这是一个示例输出: 以上描述与问题无关,但对于上下文是必要的。
这是一个非常基本的问题,但我似乎找不到好的答案。 scipy 到底计算什么内容 scipy.stats.norm(50,10).pdf(45) 据我了解,平均值为 50、标准差为 10 的高斯中像 4
我正在使用 curve_fit 来拟合一阶动态系统的阶跃响应,以估计增益和时间常数。我使用两种方法。第一种方法是在时域中拟合从函数生成的曲线。 # define the first order dyn
让我们假设 x ~ Poisson(2.5);我想计算类似 E(x | x > 2) 的东西。 我认为这可以通过 .dist.expect 运算符来完成,即: D = stats.poisson(2.
我正在通过 OpenMDAO 使用 SLSQP 来解决优化问题。优化工作充分;最后的 SLSQP 输出如下: Optimization terminated successfully. (Exi
log( VA ) = gamma - (1/eta)log[alpha L ^(-eta) + 测试版 K ^(-eta)] 我试图用非线性最小二乘法估计上述函数。我为此使用了 3 个不同的包(Sc
我是一名优秀的程序员,十分优秀!