- c - 在位数组中找到第一个零
- linux - Unix 显示有关匹配两种模式之一的文件的信息
- 正则表达式替换多个文件
- linux - 隐藏来自 xtrace 的命令
我有维数约为 200.000 的稀疏向量。我还有一个矩阵,其列数和行数与向量数相同。我想以增量方式将所有这些设置为矩阵,也就是说,第一个向量应该设置为第一行,依此类推。
目前,矩阵和向量的类型是 scipy.sparse.lil_matrix。使用以下函数将向量设置为矩阵的特定行:
In [7]: us.get_utterance_representation('here is a sentence')
Out[7]:
<1x188796 sparse matrix of type '<type 'numpy.float64'>'
with 22489 stored elements in Compressed Sparse Row format>
def set_row_vector(self, row, rowvector):
self.matrix[row] = rowvector[0]
for row, utterance in enumerate(utterances):
uvector = self.get_utterance_representation(utterance)
self.utterancematrix.add_row_vector(row, uvector)
其中 uvector 是维度为 1x~200.000 的 lil_matrix。
事实证明,以这种方式创建矩阵非常低效,其中一个文本字符串(话语)最多需要 5 秒。查看分析,我得出的结论是将向量设置为矩阵中的一行是主要问题。
55 def set_row_vector(self, row, rowvector):
2564609 function calls (2564606 primitive calls) in 5.046 seconds
Ordered by: internal time
ncalls tottime percall cumtime percall filename:lineno(function)
22489 1.397 0.000 1.397 0.000 {numpy.core.multiarray.where}
22489 0.783 0.000 2.188 0.000 csr.py:281(_get_single_element)
44978 0.365 0.000 0.916 0.000 stride_tricks.py:35(broadcast_arrays)
44978 0.258 0.000 0.413 0.000 stride_tricks.py:22(as_strided)
202490 0.244 0.000 0.244 0.000 {numpy.core.multiarray.array}
22489 0.199 0.000 2.221 0.000 lil.py:280(__setitem__)
44978 0.174 0.000 0.399 0.000 sputils.py:171(_unpack_index)
584777 0.171 0.000 0.171 0.000 {isinstance}
44988 0.170 0.000 0.230 0.000 sputils.py:115(isintlike)
67467 0.166 0.000 0.278 0.000 sputils.py:196(_check_boolean)
22489 0.154 0.000 0.647 0.000 sputils.py:215(_index_to_arrays)
1 0.129 0.129 5.035 5.035 dsm_classes.py:55(set_row_vector)
22489 0.120 0.000 0.171 0.000 lil.py:247(_insertat2)
67467 0.102 0.000 0.102 0.000 {method 'ravel' of 'numpy.ndarray' objects}
我的问题是,有没有更好的方法来完成从话语中创建矩阵?
(谢谢)
最佳答案
首先,我认为您的 uvector
实际上是 CSR 格式,而不是 LIL。然而,这可能是最好的:
In [30]: import scipy.sparse as ss
In [31]: row = ss.rand(1,5000,0.1,'csr')
In [32]: matrix = ss.lil_matrix((30,5000))
In [33]: %timeit matrix[0] = row
10 loops, best of 3: 65.6 ms per loop
In [34]: row_lil = row.tolil()
In [35]: %timeit matrix[0] = row_lil
10 loops, best of 3: 93.4 ms per loop
接下来,您可以通过删除 rowvector
上的 [0]
下标来避免一些开销:
In [38]: %timeit matrix[0] = row[0]
10 loops, best of 3: 104 ms per loop
In [39]: %timeit matrix[0] = row
10 loops, best of 3: 68.7 ms per loop
最后,解决方案的核心是尽可能避免使用 LIL 格式。虽然它是最灵活的格式,但也是最慢的(通常)。例如,如果您只想一次构建一行矩阵,则可以使用 scipy.sparse.vstack
:
In [40]: %%timeit
....: for i in xrange(matrix.shape[0]):
....: matrix[i] = row
....:
1 loops, best of 3: 3.14 s per loop
In [41]: %timeit ss.vstack([row for i in xrange(matrix.shape[0])])
1000 loops, best of 3: 1.46 ms per loop
In [44]: m2 = ss.vstack([row for i in xrange(matrix.shape[0])])
In [45]: numpy.allclose(matrix.todense(), m2.todense())
Out[45]: True
编辑:如果内存是一个问题并且您仍然想要最大速度,您可以根据fast vstack
for CSR matrices 创建自己的vstack
.我将从复制 _compressed_sparse_stack
函数开始,并使用您的 CSR 行列表和 axis = 0
调用它。然后,您应该能够修改它以采用迭代器而不是列表,这将避免高内存开销。或者,您可以将这些步骤内联到您的 for 循环中。无论哪种方式,您都会损失一点速度,但可能会节省大量内存。
关于python - 在 SciPy sparse.lil_matrix 中有效地设置行?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/21462214/
我在使用 cx_freeze 和 scipy 时无法编译 exe。特别是,我的脚本使用 from scipy.interpolate import griddata 构建过程似乎成功完成,但是当我尝试
是否可以通过函数在 scipy 中定义一个稀疏矩阵,而不是列出所有可能的值?在文档中,我看到可以通过以下方式创建稀疏矩阵 There are seven available sparse matrix
SciPy为非线性最小二乘问题提供了两种功能: optimize.leastsq()仅使用Levenberg-Marquardt算法。 optimize.least_squares()允许我们选择Le
SciPy 中的求解器能否处理复数值(即 x=x'+i*x")?我对使用 Nelder-Mead 类型的最小化函数特别感兴趣。我通常是 Matlab 用户,我知道 Matlab 没有复杂的求解器。如果
我有看起来像这样的数据集: position number_of_tag_at_this_position 3 4 8 6 13 25 23 12 我想对这个数据集应用三次样条插值来插值标签密度;为此
所以,我正在处理维基百科转储,以计算大约 5,700,000 个页面的页面排名。这些文件经过预处理,因此不是 XML 格式。 它们取自 http://haselgrove.id.au/wikipedi
Scipy 和 Numpy 返回归一化的特征向量。我正在尝试将这些向量用于物理应用程序,我需要它们不被标准化。 例如a = np.matrix('-3, 2; -1, 0') W,V = spl.ei
基于此处提供的解释 1 ,我正在尝试使用相同的想法来加速以下积分: import scipy.integrate as si from scipy.optimize import root, fsol
这很容易重新创建。 如果我的脚本 foo.py 是: import scipy 然后运行: python pyinstaller.py --onefile foo.py 当我启动 foo.exe 时,
我想在我的代码中使用 scipy.spatial.distance.cosine。如果我执行类似 import scipy.spatial 或 from scipy import spatial 的操
Numpy 有一个基本的 pxd,声明它的 c 接口(interface)到 cython。是否有用于 scipy 组件(尤其是 scipy.integrate.quadpack)的 pxd? 或者,
有人可以帮我处理 scipy.stats.chisquare 吗?我没有统计/数学背景,我正在使用来自 https://en.wikipedia.org/wiki/Chi-squared_test 的
我正在使用 scipy.odr 拟合数据与权重,但我不知道如何获得拟合优度或 R 平方的度量。有没有人对如何使用函数存储的输出获得此度量有建议? 最佳答案 res_var Output 的属性是所谓的
我刚刚下载了新的 python 3.8,我正在尝试使用以下方法安装 scipy 包: pip3.8 install scipy 但是构建失败并出现以下错误: **Failed to build sci
我有 my own triangulation algorithm它基于 Delaunay 条件和梯度创建三角剖分,使三角形与梯度对齐。 这是一个示例输出: 以上描述与问题无关,但对于上下文是必要的。
这是一个非常基本的问题,但我似乎找不到好的答案。 scipy 到底计算什么内容 scipy.stats.norm(50,10).pdf(45) 据我了解,平均值为 50、标准差为 10 的高斯中像 4
我正在使用 curve_fit 来拟合一阶动态系统的阶跃响应,以估计增益和时间常数。我使用两种方法。第一种方法是在时域中拟合从函数生成的曲线。 # define the first order dyn
让我们假设 x ~ Poisson(2.5);我想计算类似 E(x | x > 2) 的东西。 我认为这可以通过 .dist.expect 运算符来完成,即: D = stats.poisson(2.
我正在通过 OpenMDAO 使用 SLSQP 来解决优化问题。优化工作充分;最后的 SLSQP 输出如下: Optimization terminated successfully. (Exi
log( VA ) = gamma - (1/eta)log[alpha L ^(-eta) + 测试版 K ^(-eta)] 我试图用非线性最小二乘法估计上述函数。我为此使用了 3 个不同的包(Sc
我是一名优秀的程序员,十分优秀!