- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我正在尝试完成 itertools.combinations 的 Vectoriced Numpy 版本,我还可以用 @jit (Numba) 对其进行装饰 - 以使其更快。 (我不确定这是否可以做到)
我正在处理的数据集是 1d - np.array,目标是获得 3 组的组合。
x = np.array([1,2,3,4,5])
set(combinations(x, 3))
Result:
{(1, 2, 3),
(1, 2, 4),
(1, 2, 5),
(1, 3, 4),
(1, 3, 5),
(1, 4, 5),
(2, 3, 4),
(2, 3, 5),
(2, 4, 5),
(3, 4, 5)}
我一直在搜索堆栈和其他资源,我确实找到了很多关于这个主题的信息,但没有找到任何关于我的用例的有用信息。
N-D version of itertools.combinations in numpy
这个线程表明可能很难获得比 itertools.combinations 更快的东西:
numba-safe version of itertools.combinations?
我被要求详细说明用例:
我有一个价格数据 np.array price= ([100,101,102,103,104,105 etc..])
我使用 scipy.signal.argrelmax 来查找数组中的所有峰值。 (上图中的红点)
我现在需要获取峰的所有组合。
然后我将对所有组合运行简单线性回归,并寻找某个 r_val 阈值,以验证趋势线。(上图中的绿点)
(3 的组合是因为那时我知道趋势线有 3 次触动。在我发布的插图上它是 4 次触动,所以我同时处理 3 次或 4 次触动。)
(此外,我使用高于/低于趋势线的积分来过滤)
我不需要组合功能。为了返回一组元组,我编写的简单线性回归算法针对 numpy 进行了优化。
最佳答案
itertools.combinations
在 CPython 中是次优,因为它必须为每个组合调用 C 函数,还因为它必须创建一个新的元组。 在 CPython 中调用 C 函数和分配对象有点昂贵。此外,该代码是通用的,但它可以专门用于像您的情况一样想要生成三元组或四元组组合的情况。计算 set
肯定是不需要的,因为如果输入 x
也由排序的唯一项组成。二进制搜索可用于查找数组是否是另一个数组的排列。实际上,在这种情况下,只需对数组进行排序并进行比较即可。 Numba 函数可以生成 Numpy 数组中的所有组合。让我们首先编写一个优化的泛型函数:
import numba as nb
import numpy as np
@nb.njit('(int64, int64)')
def combCount(n, r):
if r < 0:
return 0
res = 1
if r > n - r:
r = n - r
for i in range(r):
res *= (n - i)
res //= (i + 1)
return res
@nb.njit(inline='always')
def genComb_generic(arr, r):
n = arr.size
out = np.empty((combCount(n, r), r), dtype=arr.dtype)
idx = np.empty(r, dtype=np.int32)
for i in range(r):
idx[i] = i
i = r - 1
cur = 0
while idx[0] < n - r + 1:
while i > 0 and idx[i] == n - r + i:
i -= 1
for j in range(r):
out[cur, j] = arr[idx[j]]
cur += 1
idx[i] += 1
while i < r - 1:
idx[i + 1] = idx[i] + 1
i += 1
return out
@nb.njit
def genComb_x3(arr):
return genComb_generic(arr, 3)
@nb.njit
def genComb_x4(arr):
return genComb_generic(arr, 4)
x = np.array([1,2,3,4,5])
genComb_x3(x) # generate triplets based on `x`
genComb_generic
速度很快,尤其是当输出很大时,但是当 r
已知时可以做得更快。这是 r=3
(三元组)的特定情况:
@nb.njit
def genComb_x3(arr):
n = arr.size
nComb = combCount(n, 3)
out = np.empty((nComb, 3), dtype=arr.dtype)
a, b, c = 0, 1, 2
arr_a = arr[a]
arr_b = arr[b]
for cur in range(nComb):
out[cur, 0] = arr_a
out[cur, 1] = arr_b
out[cur, 2] = arr[c]
if c < n - 1:
c += 1
else:
if b < n - 2:
b, c = b + 1, b + 2
arr_b = arr[b]
else:
a, b, c = a + 1, a + 2, a + 3
arr_a = arr[a]
arr_b = arr[b]
return out
当输出相对较大时,与 itertools 相比,最后一个实现非常快。当 x.size
为 30 时,它比 itertools 快 68 倍。当 x.size
为 5 时,它只快了大约 2 倍。这是因为从 CPython 调用 Numba 函数的开销很大(例如 Numpy),更不用说分配输出的时间了。在我的机器 (i5-9600KF) 上,这个开销大约是 800 ns。您可以通过从另一个 Numba 函数调用此类函数来减少很多开销,并在可能的情况下预分配输出。最后,在这种情况下,Numba 函数应该比 itertool 实现快大约 80 倍。
如果您计划生成大量组合,那么最好即时计算它们,而不是生成一个巨大的数组(因为 RAM 往往很慢)。这应该会更快。
关于numpy - itertools.combinations 的矢量化 Numpy (1d) 版本,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/74796108/
关闭。这个问题需要debugging details .它目前不接受答案。 编辑问题以包含 desired behavior, a specific problem or error, and th
我试图用这种形式简单地获取数字 28 integer+space+integer+integer+space+integer我试过这个正则表达式 \\s\\d\\d\\s 但我得到了两个数字11 和
最近一直在学习D语言。我一直对运行时感到困惑。 从我能收集到的关于它的信息中,(这不是很多)我知道它是一种有助于 D 的一些特性的运行时。像垃圾收集一样,它与您自己的程序一起运行。但是既然 D 是编译
想问一下这两个正则表达式有区别吗? \d\d\d 与 \d{3} 我已经在我的本地机器上使用 Java 和 Windows 操作系统对此进行了测试,两者都工作正常并且结果相同。但是,当在 linux
我正在学习 Go,而且我坚持使用 Go 之旅(exercise-stringer.go:https://tour.golang.org/methods/7)。 这是一些代码: type IPAddr
我在Java正则表达式中发现了一段令我困惑的代码: Pattern.compile( "J.*\\d[0-35-9]-\\d\\d-\\d\\d" ); 要编译的字符串是: String string
我在 ruby 代码上偶然发现了这个。我知道\d{4})\/(\d\d)\/(\d\d)\/(.*)/是什么意思,但是\1-\2-\3-\4 是什么意思? 最佳答案 \1-\2-\3-\4 是 b
我一直在努力解决这个问题,这让我很恼火。我了解 D 运行时库。它是什么,它做什么。我也明白你可以在没有它的情况下编译 D 应用程序。就像 XoMB 所做的那样。好吧,XoMB 定义了自己的运行时,但是
我有两个列表列表,子列表代表路径。我想找到所有路径。 List> pathList1 List> pathList2 当然是天真的解决方案: List> result = new ArrayList>
我需要使用 Regex 格式化一个字符串,该字符串包含数字、字母 a-z 和 A-Z,同时还包含破折号和空格。 从用户输入我有02-219 8 53 24 输出应该是022 198 53 24 我正在
目标是达到与this C++ example相同的效果: 避免创建临时文件。我曾尝试将 C++ 示例翻译为 D,但没有成功。我也尝试过不同的方法。 import std.datetime : benc
tl;dr:你好吗perfect forwarding在 D? 该链接有一个很好的解释,但例如,假设我有这个方法: void foo(T)(in int a, out int b, ref int c
有什么方法可以在 D 中使用abstract auto 函数吗? 如果我声明一个类如下: class MyClass { abstract auto foo(); } 我收到以下错误: mai
有没有人为内存中重叠的数组切片实现交集?算法在没有重叠时返回 []。 当 pretty-print (使用重叠缩进)内存中重叠的数组切片时,我想要这个。 最佳答案 如果您确定它们是数组,那么只需取 p
我已经开始学习 D,但我在使用 Andrei Alexandrescu 所著的 The D Programming Language 一书中提供的示例时遇到了一些麻烦。由于 int 和 ulong 类
如何创建一个不可变的类? 我的目标是创建一个实例始终不可变的类。现在我只是用不可变的方法和构造函数创建了一个“可变”类。我将其称为 mData,m 表示可变。然后我创建一个别名 alias immut
不久前我买了《The D Programming Language》。好书,很有教育意义。但是,我在尝试编译书中列出的语言功能时遇到了麻烦:扩展函数。 在这本书中,Andrei 写了任何可以像这样调用
我在 D http://www.digitalmars.com/d/2.0/lazy-evaluation.html 中找到了函数参数的惰性求值示例 我想知道如何在 D 中实现可能的无限数据结构,就像
这个问题在这里已经有了答案: 12 年前关闭。 Possible Duplicate: Could anyone explain these undefined behaviors (i = i++
当前是否可以跨模块扫描/查询/迭代具有某些属性的所有函数(或类)? 例如: source/packageA/something.d: @sillyWalk(10) void doSomething()
我是一名优秀的程序员,十分优秀!