- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我花了很多时间阅读有关在 python 中获取随机样本的各种答案,random.sample
似乎是自然且最常见的选择,但我正尝试从一个 python set
对象,并希望能高效地完成它。
由于 python 中非常好的和高效的集合功能(交集、差异等),我正在使用集合。就我的目的而言,集合是一种非常有效的数据结构,而列表则不是。我有一个算法情况,我在一个集合中有 N
元素,并且可能需要为该集合的每个采样占用任意大小的 N
子样本。该集合的每个子采样都不是完全相同的集合,并且由我必须生成子样本的每个元素的属性定义。下面是一些模糊的代码,展示了算法的复杂性:
main_set = set(...) # Values sourced from elsewhere.
capacity = 20
for element in list:
potential_values = main_set - element.set # Exclude values already in element
sample_size = capacity - len(element.set) # Num needed to fill the set to capacity
new_vals = sample(potential_values, sample_size) # <- insert sampling idea here
element.set = element.set | new_vals # Union of sample and element set
根据我在网上和一些测试中收集到的信息,random.sample
似乎将 set
转换为 list
对象。 main_set - element.set
的大小,potential_values
几乎总是远大于 element.set
的大小,因此如果 potential_values 必须是在每次采样时转换为一个列表,该算法将极大地影响性能。
那么对于如何使用集合有效地执行此操作,有没有人有任何建议或想法?我感谢任何关于此事的意见,在任何人跳到“过早优化”例程之前,我非常清楚这将要执行的规模以及 O(n) 和 O(n^) 之间的区别2) 相当可观。
我特别不关心提供的任何sample()
方法的输出。与 potential_values
的大小相比,我从 potential_values
中提取的实际样本较小。相反,所有建议的 sample()
方法都需要类似列表的输入才能工作,这意味着 potential_values
必须首先转换为可索引类型,这正是我想要的避免。
而且我现在意识到我以一种非常模糊的方式提出了大 O 表示法,可能不应该这样做。当我说我想避免 O(n^2) 时,我的意思是我想避免在循环内添加另一个 O(n) 操作。正如有人向我指出的那样,main_set - element.set
与 list(main_set)
具有相同的时间复杂度,因此它已经是 O(n^2)。添加 list
转换使整个算法更像 O(2n^2),但这些都不重要。
最佳答案
您可以使用heapq.nlargest
,它可以接受任何可迭代对象并为其提供随机键以供选择,例如:
import random, heapq
sample = heapq.nlargest(sample_size, your_set, key=lambda L: random.random())
注意 - 这会给你一个 list
对象,所以你需要在必要时转换它......
关于python - 在不转换为列表的情况下随机采样 python 集合,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/29595937/
我是 Java 新手,这是我的代码, if( a.name == b.name && a.displayname == b.displayname && a.linknam
在下面的场景中,我有一个 bool 值。根据结果,我调用完全相同的函数,唯一的区别是参数的数量。 var myBoolean = ... if (myBoolean) { retrieve
我是一名研究 C++ 的 C 开发人员: 我是否正确理解如果我抛出异常然后堆栈将展开直到找到第一个异常处理程序?是否可以在不展开的情况下在任何 throw 上打开调试器(即不离开声明它的范围或任何更高
在修复庞大代码库中的错误时,我观察到一个奇怪的情况,其中引用的动态类型从原始 Derived 类型更改为 Base 类型!我提供了最少的代码来解释问题: struct Base { // some
我正在尝试用 C# 扩展给定的代码,但由于缺乏编程经验,我有点陷入困境。 使用 Visual Studio 社区,我尝试通过控制台读出 CPU 核心温度。该代码使用开关/外壳来查找传感器的特定名称(即
这可能是一个哲学问题。 假设您正在向页面发出 AJAX 请求(这是使用 Prototype): new Ajax.Request('target.asp', { method:"post", pa
我有以下 HTML 代码,我无法在所有浏览器中正常工作: 我试图在移动到
我对 Swift 很陌生。我如何从 addPin 函数中检索注释并能够在我的 addLocation 操作 (buttonPressed) 中使用它。我正在尝试使用压力触摸在 map 上添加图钉,在两
我设置了一个详细 View ,我是否有几个 Nib 文件根据在 Root View Controller 的表中选择的项目来加载。 我发现,对于 Nibs 的类,永远不会调用 viewDidUnloa
我需要动态访问 json 文件并使用以下代码。在本例中,“bpicsel”和“temp”是变量。最终结果类似于“data[0].extit1” var title="data["+bpicsel+"]
我需要使用第三方 WCF 服务。我已经在我的证书存储中配置了所需的证书,但是在调用 WCF 服务时出现以下异常。 向 https://XXXX.com/AHSharedServices/Custome
在几个 SO 答案(1、2)中,建议如果存在冲突则不应触发 INSERT 触发器,ON CONFLICT DO NOTHING 在触发语句中。也许我理解错了,但在我的实验中似乎并非如此。 这是我的 S
如果进行修改,则会给出org.hibernate.NonUniqueObjectException。在我的 BidderBO 类(class)中 @Override @Transactional(pr
我使用 indexOf() 方法来精细地查找数组中的对象。 直到此刻我查了一些资料,发现代码应该无法正常工作。 我在reducer中尝试了上面的代码,它成功了 let tmp = state.find
假设我有以下表格: CREATE TABLE Game ( GameID INT UNSIGNED NOT NULL, GameType TINYINT UNSIGNED NOT NU
代码: Alamofire.request(URL(string: imageUrl)!).downloadProgress(closure: { (progress) in
我是一名优秀的程序员,十分优秀!