python - 在不转换为列表的情况下随机采样 python 集合

转载作者：行者123 更新时间：2023-11-28 16:33:20

24

4

问题

我花了很多时间阅读有关在 python 中获取随机样本的各种答案，random.sample 似乎是自然且最常见的选择，但我正尝试从一个 python set 对象，并希望能高效地完成它。

由于 python 中非常好的和高效的集合功能(交集、差异等)，我正在使用集合。就我的目的而言，集合是一种非常有效的数据结构，而列表则不是。我有一个算法情况，我在一个集合中有 N 元素，并且可能需要为该集合的每个采样占用任意大小的 N 子样本。该集合的每个子采样都不是完全相同的集合，并且由我必须生成子样本的每个元素的属性定义。下面是一些模糊的代码，展示了算法的复杂性:

main_set = set(...) # Values sourced from elsewhere.
capacity = 20

for element in list:
    potential_values = main_set - element.set # Exclude values already in element
    sample_size = capacity - len(element.set) # Num needed to fill the set to capacity
    new_vals = sample(potential_values, sample_size) # <- insert sampling idea here

    element.set = element.set | new_vals # Union of sample and element set

根据我在网上和一些测试中收集到的信息，random.sample 似乎将 set 转换为 list 对象。 main_set - element.set 的大小，potential_values 几乎总是远大于 element.set 的大小，因此如果 potential_values 必须是在每次采样时转换为一个列表，该算法将极大地影响性能。

那么对于如何使用集合有效地执行此操作，有没有人有任何建议或想法？我感谢任何关于此事的意见，在任何人跳到“过早优化”例程之前，我非常清楚这将要执行的规模以及 O(n) 和 O(n^) 之间的区别2) 相当可观。

澄清编辑:

我特别不关心提供的任何sample()方法的输出。与 potential_values 的大小相比，我从 potential_values 中提取的实际样本较小。相反，所有建议的 sample() 方法都需要类似列表的输入才能工作，这意味着 potential_values 必须首先转换为可索引类型，这正是我想要的避免。

而且我现在意识到我以一种非常模糊的方式提出了大 O 表示法，可能不应该这样做。当我说我想避免 O(n^2) 时，我的意思是我想避免在循环内添加另一个 O(n) 操作。正如有人向我指出的那样，main_set - element.set 与 list(main_set) 具有相同的时间复杂度，因此它已经是 O(n^2)。添加 list 转换使整个算法更像 O(2n^2)，但这些都不重要。

最佳答案

您可以使用heapq.nlargest，它可以接受任何可迭代对象并为其提供随机键以供选择，例如:

import random, heapq

sample = heapq.nlargest(sample_size, your_set, key=lambda L: random.random())

注意 - 这会给你一个 list 对象，所以你需要在必要时转换它......

关于python - 在不转换为列表的情况下随机采样 python 集合，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/29595937/

24

4

0

文章推荐： python - 发布请求 Django REST 框架

文章推荐： php - mybb - 如何检查新的私有(private)消息

文章推荐： javascript - bxSlider - 将 div 放置在 slider + 文本和背景中

java - 在具有多个条件的 If 情况下，我们能否获得条件失败的确切位置？
我是 Java 新手，这是我的代码， if( a.name == b.name && a.displayname == b.displayname && a.linknam
javascript - 在下面的 JavaScript 情况下，如何避免重复自己的情况？
在下面的场景中，我有一个 bool 值。根据结果，我调用完全相同的函数，唯一的区别是参数的数量。 var myBoolean = ... if (myBoolean) { retrieve
c++ - 异常(exception)情况下，我想在没有任何堆栈展开的情况下进行调试
我是一名研究 C++ 的 C 开发人员: 我是否正确理解如果我抛出异常然后堆栈将展开直到找到第一个异常处理程序？是否可以在不展开的情况下在任何 throw 上打开调试器(即不离开声明它的范围或任何更高
c++ - 在什么情况/情况下 dynamic_cast<> 会失败？
在修复庞大代码库中的错误时，我观察到一个奇怪的情况，其中引用的动态类型从原始 Derived 类型更改为 Base 类型!我提供了最少的代码来解释问题: struct Base { // some
c# for 循环在 switch/case 情况下 - 如何？
我正在尝试用 C# 扩展给定的代码，但由于缺乏编程经验，我有点陷入困境。使用 Visual Studio 社区，我尝试通过控制台读出 CPU 核心温度。该代码使用开关/外壳来查找传感器的特定名称(即
javascript - 在 AJAX 情况下，如何在目标页面评估 JavaScript？
这可能是一个哲学问题。假设您正在向页面发出 AJAX 请求(这是使用 Prototype): new Ajax.Request('target.asp', { method:"post", pa
html - 在 Usemap/area 情况下，光标未更改为指针
我有以下 HTML 代码，我无法在所有浏览器中正常工作: 我试图在移动到
swift - 在这种 Firebase 情况下，如何在函数之间传递数据？ swift + Xcode
我对 Swift 很陌生。我如何从 addPin 函数中检索注释并能够在我的 addLocation 操作 (buttonPressed) 中使用它。我正在尝试使用压力触摸在 map 上添加图钉，在两
ios - 在 iPad DetailView 情况下，viewDidUnload 未被调用
我设置了一个详细 View ，我是否有几个 Nib 文件根据在 Root View Controller 的表中选择的项目来加载。我发现，对于 Nibs 的类，永远不会调用 viewDidUnloa
javascript - 在这种 javascript 情况下，除了 eval 之外还有其他选择吗？
我需要动态访问 json 文件并使用以下代码。在本例中，“bpicsel”和“temp”是变量。最终结果类似于“data[0].extit1” var title="data["+bpicsel+"]
c# - 在 HTTPS 情况下，服务器证书未使用 HTTP.SYS 正确配置
我需要使用第三方 WCF 服务。我已经在我的证书存储中配置了所需的证书，但是在调用 WCF 服务时出现以下异常。向 https://XXXX.com/AHSharedServices/Custome
postgresql - 即使在 ON CONFLICT DO NOTHING 情况下，postgres INSERT 触发器也会触发
在几个 SO 答案(1、2)中，建议如果存在冲突则不应触发 INSERT 触发器，ON CONFLICT DO NOTHING 在触发语句中。也许我理解错了，但在我的实验中似乎并非如此。这是我的 S
java - 在 Hibernate3 中的 saveOrUpdateAll 情况下，具有相同标识符值的不同对象已与 session 关联
如果进行修改，则会给出org.hibernate.NonUniqueObjectException。在我的 BidderBO 类(class)中 @Override @Transactional(pr
javascript - 为什么 React App 的 redux 情况下 IndexOf(Object) 可以工作？
我使用 indexOf() 方法来精细地查找数组中的对象。直到此刻我查了一些资料，发现代码应该无法正常工作。我在reducer中尝试了上面的代码，它成功了 let tmp = state.find
mysql - 在指定了 ORDER BY 和 LIMIT 并且实际上只需要连接少量行的 JOIN 情况下，MySQL 的行为如何？
假设我有以下表格: CREATE TABLE Game ( GameID INT UNSIGNED NOT NULL, GameType TINYINT UNSIGNED NOT NU
ios - 在使用 swift ios 的某些 URL 情况下，Alamofire 进度状态显示 0.0
代码: Alamofire.request(URL(string: imageUrl)!).downloadProgress(closure: { (progress) in

首页

博学

6Ren·AI

商城

python - 在不转换为列表的情况下随机采样 python 集合

问题

澄清编辑: