python - 没有 View 的切片(或 : shuffling multiple arrays)-6ren

python - 没有 View 的切片(或 : shuffling multiple arrays)

转载作者：太空宇宙更新时间：2023-11-04 05:28:49

25

4

我有两个不同的 numpy 数组，我想以异步方式打乱它们。

当前解决方案取自https://www.tensorflow.org/versions/r0.8/tutorials/mnist/pros/index.html并进行如下操作:

perm = np.arange(self.no_images_train)
np.random.shuffle(perm)
self.images_train = self.images_train[perm]
self.labels_train = self.labels_train[perm]

问题是每次我这样做都会使内存翻倍。不知何故，旧数组没有被删除，我猜可能是因为切片运算符创建了 View 。出于纯粹的绝望，我尝试了以下更改:

perm = np.arange(self.no_images_train)
np.random.shuffle(perm)

n_images_train = self.images_train[perm]
n_labels_train = self.labels_train[perm]            

del self.images_train
del self.labels_train
gc.collect()

self.images_train = n_images_train
self.labels_train = n_labels_train

还是一样，内存泄漏，几次操作后内存不足。

顺便说一句，这两个数组的等级分别为 100000,224,244,1 和 100000,1。

我知道这已在此处处理(Better way to shuffle two numpy arrays in unison)，但答案对我没有帮助，因为提供的解决方案需要再次切片。

感谢您的帮助。

最佳答案

以同步方式就地置换两个大数组的一种方法是保存随机数生成器的状态，然后打乱第一个数组。然后恢复状态并对第二个数组进行洗牌。

例如，这是我的两个数组:

In [48]: a
Out[48]: array([ 0,  1,  2,  3,  4,  5,  6,  7,  8,  9, 10, 11, 12, 13, 14, 15])

In [49]: b
Out[49]: array([ 0,  1,  2,  3,  4,  5,  6,  7,  8,  9, 10, 11, 12, 13, 14, 15])

保存随机数生成器当前的内部状态:

In [50]: state = np.random.get_state()

就地随机播放a:

In [51]: np.random.shuffle(a)

恢复随机数生成器的内部状态:

In [52]: np.random.set_state(state)

就地随机播放 b:

In [53]: np.random.shuffle(b)

检查排列是否相同:

In [54]: a
Out[54]: array([13, 12, 11, 15, 10,  5,  1,  6, 14,  3,  9,  7,  0,  8,  4,  2])

In [55]: b
Out[55]: array([13, 12, 11, 15, 10,  5,  1,  6, 14,  3,  9,  7,  0,  8,  4,  2])

对于您的代码，这看起来像:

state = np.random.get_state()
np.random.shuffle(self.images_train)
np.random.set_state(state)
np.random.shuffle(self.labels_train)

关于python - 没有 View 的切片(或 : shuffling multiple arrays)，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/37820345/

25

4

0

文章推荐： c - 在 C 中打印字节字符

文章推荐： asp.net - CSS 友好并升级到 ASP.NET 4.0

文章推荐： php - 使用 jQuery 的配置文件背景自定义？

文章推荐： css - Compass/Blurprint 的 +clearfix 究竟做了什么？

Java 数组算法，将 shuffle 类型从 "in-shuffle"交换到 "out-shuffle"时出错
我正在尝试复制以下 while 循环，但它们交错我的“卡片”的方式有所不同。这是我当前有效的 while 循环，我的目标是重新创建此循环，但颠倒两个 card_force 数组的顺序: while
apache-spark - Spark : Difference between Shuffle Write, Shuffle 溢出(内存)，Shuffle 溢出(磁盘)？
我有以下 Spark 作业，试图将所有内容保留在内存中: val myOutRDD = myInRDD.flatMap { fp => val tuple2List: ListBuffer[(St
tensorflow 数据集 shuffle 然后批处理或批处理然后 shuffle
我最近开始学习 tensorflow。我不确定是否有区别 x = np.array([[1],[2],[3],[4],[5]]) dataset = tf.data.Dataset.from_ten
shuffle - 使用最新spark版本时如何设置spark.sql.shuffle.partitions
我想重置 pyspark 代码中的 spark.sql.shuffle.partitions 配置，因为我需要加入两个大表。但是以下代码在最新的spark版本中不起作用，错误说“xxx中没有方法“se
java - mapreduce.reduce.shuffle.memory.limit.percent、mapreduce.reduce.shuffle.input.buffer.percent 和 mapreduce.reduce.shuffle.merge.percent
我只是想验证我对这些参数及其关系的理解，如果我错了请通知我。 mapreduce.reduce.shuffle.input.buffer.percent 告诉分配给 reducer 的整个洗牌阶段的内
javascript - 如何让 PHP shuffle 结果在整个 shuffle 过程中一次显示一个
假设我的数据库中有 10 个项目正在尝试洗牌，我如何更改当前的代码，以便每次从数据库中提取一个名称时，一次显示一个名称，而不是全部显示一次？ $con = mysqli_connect("XXX",
【Flink】Flink Remote Shuffle 开源：面向流批一体与云原生的 Shuffle 服务
1.概述转载：Flink Remote Shuffle 开源：面向流批一体与云原生的 Shuffle 服务 2.开源作为支持 Flink 流批一体与云原生的重要组成部分，Flink Remote
javascript - 确保 JavaScript 中 shuffle 后的第一个元素与上一次 shuffle 中的最后一个元素不同
这个 fiddle 演示了我的问题:https://jsfiddle.net/petebere/fhg84je2/ 我想确保每次用户单击按钮时都会显示数组中的随机元素。问题是，有时进行新的混洗时，新混
javascript - 尝试使用 Shuffle.js 但出现 Uncaught TypeError : Shuffle is not a constructor
对于那些了解情况的人来说，这应该是一个足够简单的问题 - 为什么我会在控制台中收到此错误？我尝试按照 Shuffle homepage 上“用法”下显示的代码进行操作但我认为该页面忽略了包含开始使用该
scala - Apache Spark 中的 shuffle read 和 shuffle write 是什么
在下面的 Spark admin 在端口 8080 上运行的屏幕截图中: 此代码的“随机读取”和“随机写入”参数始终为空: import org.apache.spark.SparkContext;
java - java.util.Collections.shuffle(List list) 可以按照与 "sent to be shuffled"相同的顺序返回列表吗？
docs说“所有排列的发生概率大致相等。”但我不知道这是否包括返回相同订单的可能性(无论多么小)。我有一个方法(见下文)，在两次测试运行期间，列表以原始顺序返回，也许……其他因素可能有问题，比如可能已
apache-spark - Spark shuffle 错误 org.apache.spark.shuffle.FetchFailedException : FAILED_TO_UNCOMPRESS(5)
我有一份处理大量数据的工作。此作业经常运行而没有任何错误，但偶尔会引发此错误。我正在使用 Kyro Serializer。我正在使用 yarn 集群运行 Spark 1.2.0。完整的堆栈跟踪在这
memory-management - org.apache.spark.shuffle.MetadataFetchFailedException : Missing an output location for shuffle? 的可能原因是什么
我正在 EC2 集群上部署 Spark 数据处理作业，该作业对于集群来说很小(16 个核心，总共 120G RAM)，最大的 RDD 只有 76k+ 行。但是中间严重倾斜(因此需要重新分区)并且每
apache-spark - 当 shuffle 分区大于 200 时会发生什么(数据帧中的 spark.sql.shuffle.partitions 200(默认情况下))
打乱数据的 spark sql 聚合操作，即 spark.sql.shuffle.partitions 200(默认情况下)。当 shuffle partition 大于 200 时，性能会发生什么变
apache-spark - 当 shuffle 分区大于 200 时会发生什么(数据帧中的 spark.sql.shuffle.partitions 200(默认情况下))
打乱数据的 spark sql 聚合操作，即 spark.sql.shuffle.partitions 200(默认情况下)。当 shuffle partition 大于 200 时，性能会发生什么变
python - 为什么 random.shuffle(list(range(n))) 有效，但 random.shuffle(range(n)) 无效？
当在 Python 3 中使用 random 模块 random.shuffle(list(range(n))) 时，但是 random.shuffle(range( n)) 没有。为什么会这样？
python - ValueError : Setting a random_state has no effect since shuffle is False. 您应该将 random_state 保留为其默认值(无)，或设置 shuffle=True
当我尝试在 pycaret 中训练某些东西时，我收到此错误消息 ValueError: Setting a random_state has no effect since shuffle is Fa
apache-spark - 为什么 Spark 作业失败并出现 org.apache.spark.shuffle.MetadataFetchFailedException : Missing an output location for shuffle 0 in speculation mode?
我正在以推测模式运行 Spark 作业。我有大约 500 个任务和大约 500 个 1 GB gz 压缩文件。我不断地进入每项作业，对于 1-2 个任务，附加错误，然后它会重新运行数十次(阻止作业完成
模板中的django shuffle
作为Django中关键字云函数的一部分，我正在尝试输出字符串列表。是否有模板过滤器，可让您随机播放列表中的项目？我认为这很简单，但是我在官方文档中找不到任何适用的过滤器。最佳答案制作自己的东西很简
shuffle - 混洗有偏差的随机数
同时思考this问题并与参与者交谈后，出现了这样的想法:对一组有限的明显有偏见的随机数进行洗牌，使它们变得随机，因为你不知道它们被选择的顺序。这是真的吗？如果是的话，有人可以指出一些资源吗？编辑:我

首页

博学

6Ren·AI

商城

python - 没有 View 的切片(或 : shuffling multiple arrays)