arrays - 什么是 'Ruby way' 来识别哈希中的重复值？-6ren

arrays - 什么是 'Ruby way' 来识别哈希中的重复值？

转载作者：行者123 更新时间：2023-12-04 00:52:50

25

4

我在 macOS Catalina 上使用 Ruby 2.7.x。

我有多达 100 万个键值元组。键是字符串并且保证是唯一的。这些值是字符串，可能包含重复项(或一式三份或更多)。鉴于键的唯一性，散列似乎是它们的自然数据结构。所以如果我从包含所有键值元组的 original_hash 开始，我想以 uniques_hash 结束，它包含所有且仅包含唯一的键值元组，和 duplicates_hash，包含所有具有重复值的键。

与内存效率或速度相比，我对优化清晰度和 Ruby 惯用语更感兴趣 - 我不希望经常运行此代码，而且我有足够的 RAM。

如果我转换为两个数组，我可以在值数组中找到唯一值——但我如何保证使用正确的 key 重新配对？这是解决这个问题的正确方法吗？

非常感谢您的帮助!

最佳答案

假设

original_hash = {:a=>1, :b=>2, :c=>2, :d=>2, :e=>3, :f=>4, :g=>4}

如果您只对返回哈希值感兴趣 uniques_hash包含唯一值，您可以编写以下内容。

uniques_hash = original_hash.invert.invert
  #=> {:a=>1, :d=>2, :e=>3, :g=>4}

中间步骤是

original_hash.invert
  #=> {1=>:a, 2=>:d, 3=>:e, 4=>:g}

参见 Hash#invert .注意 uniques_hash ，正如定义的那样，它本身并不是唯一的。它可以是以下任何一项。

{:a=>1, :b=>2, :e=>3, :f=>4}
{:a=>1, :b=>2, :e=>3, :g=>4}
{:a=>1, :c=>2, :e=>3, :f=>4}
{:a=>1, :c=>2, :e=>3, :g=>4}
{:a=>1, :d=>2, :e=>3, :f=>4}
{:a=>1, :d=>2, :e=>3, :g=>4}

另一种方法是使用 Enumerable#uniq和 Array#to_h .

unique_hash = original_hash.uniq(&:last).to_h
  #=> {:a=>1, :b=>2, :e=>3, :f=>4}

中间计算是

original_hash.uniq(&:last)
  #=> [[:a, 1], [:b, 2], [:e, 3], [:f, 4]]

这是

的简写

original_hash.uniq { |_k,v| v }

据推测，duplicates_hash 的每个键是 original_hash 中的一个值该键的值是这些键的数组 k在 original_hash为此 original_hash[k] == v .

一种计算duplicates_hash的方法如下。

duplicates_hash = original_hash.each_with_object({}) do |(k,v),h|
  h[v] = (h[v] || []) << k
end
  #=> {1=>[:a], 2=>[:b, :c, :d], 3=>[:e], 4=>[:f, :g]}

这样写也可以

duplicates_hash = original_hash.
  each_with_object(Hash.new { |h,k| h[k] = [] }) { |(k,v),h| h[v] << k }
  #=> {1=>[:a], 2=>[:b, :c, :d], 3=>[:e], 4=>[:f, :g]}

参见 Hash::new .两种形式都等同于

duplicates_hash = original_hash.each_with_object({}) do |(k,v),h|
  h[v] = [] unless h.key?(v)
  h[v] << k
end

将 block 变量写为 |(k,v),h|利用array decomposition .

我们有一个枚举器，它将生成值并将它们传递给它的 block 。

enum = original_hash.each_with_object({})
  #=> #<Enumerator: {:a=>1, :b=>2, :c=>2, :d=>2, :e=>3, :f=>4, :g=>4}:
  #     each_with_object({})>

枚举器是 Enumerator 类的实例.

生成枚举器的第一个值，并为 block 变量赋值，如下所示:

(k,v),h = enum.next
  #=> [[:a, 1], {}]

可以看到数组分解将这个包含两个元素的数组拆分如下:

k #=> :a 
v #=> 1 
h #=> {}

注意左边的括号是如何对应于右边的内括号的。然后使用这些变量执行 block 计算。

h[v] = (h[v] || []) << k
  #=> [:a]

现在，

h #=> {1=>[:a]}

然后由枚举器生成下一个值并执行分 block 计算。

(k,v),h = enum.next
  #=> [[:b, 2], {1=>[:a]}] 
k #=> :b 
v #=> 2 
h #=> {1=>[:a]} 
h[v] = (h[v] || []) << k

现在

h #=> {1=>[:a], 2=>[:b]}

这一直持续到

enum.next
  #=> Stop Interation (exception)

导致 Ruby 返回 h 的值.

请注意，通过计算 duplicates_hash首先我们可以计算uniques_hash如下。

keeper_keys = duplicates_hash.values.map(&:first)
  #=> [:a, :b, :e, :f] 
unique_keys = original_hash.slice(*keeper_keys)
  #=> {:a=>1, :b=>2, :e=>3, :f=>4}

或

unique_keys = original_hash.slice(*duplicates_hash.values.map(&:first))
  #=> {:a=>1, :b=>2, :e=>3, :f=>4}

参见 Hash#slice .如果一个人因为偏爱某些键而感到内疚，那么他可以改写

unique_keys = original_hash.slice(*duplicates_hash.values.map(&:sample))
  #=> {:a=>1, :b=>2, :e=>3, :g=>4}

参见 Array#sample .

关于arrays - 什么是 'Ruby way' 来识别哈希中的重复值？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/65130141/

25

4

0

文章推荐： sql - 在 where 子句中使用 case 语句

文章推荐： arrays - Julia:使用自定义比较器按行对矩阵进行排序

文章推荐： amazon-web-services - Lambda 无权访问 ECR 镜像

文章推荐： parallel-processing - 为什么我会出现这种行为？

arrays - 为什么是 &array != &array[0]？
在 C 中: int a[10]; printf("%p\n", a); printf("%p\n", &a[0]); 产量: 0x7fff5606c600 0x7fff5606c600 这是我所期望
arrays - 替换 Array of Array 中元素的位置
我一直在尝试运行此循环来更改基于数组的元素的位置，但出现以下错误。不太确定哪里出了问题。任何想法或想法!谢谢。 var population = [[98, 8, 45, 34, 56], [9, 1
arrays - Ruby Array of Arrays 按值分组和计数
我正在尝试获取一个 Ruby 数组数组并将其分组以计算其值。数组有一个月份和一个 bool 值: array = [["June", false], ["June", false], ["June"
javascript - array.split ("stop here") array to array of arrays in javascript 数组
所以我们的目标是在遇到某个元素时将数组分割成子数组下面的示例 array.split("stop here") ["haii", "keep", "these in the same array bu
java - Arrays.stream(array) 与 Arrays.asList(array).stream()
在this问题已经回答了两个表达式是相等的，但在这种情况下它们会产生不同的结果。对于给定的 int[] 分数，为什么会这样: Arrays.stream(scores) .forEac
arrays - 我如何制作 Perl "array of arrays of hashes"？
我认为我需要的是哈希数组的数组，但我不知道如何制作它。 Perl 能做到吗？如果是这样，代码会是什么样子？最佳答案 perldoc perldsc是了解 Perl 数据结构的好文档。关于arra
android - GSON 解析 Array in array in array
我遇到了这个问题，从 API 中我得到一个扩展 JSON，其中包含一个名为坐标的对象，该对象是一个包含数组 o 数组的数组。为了更清楚地看这个例子: "coordinates": [
arrays - Postgres JSONB : where clause for arrays of arrays
postgres 中有(v 9.5，如果重要的话): create table json_test( id varchar NOT NULL, data jsonb NOT NULL, PRIM
arrays - bash中echo "${array[@]}"echo "${array[*]}"有什么区别
我用 echo "${array[@]}" 和 echo "${array[*]}" 得到了相同的结果。如果我这样做: mkdir 假音乐； touch fakemusic/{Beatles,Sto
arrays - Array of arrays of typealias 表达式类型不明确，没有更多上下文
我正在尝试创建 typealias 对象的数组数组 - 但我收到“表达式类型不明确，没有更多上下文”编译错误。这是我的代码: typealias TestClosure = ((message: St
python - array.array 与 numpy.array
如果您在 Python 中创建一维数组，使用 NumPy 包有什么好处吗？最佳答案这完全取决于您打算如何处理数组。如果您所做的只是创建简单数据类型的数组并进行 I/O，array模块就可以了。另
arrays - Perl6 : Pushing an array to an array of arrays with one element seems not to work as expected
当我将数组推送到只有一个数组作为其唯一元素的数组数组时，为什么会得到这种数据结构？ use v6; my @d = ( [ 1 .. 3 ] ); @d.push( [ 4 .. 6 ] ); @d.
arrays - 如何从 Array{Array{Int64,2},1} 转换为 Array{Int64,2}
在 Julia 中，我想将定义为二维数组向量的数据转换为二维矩阵数组。如下例所述，我想把数据s转换成数据t，但是至今没有成功。我该如何处理这个案子？ julia> s = [[1 2 3], [4
c - 1[&array] 是 &array[sizeof(array)/sizeof(array[0])] 的合适替代品还是太混淆了？
C 没有elementsof 关键字来获取数组的元素数。所以这通常由计算 sizeof(Array)/sizeof(Array[0]) 代替但这需要重复数组变量名。1[&Array] 是指向数组后第一
arrays - 为什么我可以调用 array.some() 而不是 array.every() 联合数组类型？
所以，假设我有一个像这样的(愚蠢的)函数: function doSomething(input: number|string): boolean { if (input === 42 || in
arrays - 需要的公式 : Sort array to array -"zig-zag"
我有以下数组: a = [1,2,3,4,5,6,7,8,9,10,11,12,13,14,15,16] 我将它用于一些像这样的视觉内容: 1 2 3 4 5 6 7 8 9 10
arrays - Scala:array.toList 与 array.to[List]
我想知道数组中的 .toList 与 .to[List] 之间有什么区别。我在spark-shell中做了这个测试，结果没有区别，但我不知道用什么更好。任何意见？ scala> val l = Arr
arrays - Array.Find和IndexOf用于完全相同对象的多个元素
我很难获得完全相同对象的多个元素的当前元素索引: $b = "A","D","B","D","C","E","D","F" $b | ? { $_ -contains "D" } 替代版本: $b =
arrays - Vuetify : How to do a v-select search in array of arrays
我正在尝试使用来自我的 API 的 v-select 执行 options，我将数据放在数组数组中。 Array which I got from API 它应该是一个带有搜索的 select，因为它
arrays - char *array 和 char array[] 之间的内存区别是什么？
这个问题在这里已经有了答案: String literals: pointer vs. char array (1 个回答) 4 个月前关闭。当我执行下一个代码时 int main() {

首页

博学

6Ren·AI

商城

arrays - 什么是 'Ruby way' 来识别哈希中的重复值？