- android - 多次调用 OnPrimaryClipChangedListener
- android - 无法更新 RecyclerView 中的 TextView 字段
- android.database.CursorIndexOutOfBoundsException : Index 0 requested, 光标大小为 0
- android - 使用 AppCompat 时,我们是否需要明确指定其 UI 组件(Spinner、EditText)颜色
我有一堆长弦,必须操纵。它们可以一次又一次地出现,如果它们出现两次,我想忽略它们。我认为执行此操作的最佳方法是对字符串进行哈希处理,并以快速的查找时间将哈希列表存储在某种有序列表中,以便在数据集向我提供新字符串时可以进行比较。
要求:
能够将项目(哈希)添加到我的收藏中
能够(快速)检查集合中是否已存在特定的哈希。
不太占用内存。我最终可能会得到大约100,000个哈希值。
如果那有什么区别,我不需要倒退(键->值)。
关于哪种.NET数据类型最有效的任何建议?
最佳答案
我认为执行此操作的最佳方法是对字符串进行哈希处理,并以快速的查找时间将哈希列表存储在某种有序列表中,以便每当我的数据集给我一个新字符串时就可以进行比较。
不,不要那样做。两个原因:
哈希值仅告诉您两个值是否相同;他们不会告诉您是否相同。
您会做很多已经为您完成的工作。
基本上,您应该只保留一个HashSet<String>
。没问题,可以快速查找,并且您不需要自己实现它。
缺点是您最终会将所有字符串保留在内存中。如果这是一个问题,那么您将需要制定一种替代策略……实际上可能最终只能将哈希保留在内存中。确切的详细信息可能取决于字符串的来源,以及如果得到误报会导致什么样的问题。例如,您可以保留每个字符串的MD5散列,作为“优于hashCode
”散列-但这仍将使攻击者可以向您呈现具有相同散列的另一个字符串。那是问题吗?如果是这样,则更安全的哈希算法(例如SHA-256)可能会有所帮助。但是,它仍然不能保证您为不同的字符串使用不同的哈希值。
如果您确实想确定,则需要将散列保留在内存中,但将实际的字符串数据保留(存储到磁盘或数据库中)-然后,在可能的匹配项中(因为您看到了相同的散列)之前),您需要将存储的字符串与新字符串进行比较。
如果您将哈希存储在内存中,则最佳方法将取决于您使用的哈希大小。例如,对于仅64位哈希,您可以为每个哈希使用Long
并将其保存在HashSet<Long>
中。对于更长的散列,您需要一个可以轻松比较的对象。在这一点上,我建议您查看Guava及其HashCode
类以及中的工厂方法(从Guava v16起不推荐使用) )。HashCodes
关于c# - 我应该使用哪种收集类型来存储一堆哈希值?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/16812751/
我正在尝试在Elasticsearch中返回的值中考虑地理位置的接近性。我希望近距离比某些字段(例如legal_name)重要,但比其他字段重要。 从文档看来,当前的方法是使用distance_fea
我是Elasticsearch的初学者,今天在进行“多与或”查询时遇到问题。 我有一个SQL查询,需要在Elastic中进行转换: WHERE host_id = 999 AND psh_pid =
智能指针应该/可以在函数中通过引用传递吗? 即: void foo(const std::weak_ptr& x) 最佳答案 当然你可以通过const&传递一个智能指针。 这样做也是有原因的: 如果接
我想执行与以下MYSQL查询等效的查询 SELECT http_user, http_req_method, dst dst_port count(*) as total FROM my_table
我用这两个查询进行测试 用must查询 { "size": 200, "from": 0, "query": { "bool": { "must": [ { "mat
我仍在研究 Pro Android 2 的简短服务示例(第 304 页)同样,服务示例由两个类组成:如下所示的 BackgroundService.java 和如下所示的 MainActivity.j
给定标记 like this : header really_wide_table..........................................
根据 shouldJS 上的文档网站我应该能够做到这一点: ''.should.be.empty(); ChaiJS网站没有使用 should 语法的示例,但它列出了 expect 并且上面的示例似乎
我在 Stack Overflow 上读到一些 C 函数是“过时的”或“应该避免”。你能给我一些这种功能的例子以及原因吗? 这些功能有哪些替代方案? 我们可以安全地使用它们 - 有什么好的做法吗? 最
在 C++11 中,可变参数模板允许使用任意数量的参数和省略号运算符 ... 调用函数。允许该可变参数函数对每个参数做一些事情,即使每个参数的事情不是一样的: template void dummy(
我在我从事的项目之一上将Shoulda与Test::Unit结合使用。我遇到的问题是我最近更改了此设置: class MyModel :update end 以前,我的(通过)测试看起来像这样: c
我该如何做 or使用 chai.should 进行测试? 例如就像是 total.should.equal(4).or.equal(5) 或者 total.should.equal.any(4,5)
如果您要将存储库 B 中的更改 merge 到存储库 A 中,是否应该 merge .hgtags 中的更改? 存储库 B 可能具有 A 中没有的标签 1.01、1.02、1.03。为什么要将这些 m
我正在尝试执行X AND(y OR z)的查询 我需要获得该代理为上市代理或卖方的所有已售属性(property)。 我只用 bool(boolean) 值就可以得到9324个结果。当我添加 bool
我要离开 this教程,尝试使用 Mocha、Supertest 和 Should.js 进行测试。 我有以下基本测试来通过 PUT 创建用户接受 header 中数据的端点。 describe('U
我正在尝试为 Web 应用程序编写一些 UI 测试,但有一些复杂的问题希望您能帮助我解决。 首先,该应用程序有两种模式。其中一种模式是“训练”,另一种是“现场”。在实时模式下,数据直接从我们的数据库中
我有一个规范: require 'spec_helper' # hmm... I need to include it here because if I include it inside desc
我正在尝试用这个测试我在 Rails 中的更新操作: context "on PUT to :update" do setup do @countdown = Factory(:count
我还没有找到合适的答案: onclick="..." 中是否应该转义 &(& 符号)? (或者就此而言,在每个 HTML 属性中?) 我已经尝试在 jsFiddle 和 W3C 的验证器上运行转义和非
import java.applet.*; import java.awt.*; import java.awt.event.*; public class Main extends Applet i
我是一名优秀的程序员,十分优秀!