- r - 以节省内存的方式增长 data.frame
- ruby-on-rails - ruby/ruby on rails 内存泄漏检测
- android - 无法解析导入android.support.v7.app
- UNIX 域套接字与共享内存(映射文件)
我正在尝试对非常大的原始非规范化 CSV 表中的列进行规范化。列值是短字符串(10-100 字节)。我正在努力寻找比我目前的方法更快的解决方案。
输入.csv
john,london
jean,paris
bill,london
转换为以下文件:
输入.标准化.csv
1,1
2,2
3,1
输入.col1.csv
1,john
2,jean
3,bill
输入.col2.csv
1,london
2,paris
我目前有两种方法来规范化这些数据集。
单一传递方法,将列 values -> normalized_id
值存储在关联数组中(在我的例子中是 Java HashMap)。这会在某个时候耗尽内存,但是当它可以将所有内容存储在内存中时速度很快。降低内存使用量的一种简单方法是每列执行一次。
基于排序的多 channel 方法。列值附加它们的行号,然后进行排序(以内存高效的合并排序方式)。例如,列值 london,paris,london
附有行号,然后进行排序:london;1,london;3,paris;2
。
我现在可以拥有一个“唯一值计数器”,只需将每个值与之前的值进行比较(例如 London == London,因此不要增加唯一值计数器)。最后,我有一对 unique_id,linenum
对,我可以按行号排序以重建规范化列。然后可以一次合并列。
这种方法可以在非常有限的内存中完成,具体取决于所应用的排序算法的内存使用情况。好消息是这种方法很容易在 hadoop 之类的东西中实现,利用它的分布式排序步骤。
与单遍方法(或每列单遍方法)相比,多遍方法慢得令人痛苦。所以我想知道优化该方法的最佳方法是什么,或者是否有人可以建议替代方法?
我想我正在寻找某种(分布式)键值存储,它的内存使用率尽可能低。
在我看来,使用 Trove 将是使用 Java HashMap 的一种很好、简单的替代方法,但我想要一些可以为我处理 key 分配的东西。
Redis 可能是一个不错的选择,但我对它的每个键值对的内存使用情况并不满意。
最佳答案
您知道输入列的大致数量级吗?如果是这样,您不需要保留原始输入文件顺序吗?然后您可以使用足够大的哈希函数来避免输入键的冲突。
如果您坚持要有一个密集的连续键空间,那么您已经涵盖了两个主要选择。您当然可以尝试使用 Redis,我已经看到它用于数以千万计的键值对,但它可能不会超出此范围。你也可以试试 memcached。它的内存开销可能比 Redis 略低,但我肯定会尝试两者,因为它们在这种特定用途上非常相似。您实际上不需要 Redis 的高级数据结构。
如果您需要的键值比单台机器内存中存储的更多,您可以回退到 BDB 或 Kyoto cabinet 之类的东西,但最终这一步将成为处理的瓶颈。另一个危险信号是,如果您可以在一台机器上的内存中容纳整个列,那么您为什么要使用 Hadoop?
老实说,依赖密集有序的主键是在 NoSQL 数据库中首先被抛弃的事情之一,因为它假设有一个协调的主控。如果您甚至可以允许一些间隙,那么您可以做类似于 vector 时钟的事情。
最后一个替代方案是使用 map-reduce 作业来按键收集所有重复值,然后使用一些外部事务数据库计数器分配一个唯一值。然而,map-reduce 作业本质上是一种多遍方法,因此它可能更糟。主要优点是您将获得一些 IO 并行性。 (虽然id赋值仍然是一个串行事务。)
关于java - 内存高效的分布式方法来确定唯一值?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/23007984/
我正在使用 Selenium Web 驱动程序 3.0,并且想要从打开的两个对话框(一个在后台,第二个在前台)的 Activity 对话框中单击“确定”按钮。如何从 html 下面的父 div 单击前
actions: [ FlatButton( onPressed: () {
我有一个问题有点超出我的范围(我真的很高兴我是 Beta)涉及重复项(所以 GROUP BY, HAVING, COUNT),通过将解决方案保留在 SQLite 附带的标准函数中而变得更加复杂。我正在
使用DBI是否可以确定SELECT语句的已执行语句句柄是否返回任何行而不从中获取行? IE。就像是: use DBI; ... my $sth = $dbh->prepare("SELECT ..."
是否可以为“确定”和“关闭”按钮指定回调函数? 如果是JQuery Modal,则可以在初始化时使用按钮字典指定回调函数。 Semantic-ui模态是否提供类似的功能?按下确定后,我该如何寻求其他逻
我想阅读警报中的消息。 示例:如果警报显示“错误的电子邮件地址”。怎么读呢?意味着我想将该消息存储在字符串中。 如何在“警报”中单击“确定”...?? 如何使用 Selenium 来做到这一点? 最佳
我有一个删除按钮: 我试图首先查明是否已选择一个网站,如果已选择一个网站,我需要确定是否已选择一个或多个列表项,如果是,则继续删除这些项目。 我的 if 语句不断返回“您必须首先选择您的列表”,即使它
部分出于好奇——我们想知道在我们的应用程序中发生了什么——部分是因为我们需要在我们的代码中找到一些潜在的问题,我喜欢在我们的网络应用程序运行时跟踪一些一般值。这尤其包括某些对象图的分配内存。 我们的应
我将 SweetAlert 与 Symfony 结合使用,我希望用户在完成删除操作之前进行确认。 发生的情况是,当用户单击删除按钮时,SweetAlert 会弹出,然后立即消失,并且该项目被删除。 在
我们有一个应用程序可以生成不包括字母 O 的随机基数 35 [0-9A-Z]。我正在寻找一种解决方案来查找包含任何淫秽英语单词的代码,而无需搜索包含 10,000 个条目的列表每个生成的代码。每秒生成
这是我做的: #include #include int betweenArray(int a, int b){ int *arr,i,range; range = b - a +
我知道如何创建 警报和确认框,但我不知道如何做的是实际单击“确定”。我有一个弹出确认框的页面。 我想使用 Java Script 插件单击“确定”。基本上,我希望我的代码单击页面上的链接,然后在出现提
代码: swal('Your ORDER has been placed Successfully!!!'); window.location="index.php"; 甜蜜警报工
>>> import re >>> s = "These are the words in a sentence" >>> regex = re.compile('are|words') >>> [m
使用确定的理想散列函数给出随机期望线性时间算法两个数组 A[1..n] 和 B[1..n] 是否不相交,即 A 的元素是否也是 B 的元素。 谁能告诉我如何做到这一点,甚至如何开始考虑它? 最佳答案
我在计算机科学课上有这段代码: int input=15; while (input < n ) { input = input *3;} 这段代码有 log3(n/15) 次循环的上限。我们怎样才能
我有一个允许 2 位玩家玩 TicTacToe 的程序。在每个玩家移动之后,它应该在那个点显示棋盘并返回一个名为 Status 的枚举,显示玩家是否应该继续,如果玩家赢了,还是平局。但是,该算法要么返
给定一个 y 值数组,例如 [-3400, -1000, 500, 1200, 3790],我如何确定“好的”Y 轴标签并将它们放置在网格上? ^ ---(6,000)-|---
假设我有一个检查用户登录的 SQL 语句: SELECT * FROM users WHERE username='test@example.com', password='abc123', expi
teradata中有返回表中哪一列被定义为主索引的命令吗?我没有制作一些我正在处理的表,也没有尝试优化我对这些表的连接。谢谢! 最佳答案 有dbc.IndicesV,其中IndexNumber=1表示
我是一名优秀的程序员,十分优秀!