c++ - 这个问题有更好的数据结构和算法选择吗？-6ren

c++ - 这个问题有更好的数据结构和算法选择吗？

转载作者：行者123 更新时间：2023-11-28 04:05:50

25

4

对于以下问题，请提出更好的解决方案(在时间复杂度方面)。我在最后解释了我的方法。

有一个文件包含以下格式的记录:-RecordType;Symbol;price;id;parentId

示例文件看起来像 -

RecordType;Symbol;price;id;parentId

 - A;BANK_X;20;2345;0
 - A;BANK_Y;30;2346;0
 - A;BANK_Z;40;2347;0
 - M;BANK_X;50;2348;2345
 - M;BANK_Y;10;2349;2346 
 - A;BANK_X;20;2350;0 
 - A;BANK_E;40;2351;0 
 - M;BANK_X;45;2352;2345 
 - M;BANK_X;20;2353;2350

这样的文件包含数百万条记录。目标是编写一个高效的 C++ 程序，将文件拆分为多个文件，以便每个较小的文件包含 Y 条记录，其中 Y 是作为输入提供的整数。

要记住的要点:

每条记录都有唯一的 ID(即记录中的倒数第二个字段)
对于符号匹配的 A 和 M 记录应该在同一个较小的文件中。

例如，如果示例文件被拆分成至少包含 2 行的文件，那么以下记录应该在一个文件中:

 - A;BANK_X;20;2345;0
 - M;BANK_X;50;2348;2345
 - M;BANK_X;45;2352;2345

我解决问题的方法:

使用的数据结构:
- 队列:这将包含对象，其中键为 id(它们是父对象)，对象中的值将是一个包含子项列表的 vector 。
- Unordered_map 1: Key: id(即最后一个字段中记录值为0的id)，value: string(即从文件中读取的那个id的记录)
- Unordered_map 2: Key: id(即记录在最后一个字段中具有非 0 值的 id)，value:string(即从文件中读取的该 id 的记录)
算法:
- 逐行读取文件
- 解析最后 2 个记录字段
- 检查 id 是否为父级(即记录的最后一个字段是否为 0)如果是:创建对象{id, vactor< int >} 放入队列向 unordered_map 1 添加 id 和 string 记录如果不:在队列中搜索父 ID 并在 vector 中添加子 ID(这可以进行恒定时间搜索)向unordered_map添加id和string记录2
- 执行上述步骤直到文件结束。
- 现在开始弹出队列，并为每个 id(即父级)从 Unordered_map 中获取记录字符串 1 写入一个新文件，同样对于它的 child (在 vector 中可用)从 Unordered_map 2 中获取记录字符串写入文件。在这里，我将检查最小行数。
- 根据 Y 的值，从 unsorted_map 中获取 ids(parent)和 children 的记录并写入新文件。

如果我考虑声明中提到的示例文件，应用我的算法数据结构后将具有以下值:-

Queue< int, std::vector < int> >: [ {2345, <2348, 2352>}, {2346, <2349>}, {2347, <empty>}, {2350, <2353>}, {2351, <empty>}]
Unordered_map 1 < int, std::string >: [{2345, "A;BANK_X;20;2345;0"}, {2346, "A;BANK_Y;30;2346;0"}, {2347, "A;BANK_Z;40;2347;0"}, {2350, "A;BANK_X;20;2350;0"}, {2351, "A;BANK_E;40;2351;0"}]
Unordered_map 2 < int, std::string >: [{2348, "M;BANK_X;50;2348;2345"}, {2349, "M;BANK_Y;10;2349;2346"}, {2352, "M;BANK_X;45;2352;2345"}, {2353, "M;BANK_X;20;2353;2350"}]

最佳答案

您问题的以下陈述:

"Such a file contains millions of records."
"Every record has unique id (i.e. second last field in the record)"

.. 断言我建议您使用 SQL 数据库。这样，您可以将所有内容保存在单个文件中以便于访问。您将来可以高效地选择、插入、更新、删除，而不会失去从第一天开始就获得的灵 active 。

SQLite确实是一个轻量级的选择。

关于c++ - 这个问题有更好的数据结构和算法选择吗？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/58717540/

25

4

0

文章推荐： c++ - 是否可以在运行时为宏分配地址？

文章推荐： c++ - shared_ptr 类 vector 的 vector 初始化问题

文章推荐： jquery - 根据选择值显示 div

html - 是完全不渲染 HTML 更好，还是添加显示 :none? 更好
据我所知，根本不为元素呈现 HTML，或添加 display:none，似乎具有完全相同的行为:两者都使元素消失并且不与 HTML 交互。我正在尝试禁用和隐藏一个复选框。所以HTML的总量很小；我无
android - 在单个进程中使用 AsyncTask(或 Timer)更好，还是在单独的进程中使用 Service 更好？
我刚刚读了Android Architecture Tutorial: Developing an App with a Background Service (using IPC) .基本上是让服
mysql - 在 SELECT 中使用 SUM() 更好，还是在 SUB-SELECT 中使用 SUM() 更好？
我有两个查询具有相同的结果，现在我想知道哪个查询更优化？在选择中: select t1.*, sum(t2.value) as total_votes from table1 t1 left joi
blocking - 为什么 cpu bound 对阻塞 I/O 更好，而 I/O bound 对非阻塞 I/O 更好
有人告诉我，对于 I/O 绑定(bind)的应用程序，非阻塞 I/O 会更好。对于 CPU 密集型应用程序，阻塞 I/O 会好得多。我找不到这种说法的原因。试过谷歌，但很少有文章只是触及这个话题而没有
python - 使复杂性更小(更好)
我有一个算法可以在数字列表中寻找好的对。一个好的配对被认为是索引 i 小于 j 且 arr[i] 1: # Finding the mid of the array
python - 使复杂性更小(更好)
我有一个算法可以在数字列表中寻找好的对。一个好的配对被认为是索引 i 小于 j 且 arr[i] 1: # Finding the mid of the array
javascript - 更好/更快地修改嵌套对象不同深度下找到的所有匹配属性的方法
我从 API 收到一个 json，我需要解析并修改一个属性值。问题是，我收到的 json 数据的嵌套结构不一致，我无法控制它。这将禁止我指定在特定深度(如 parsedJson.children[0
mysql - 哪一个运行起来更安全/更好？
我有 451 个城市的坐标。现在我想计算每个城市之间的距离，然后根据该距离对一些结果进行排序。现在我有两个选择: 我可以运行一个循环来计算每个可能的城市组合的距离并将它们存储到一个表中，这将产生大约
sql - 哪个查询计划更快/更好
对于返回相同结果的不同查询，我有两个查询计划我想知道是否有人可以告诉我哪个“更好”，以及为什么。 SELECT * FROM bids order by (select ranking from us
android - 请解释阵列适配器及其用途。更好
关闭。这个问题需要更多focused .它目前不接受答案。想改进这个问题吗？更新问题，使其只关注一个问题 editing this post . 关闭 7 年前。 Improve this qu
c++ - 执行直接指针操作还是 [] 更好
我有一个二维数组。我需要尽可能快地对其执行一些操作(函数每秒将被调用十几次，所以让它变得高效会很好)。现在，假设我想获取元素 A[i][j]，简单地使用 A[i][j] 在速度上有什么不同吗和 *(
c# - 什么时候在字符串前使用@更好？
在声明或使用字符串的代码中，我通常会看到开发人员这样声明它: string randomString = @"C:\Random\RandomFolder\ThisFile.xml"; 代替: str
html - 为什么把所有的标签都写成一种样式比使用通用选择器(*)更好？
这个问题在这里已经有了答案: 关闭 10 年前。 Possible Duplicate: Why don't CSS resets use '*' to cover all elements? 我正
python - 更好/更快地循环遍历集合或列表？
如果我有一个包含许多重复项的 python 列表，并且我想遍历每个项目，而不是重复项，最好使用一个集合(如 set(mylist)，或者找到另一种方法来创建没有重复的列表？我想只是循环遍历列表并检查重
java - 没有实例的最终常量类如何比常量接口(interface)更好？
在阅读常量接口(interface)反模式时，我发现没有实例的最终常量类比常量接口(interface)更好。请解释一下怎么做？ public interface ConstIfc { publ
C:为什么 &= 比 = 更好？
我正在查看我继承的一些旧代码，我真的不喜欢某些地方的风格。我真的不喜欢它的外观的一件事是: bool func() { bool ret = true; ret &= test1();
java - @Path 注解中的路径参数，更好
关闭。这个问题是opinion-based 。目前不接受答案。想要改进这个问题吗？更新问题，以便 editing this post 可以用事实和引文来回答它。 . 已关闭 4 年前。 Improv
c++ - 访问者模式是否比受控使用 RTTI 更好？
我经常发现自己试图使用 boost/QT 信号解耦对象。实现这一点的简单方法是针对我要通信的每个具体类型，创建一个新的信号和插槽签名并连接所有相关对象。这导致了访问者模式，理想情况下我想发出一个访问者
java - 为什么这段代码片段中的 lambda 更好？
我正在 https://docs.oracle.com/javase/tutorial/java/javaOO/lambdaexpressions.html 上阅读有关 lambda 的内容在方法
java - 为什么从创建列表的方法返回 unmodifyingList 更好？
public List getInts() { List xs = new ArrayList(); xs.add(1); // return Collections.unmo

首页

博学

6Ren·AI

商城

c++ - 这个问题有更好的数据结构和算法选择吗？