sql - 在两个大数据流中查找客户条目的有效方法-6ren

sql - 在两个大数据流中查找客户条目的有效方法

转载作者：可可西里更新时间：2023-11-01 14:52:48

26

4

如果我有一个数据流每天给我 1000 万条记录(流 A)，另一个数据流每天给我 10 亿条记录(流 B)，查看数据是否重叠的有效方法是什么？

更具体地说，如果流 A 中有一位客户访问了一个网页，而同一位客户访问了流 B 中的另一个网页，我如何判断该客户访问了这两个网页？

我最初的想法是将记录放入关系数据库并进行连接，但我知道这样效率很低。

执行此操作的更有效方法是什么？我如何使用 Hadoop 或 Spark 等工具来做到这一点？

最佳答案

联接应该是处理此问题的有效方法。您应该对两个数据集进行排序，或者对 CustomerID 进行索引(并且索引将按 CustomerID 进行排序)。由于索引，SQL 引擎会知道这些集合是有序的，并且应该能够非常有效地进行连接。

如果您只查找 CustomerID 在两者中都存在的实例，它可能是一个 SQL 查询:

Select Distinct A.CustomerID 
From A 
  Inner Join B 
    on A.CustomerID = B.CustomerID

关于sql - 在两个大数据流中查找客户条目的有效方法，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/35047939/

26

4

0

文章推荐： algorithm - gzip 文件如何存储在 HDFS 中

文章推荐： C++ 诡异的构造函数

文章推荐： javascript - 打开 Firebug Lite

文章推荐： Hadoop inode 到路径

ios - 如何导航回已删除的 PageViewController 条目/更改 PageViewController 条目
情况:我想从数据条目列表导航回我的 PageViewController。 before 和 previous 函数起作用 func pageViewController(pageViewContro
java - 如何避免 Gradle 的 osgi 插件为私有(private)包生成 export-pacakge 条目，为嵌入式依赖项生成 import-package 条目
尊敬的 StackOverflow 用户我有一个 gradle 项目，我想将其工件转换为 osgi 包。在这个包中，我有: 我不想导出的包(可能不会出现在 list 的 Export-Package
android - AlarmManager 条目
我为我的 PendingIntent 设置了一个警报。现在我想在我的 Activity 中显示是否设置了此警报。 Intent service = new Intent(context, MyServ
一个表中最常出现在另一表中的 MYSQL 条目
我有 2 个表、作者和书籍 authors 包含唯一的 IDauthorId 书籍也包含此作为外键我需要知道书籍数量最多的作者。如果 2 个或更多作者并列最多书籍，我需要显示这两位作者我已经能够通
mysql - 根据重复的列值删除行/条目
我有一个名为 prospective_shop 的表，其中一个列名称是“用户名”。用户名未设置为主键，但我想删除所有具有重复用户名的行。我怎样才能以最快的方式做到这一点？我尝试执行以下操作: ALT
android - 如何阅读添加到日历的事件/条目？
我现在可以添加条目了。在我的应用程序中，用户可以在他的日历上输入约会/事件。但在他这样做之前，它应该向他显示他已经添加的事件。它应该从日历中获取事件并将其显示给他。这该怎么做？我被困在这部分。提前致谢
在内核中创建一个简单的只写 proc 条目
#include #include #include #include #include #include char *msg; ssize_t write_proc(struct file
从内核模块创建 sysfs 条目
我想将大于 1024 个字符的字符串传递到我的模块(文件系统)。由于内核参数限制为 1024 个字符，someone recommended改为使用 sysfs。我试图包括 this example
python - SQLAlchemy:相关子查询中仍然存在 FROM 条目
我正在尝试使用 SQLAlchemy 构建以下查询(用作包含查询的子查询，该查询定义名为 tbl_outer 的别名): SELECT max(tbl.ts) AS max_1 FROM tbl WH
Java - 仅比较特定键的两个 Maps 条目
假设我有两张 map : Map map1 = Map.of( "a", "1", "b", "2", "c", "3", "x
VBA:从每个类别中提取前 'x' 条目
通过简化示例，假设您有以下数据集: A B C Name Group Amount Dave A 2 Mike B 3 Adam C 4
apache - 三级域的 DNS 条目
我正在尝试在我的服务器上创建一个三级域虚拟主机。我希望配置设置正确，但我得到一个 ERR_NAME_NOT_RESOLVED错误。我已经读到我必须在某处“添加 DNS 条目”以便解析名称，但我该怎么
regex - 我可以使用什么正则表达式来查找逗号分隔列表中的 Nᵗʰ 条目？
我需要一个可用于在逗号分隔列表中查找第 N 个条目的正则表达式。例如，假设此列表如下所示: abc,def,4322,mail@mailinator.com,3321,alpha-beta,43 .
GWT .hgignore/.gitignore 条目
GWT 应用程序(在 Eclipse 中开发)的源代码管理忽略文件中的典型条目是什么？最佳答案我会推荐: 你leave the eclipse files (.project, .classpat
sql - 需要帮助为没有订单的月份生成 NULL 条目
我必须创建显示表 (Tbl) 中所有字段的输出，并创建一个额外的列来按月计算每个客户的累计总和(例如，如果客户在 4 月份有两次销售，新列将具有这些销售额和两行中任何先前销售额的总和)。我能做的就这么
docker - 使用从属性文件创建的 ConfigMap 条目
文档 ( http://kubernetes.io/docs/user-guide/configmap/ ) 上用于使用值的示例基于 ConfigMap，其中每个数据条目都是一对/值。例子: apiV
autohotkey - 创建以冒号结尾的 AutoHotkey 条目
我有一个奇怪的错字，我一遍又一遍地犯，而不是实际工作我的打字技巧，我想编辑我的 AutoHotkey 脚本来弥补这一点。有时，当我输入大写字母时，我会点击:按钮并输入“I:”，我希望 AHK 仅用字
x86 - 初始加载后如何更新 GDT 条目？
使用 lgdt 初始化 GDT 并将其加载到 GDTR 后，稍后如何更新 GDT？如果我使用 sgdt 命令获取基地址，然后更新或添加条目，然后使用 lgdt 再次重新加载，我是否正确？还有其他方法
c# - 条目(数据库)已添加
我有两个应用程序共享同一个数据库，即 API 和 MVC5 应用程序。两者都在本地主机上运行良好，但在部署到我的 Azure 帐户时出现此错误 Configuration Error Descrip
powershell - 从数组中删除 'lesser' 条目
我正在尝试修剪我拥有的一些文件。我将为您保存到目前为止我编写的野兽，并通过提供虚构代码使其保持简单。让我们来看看这个数组: [System.String[]]$Collection = 'Invit

首页

博学

6Ren·AI

商城

sql - 在两个大数据流中查找客户条目的有效方法