apache-spark - 加入一个巨大而巨大的 Spark 数据框-6ren

apache-spark - 加入一个巨大而巨大的 Spark 数据框

转载作者：行者123 更新时间：2023-12-04 04:45:01

24

4

我有两个数据帧，df1 有 600 万行，df2 有 10 亿行。

我尝试过标准的 df1.join(df2,df1("id")<=>df2("id2")) ，但内存不足。

df1 太大，无法放入广播连接。

我什至尝试过布隆过滤器，但它也太大了，无法放入广播中，但仍然有用。

我尝试过的唯一不会出错的方法是将 df1 分成 300,000 个行块并在 foreach 循环中与 df2 连接。但这比它可能需要的时间长一个数量级(可能是因为它太大而无法作为持久化，导致它重做分割到那个点)。重新组合结果也需要一段时间。

你是如何解决这个问题的？

一些注意事项:

df1 是 df2 的子集。 df1=df2.where("fin<1").selectExpr("id as id2").distinct() 我对 df2 中的所有行都感兴趣，这些行的 id 曾经有一个 fin<1，这意味着我不能一步完成。

df2 中大约有 2 亿个唯一 ID。

以下是一些相关的 Spark 设置:

spark.cores.max=1000
spark.executor.memory=15G
spark.akka.frameSize=1024
spark.shuffle.consolidateFiles=false
spark.task.cpus=1
spark.driver.cores=1
spark.executor.cores=1
spark.memory.fraction=0.5
spark.memory.storageFraction=0.3
spark.sql.shuffle.partitions=10000
spark.default.parallelism=10000

我得到的错误是:

16/03/11 04:36:07 ERROR LiveListenerBus: SparkListenerBus has already stopped! Dropping event SparkListenerTaskEnd(11,1,ResultTask,FetchFailed(BlockManagerId(68dcb91c-1b45-437d-ac47-8e8c1e4bc386-S199, mapr, 46487),3,176,4750,org.apache.spark.shuffle.FetchFailedException: java.io.FileNotFoundException: /tmp/mesos/work/slaves/68dcb91c-1b45-437d-ac47-8e8c1e4bc386-S199/frameworks/c754216b-bf80-4d84-97f1-2e907030365e-2545/executors/16/runs/5a5a01c5-205e-4380-94d3-7fa0f6421b85/blockmgr-ea345692-05bb-4f42-9ba1-7b93311fb9d4/0e/shuffle_3_340_0.index (No such file or directory)

和

Caused by: org.apache.spark.SparkException: Job aborted due to stage failure: Task 465 in stage 6.3 failed 4 times, most recent failure: Lost task 465.3 in stage 6.3 (TID 114448, mapr): java.lang.OutOfMemoryError: Direct buffer memory

最佳答案

正如我所见，您有分区太大的问题(可能是由于数据较大)
您可以尝试几种方法:

尝试将 spark.sql.shuffle.partitions 定义为 2048 甚至更多(默认为 200)。加入你的 df-s 时会有 shuffle。尝试使用此参数，以便更大数据的总量/此参数将约为 64Mb-100Mb(取决于文件格式)。一般来说，你应该在 spark UI 中看到每个任务(每个分区)处理“正常”的数据量(最大 64MB-100MB)

如果第一个不起作用，我可以建议在 RDD api 中加入这个。将您的 df 转换为 RDD。然后通过 HashPartitioner(分区数)对两个 RDD 进行分区。什么时候应该像我之前描述的那样计算分区数。

最近，spark 开发人员添加了新选项:您可以将巨大的表存储到 N 个存储桶中(即存储它以备加入)。存在的限制很少，但它可以完全消除混洗的大量数据。 bucketBy 仅支持 saveAsTable api 而不是 save 一个。在您使用 bucketBy 数据并将其分桶后，然后在下一次迭代中，您可以将此数据作为外部表加载，同时提供分桶规范(请参阅 https://docs.databricks.com/spark/latest/spark-sql/language-manual/create-table.html )

CREATE TABLE 巨大的
--...在这里你必须指定架构
使用 Parquet
CLUSTERED BY (a,b,c) INTO N 个桶
位置 'hdfs://your-path'

然后，当您将巨大的表加载为分桶表时，您可以加载大表并将其重新分区为相同数量的存储桶和相同的列(df.repartition(N, a,b,c))

关于apache-spark - 加入一个巨大而巨大的 Spark 数据框，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/35948714/

24

4

0

文章推荐： laravel - 验证匹配字符串

文章推荐： node.js - 如何git clone一个 ionic 项目？

mysql - (A 加入 B) 加入 (C 加入 D)
我想对 JOIN 进行特定的排序 SELECT * FROM (lives_in as t1 NATURAL JOIN preferences p1) l1 JOIN (lives_in t2 NAT
mysql - 苦苦挣扎于查询、加入、加入
我正在努力解决一个查询。并想知道是否有人可以提供帮助。我有一个标签表(服务请求票)和序列号表从我的标签中我正在这样做 Select * from tag where tag.created BET
mysql - A 加入 B 与 B 加入 A
关闭。这个问题需要多问focused 。目前不接受答案。想要改进此问题吗？更新问题，使其仅关注一个问题 editing this post . 已关闭 7 年前。 Improve this ques
Mysql查询(加入)
我有两个表 tbl_user 和 tbl_lastchangepassword，如下所示表 tbl_user id| name --------- 1 | user1 2 | user2 3 |
MySQL查询优化[加入]
我有下一个问题 SELECT i.*, gu.* vs.* FROM common.global_users gu LEFT JOIN common.global_users_perms gup ON
mysql新手——加入
我有一个电影表和一个投票表。用户为他们喜欢的电影投票。我需要显示按电影总票数降序排列的电影列表。我现在所拥有的有点作品。唯一的问题是它不显示 0 票的电影。 SELECT m.name, m.imdb
MySql 加入 BETWEEN
我有一个由这样的表组成的 mySql 数据库: 我如何(如果可能的话)使用 JOINS 从名称/周期表中获取结果？简单来说，它是如何工作的？我向菜鸟问题道歉。我对此很陌生。任何帮助将不胜感激。最佳答
SQL 自引用查询。加入
我需要查询单元先决条件的自引用关系。我知道您需要使用两个联接，我是否选择我的列然后将其联接到自身？ SELECT u.unit_code, u.name + ' is a prerequisi
LINQ - 加入 OR 条件
我有两个实体，用户和友谊，它们看起来像: public class User { public int UserId { get; set; } (..
sql - 加入 OR 的性能
假设我有两个表: Table A ProdID | PartNumber | Data... 1 | ABC-a | "Data A" 2 | (null) |
r - 加入/合并数据框内的两列
说我有这个数据， (df <- data.frame( col1 = c('My','Your','His','Thir'), col2 = c('Cat','Dog','Fish','Dog')))
php - 加入/合并两个数组
我有两个这样的数组，实际上这是从两个不同的服务器检索的 mysql 数据: $array1 = array ( 0 => array ( 'id' => 1, 'n
sqlite - 从不同的表中获取结果 - 加入
我的数据库中有以下表格 CREATE TABLE [author_details] ( [_id] INTEGER PRIMARY KEY AUTOINCREMENT NOT NULL, [name
LINQ 加入 Where 子句
我正在努力使用一个相当简单的 sql select 语句的 join/where 子句。我正在尝试从 tb1 中检索产品信息列表，其中 where 条件位于 tbl2 中，但这必须由三个不同的列连接
haskell - “加入”申请？
我正在寻找以下功能: Applicative f => f (f a) -> f a Hoogle给我看join : >:t join join :: Monad m => m (m a) -> m
javascript - 加入 Firebase
我有两个“表”，分别是 USER 和 CONGE。在表“CONGE”中，我插入了用户的 ID。但是我不知道如何根据用户的id显示用户的休假。我想根据id发布“Congé”。 { "conge"
elasticsearch - 加入/合并Elasticsearch结果
我们有一个具有(简化)结构的文档，如Elasticsearch所示: { _id: ..., patientId: 4711, text: "blue" } { _id: ..., patientId
sql - 加入/哪里概念
这两个sql语句有什么区别 a) 从 T1,T2 中选择 *，其中 T1.A=T2.A ； b) 从 T1,T2 中选择 *，其中 T2.A=T1.A ；在这两种情况下我得到相同的输出，这两种语句之
NHibernate HQL - 加入
我想做一个简单的连接，只是比较两个表中的 ID.. 我有我的组表，包含；身份证姓名等.. 我的 GroupMap 表包含；身份证组号元素编号我的查询采用 GroupMap.ItemID
python - 加入/合并具有相同列名的数据框的微妙问题
所以我有一组主要数据，如下所示: value_num code value_letter 1 CDX A 2 DEF B

首页

博学

6Ren·AI

商城

apache-spark - 加入一个巨大而巨大的 Spark 数据框