sql - 如何在Spark数据帧中分组和聚合后过滤？-6ren

sql - 如何在Spark数据帧中分组和聚合后过滤？

转载作者：行者123 更新时间：2023-12-04 23:45:38

24

4

我有一个带有架构的 Spark 数据帧 df ，如下所示:

[id:string, label:string, tags:string]

id | label | tag
---|-------|-----
 1 | h     | null
 1 | w     | x
 1 | v     | null
 1 | v     | x
 2 | h     | x
 3 | h     | x
 3 | w     | x
 3 | v     | null
 3 | v     | null
 4 | h     | null
 4 | w     | x
 5 | w     | x

(h、w、v 是标签。x 可以是任何非空值)

对于每个 id，最多有一个标签“h”或“w”，但可能有多个“v”。我想选择满足以下条件的所有 id:

每个 id 有:
1. 一个标签“h”及其标签 = null，
2. 一个标签 "w"及其标签 != null,
3. 每个id至少有一个标签“v”。

我想我需要创建三列检查上述每个条件。然后我需要按“id”做一个组。

val hCheck = (label: String, tag: String) => {if (label=="h" && tag==null) 1 else 0}
val udfHCheck = udf(hCheck)
val wCheck = (label: String, tag: String) => {if (label=="w" && tag!=null) 1 else 0}
val udfWCheck = udf(wCheck)
val vCheck = (label: String) => {if (label==null) 1 else 0}
val udfVCheck = udf(vCheck)

dfx = df.withColumn("hCheck", udfHCheck(col("label"), col("tag")))
        .withColumn("wCheck", udfWCheck(col("label"), col("tag")))
        .withColumn("vCheck", udfVCheck(col("label")))
        .select("id","hCheck","wCheck","vCheck")
        .groupBy("id")

不知何故，我需要将三列 {"hCheck","wCheck","vCheck"} 分组为列表 [x,0,0],[0,x,0],[0,0,x] 的向量。并检查这些向量是否包含所有三个 {[1,0,0],[0,1,0],[0,0,1]}

我还没有能够解决这个问题。并且可能有比这个更好的方法。希望有人能给我建议。谢谢

最佳答案

要将三个检查转换为向量，您可以执行以下操作:
具体你可以这样做:

val df1 = df.withColumn("hCheck", udfHCheck(col("label"), col("tag")))
            .withColumn("wCheck", udfWCheck(col("label"), col("tag")))
            .withColumn("vCheck", udfVCheck(col("label")))
            .select($"id",array($"hCheck",$"wCheck",$"vCheck").as("vec"))

接下来 groupby 返回一个需要对其执行聚合的分组对象。特别是要获得所有向量，您应该执行以下操作:

    .groupBy("id").agg(collect_list($"vec"))

此外，您不需要 udfs 进行各种检查。您可以使用列语义来做到这一点。例如 udfHCheck 可以写成:

with($"label" == lit("h") && tag.isnull 1).otherwise(0)

顺便说一句，你说你想要一个标签“v”，但在 vcheck 中你只检查标签是否为空。

更新:替代解决方案

再次查看这个问题时，我会做这样的事情:

val grouped = df.groupBy("id", "label").agg(count("$label").as("cnt"), first($"tag").as("tag"))
val filtered1 = grouped.filter($"label" === "v" || $"cnt" === 1)
val filtered2 = filtered.filter($"label" === "v" || ($"label" === "h" && $"tag".isNull) || ($"label" === "w" && $"tag".isNotNull))
val ids = filtered2.groupBy("id").count.filter($"count" === 3)

这个想法是首先我们对 id 和 label 进行分组，以便我们获得有关组合的信息。我们收集的信息是有多少个值 (cnt) 和第一个元素(与哪个无关)。

现在我们做两个过滤步骤:
1. 我们正好需要一个 h 和一个 w 以及任意数量的 v，所以第一个过滤器为我们提供了这些情况。
2. 我们确保每个案例都符合所有规则。

现在我们只有匹配规则的 id 和 label 的组合，所以为了使 id 合法，我们需要正好有三个 label 实例。这导致第二个 groupby，它简单地计算与规则匹配的标签数量。我们只需要三个是合法的(即匹配所有规则)。

关于sql - 如何在Spark数据帧中分组和聚合后过滤？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/43402111/

24

4

0

文章推荐： sql - 是否可以按行组合进行分组？

文章推荐： sql - 如果存在于文件夹中，则将多个表从 CSV 导入 SQL

Cassandra 聚合
我有一个 Cassandra 集群，里面有 4 个表和数据。我想使用聚合函数(sum，max ...)发出请求，但我在这里读到这是不可能的: http://www.datastax.com/docu
MySQL 聚合？
我有以下两张表 Table: items ID | TITLE 249 | One 250 | Two 251 | Three 我投票给这些: Table: votes VID | IID | u
MongoDB $set 聚合
这个问题在这里已经有了答案: Update MongoDB field using value of another field (12 个答案) 关闭 3 年前。我想根据另一个“源”集合的文档中
MongoDB 聚合 - 不同计数特定元素
我的收藏包含以下文件。我想使用聚合来计算里面有多少客户，但我遇到了一些问题。我可以获得总行数，但不能获得总(唯一)客户。 [{ _id: "n001", channel: "Kalip
excel - 聚合、整理行并将行转置为列
我有下表 Id Letter 1001 A 1001 H 1001 H 1001 H 1001 B 1001 H 1001 H 1001
sql - 日期范围内的分组/聚合
得到一列的表 ABC。 “创建”的日期列。所以样本值就像; created 2009-06-18 13:56:00 2009-06-18 12:56:00 2009-06-17 14:02:0
Mongodb 聚合 - 分钟但不为零
我有一个带有数组字段的集合: {[ name:String buyPrice:Int sellPrice:Int ]} 我试图找到最低和最高买入/卖出价格。在某些条目中，买入或卖出价格为零
MongoDb 聚合，每个值的所有现有值
我有以下问题: 在我的 mongo db 中，我有以下结构: { "instanceId": "12", "eventId": "0-1b", "activityType":
数组项上的 Elasticsearch 聚合
下面给出的是我要在其上触发聚合查询的 Elasticsearch 文档。 { "id": 1, "attributes": [ { "fieldId": 1,
Django 聚合 - 零值除法
我正在使用 Django 的 aggregate query expression总计一些值。最终值是一个除法表达式，有时可能以零作为分母。如果是这种情况，我需要一种方法来逃避，以便它只返回 0。我
iphone - 如何统计coredata(聚合)？
我正在学习核心数据，特别是聚合。当前我想要做的事情:计算表中在某些条件上具有逆关系的多对关系的记录数。目前我正在这样做: NSExpression *ex = [NSExpression expr
Delphi 客户端数据集查找/聚合
我需要有关 Delphi 中的 ClientDatasets 的一些帮助。我想要实现的是一个显示客户的网格，其中一列显示每个客户的订单数量。我将 ClientDataset 放在表单上并从 Delp
MongoDB 匹配索引与无索引 - 聚合
我的集合有 10M 个文档，并且有一个名为 movieId 的字段；该文档具有以下结构: { "_id" : ObjectId("589bed43e3d78e89bfd9b779"), "us
oop - 聚合、组合和依赖之间有什么区别？
这个问题已经有答案了: What is the difference between association, aggregation and composition? (21 个回答) 已关闭 9
数组索引或替代解决方案上的 Elasticsearch 聚合
我在 elasticsearch 中有一些类似于这些示例的文档: { "id": ">", "list": [ "a", "b", "c" ] } { "id"
elasticsearch 聚合 - 为什么匹配所有查询不返回更具体查询的键？
我正在做一些聚合。但是结果完全不是我所期望的，似乎它们没有聚合索引中与我的查询匹配的所有文档，在这种情况下 - 它有什么好处？例如，首先我做这个查询: {"index":"datalayer","t
用户定义组的 Elasticsearch 聚合
假设我在 ES 中有这些数据。 | KEY | value | |:-----------|------------:| | A |
elasticsearch - ElasticSearch:聚合
可能在我的文档中，我有一个被分析的文本字段。我只是在ElasticSearch AggregationAPI中迷路了。我需要2种不同情况的支持: 情况A)结果是带有计数标记(条款)的篮子下降。情况B
json - 对多个字段进行ElasticSearch过滤(聚合)
我正在为网上商店构建多面过滤功能，如下所示: Filter on Brand: [ ] LG (10) [ ] Apple (5) [ ] HTC (3) Filter on OS: [ ] Andr
父属性上的 Elasticsearch 聚合
我有一个父/子关系并且正在搜索 child 。是否可以在父属性上创建聚合？例如parent 是 POST，children 是 COMMENT。如果父项具有“类别”属性，是否可以搜索 COMMEN

首页

博学

6Ren·AI

商城

sql - 如何在Spark数据帧中分组和聚合后过滤？