python - 使用 Pyspark 从关系数据集构建层次结构-6ren

python - 使用 Pyspark 从关系数据集构建层次结构

转载作者：行者123 更新时间：2023-12-03 23:06:26

33

4

我是 Python 新手，并坚持从关系数据集构建层次结构。
如果有人对如何进行此操作有想法，那将是非常有帮助的。
我有一个包含数据的关系数据集

_currentnode,  childnode_  
 root,         child1  
 child1,       leaf2  
 child1,       child3  
 child1,       leaf4  
 child3,       leaf5  
 child3,       leaf6

很快。我正在寻找一些 python 或 pyspark 代码
构建如下所示的层次结构数据框

_level1, level2,  level3,  level4_  
root,    child1,  leaf2,   null  
root,    child1,  child3,  leaf5  
root,    child1,  child3,  leaf6  
root,    child1,  leaf4,   null

数据是字母数字，是一个巨大的数据集[~5000万条记录]。
此外，层次结构的根是已知的，可以在代码中进行硬连线。
因此，在上面的示例中，层次结构的根是“root”。

最佳答案

Pyspark 的最短路径
输入数据可以解释为具有 currentnode 之间连接的图形。和 childnode .那么问题是根节点和所有叶节点之间的最短路径是什么，称为single source shortest path .
Spark有Graphx处理图的并行计算。不幸的是，GraphX 没有提供 Python API(更多细节可以在 here 中找到)。支持 Python 的图形库是 GraphFrames . GraphFrames 使用了 GraphX 的一部分。
GraphX 和 GraphFrames 都为 sssp 提供了解决方案。不幸的是，这两种实现都只返回最短路径的长度，而不是路径本身( GraphX 和 GraphFrames )。但是this answer为 GraphX 和 Scala 提供算法的实现，该算法也返回路径。所有三个解决方案都使用 Pregel .
将上述答案翻译为 GraphFrames/Python:
1. 数据准备
为所有节点提供唯一 ID 并更改列名称，使其适合所描述的名称 here

import pyspark.sql.functions as F

df = ...

vertices = df.select("currentnode").withColumnRenamed("currentnode", "node").union(df.select("childnode")).distinct().withColumn("id", F.monotonically_increasing_id()).cache()

edges = df.join(vertices, df.currentnode == vertices.node).drop(F.col("node")).withColumnRenamed("id", "src")\
        .join(vertices, df.childnode== vertices.node).drop(F.col("node")).withColumnRenamed("id", "dst").cache()

Nodes                   Edges
+------+------------+   +-----------+---------+------------+------------+
|  node|          id|   |currentnode|childnode|         src|         dst|
+------+------------+   +-----------+---------+------------+------------+
| leaf2| 17179869184|   |     child1|    leaf4| 25769803776|249108103168|
|child1| 25769803776|   |     child1|   child3| 25769803776| 68719476736|
|child3| 68719476736|   |     child1|    leaf2| 25769803776| 17179869184|
| leaf6|103079215104|   |     child3|    leaf6| 68719476736|103079215104|
|  root|171798691840|   |     child3|    leaf5| 68719476736|214748364800|
| leaf5|214748364800|   |       root|   child1|171798691840| 25769803776|
| leaf4|249108103168|   +-----------+---------+------------+------------+
+------+------------+

2. 创建 GraphFrame

from graphframes import GraphFrame
graph = GraphFrame(vertices, edges)

3. 创建将构成 Pregel 算法单个部分的 UDF
消息类型:

from pyspark.sql.types import *
vertColSchema = StructType()\
      .add("dist", DoubleType())\
      .add("node", StringType())\
      .add("path", ArrayType(StringType(), True))

顶点程序:

def vertexProgram(vd, msg):
    if msg == None or vd.__getitem__(0) < msg.__getitem__(0):
        return (vd.__getitem__(0), vd.__getitem__(1), vd.__getitem__(2))
    else:
        return (msg.__getitem__(0), vd.__getitem__(1), msg.__getitem__(2))
vertexProgramUdf = F.udf(vertexProgram, vertColSchema)

传出的消息:

def sendMsgToDst(src, dst):
    srcDist = src.__getitem__(0)
    dstDist = dst.__getitem__(0)
    if srcDist < (dstDist - 1):
        return (srcDist + 1, src.__getitem__(1), src.__getitem__(2) + [dst.__getitem__(1)])
    else:
        return None
sendMsgToDstUdf = F.udf(sendMsgToDst, vertColSchema)

消息聚合:

def aggMsgs(agg):
    shortest_dist = sorted(agg, key=lambda tup: tup[1])[0]
    return (shortest_dist.__getitem__(0), shortest_dist.__getitem__(1), shortest_dist.__getitem__(2))
aggMsgsUdf = F.udf(aggMsgs, vertColSchema)

4. 组合零件

from graphframes.lib import Pregel
result = graph.pregel.withVertexColumn(colName = "vertCol", \
    initialExpr = F.when(F.col("node")==(F.lit("root")), F.struct(F.lit(0.0), F.col("node"), F.array(F.col("node")))) \
    .otherwise(F.struct(F.lit(float("inf")), F.col("node"), F.array(F.lit("")))).cast(vertColSchema), \
    updateAfterAggMsgsExpr = vertexProgramUdf(F.col("vertCol"), Pregel.msg())) \
    .sendMsgToDst(sendMsgToDstUdf(F.col("src.vertCol"), Pregel.dst("vertCol"))) \
    .aggMsgs(aggMsgsUdf(F.collect_list(Pregel.msg()))) \
    .setMaxIter(10) \
    .setCheckpointInterval(2) \
    .run()
result.select("vertCol.path").show(truncate=False)

评论:

maxIter应设置为至少与最长路径一样大的值。数值越大，结果不变，但计算时间变长。如果该值太小，则结果中将缺少较长的路径。当前版本的 GraphFrames (0.8.0) 不支持在不再发送新消息时停止循环。

checkpointInterval应设置为小于 maxIter 的值.实际值取决于数据和可用硬件。当出现 OutOfMemory 异常或 Spark session 挂起一段时间时，该值可能会减小。

最终结果是带有内容的常规数据框

+-----------------------------+
|path                         |
+-----------------------------+
|[root, child1]               |
|[root, child1, leaf4]        |
|[root, child1, child3]       |
|[root]                       |
|[root, child1, child3, leaf6]|
|[root, child1, child3, leaf5]|
|[root, child1, leaf2]        |
+-----------------------------+

如有必要，可以在此处过滤掉非叶节点。

关于python - 使用 Pyspark 从关系数据集构建层次结构，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/62450917/

33

4

0

文章推荐： vespa - Vespa.ai 中的内存文档存储

文章推荐： python - 10,000 到 100,000 到 150,000,000 及以上的正则表达式

文章推荐： python - 根据使用 Pandas 的条件动态改变日期

文章推荐： r - 是否可以对输出 bigz 对象的函数进行矢量化？

Java has-a 关系
下面的说法正确吗？ “人最好的 friend 是狗。” public class Mann { private BestFriend dog; //etc } 最佳答案我想说这样
Laravel 关系
我一直在 documentation 中查看 Laravel 4 中的关系我正在尝试解决以下问题。我的数据库中有一个名为“事件”的表。该表具有各种字段，主要包含与其他表相关的 ID。例如，我有一个“
mysql表重新设计思路(关系)
我的表具有如下关系: 我有相互链接的级联下拉框，即当您选择国家/地区时，该国家/地区下的区域将加载到区域下拉列表中。但现在我想将下拉菜单更改为基于 Ajax 的自动完成文本框。我的问题是，我应该有多
MySQL 关系
我正在尝试弄清楚如何构建这个数据库。我之前用过Apple的核心数据就好了，现在我只是在做一个需要MySQL的不同项目。我是 MySQL 的新手，所以请放轻松。 :) 对于这个例子，假设我有三个表，Us
浅谈MongoDB 关系
MongoDB 的关系表示多个文档之间在逻辑上的相互联系。文档间可以通过嵌入和引用来建立联系。 MongoDB 中的关系可以是： 1:1 (1对1) 1: N (1对多)
sql - 范围和分配单元之间有什么区别/关系？
您能解释一下 SQL 中“范围”和“分配单元”之间的区别或关系吗？最佳答案分配单元基本上只是一组页面。它可以很小(一页)或很大(很多页)。它在 sys.allocation_units 中有一个元
基于每个表两列的 PowerPivot 关系
我有一个表 geoLocations，其中包含两列纬度和经度。还有第二个表(让我们将其命名为城市)，其中包含每对唯一的纬度和经度对应的城市。如何使用 PowerPivot 为这种关系建模？创建两个单
android - SQLDelight 关系
我想用 SQLDelight 建模关系，尤其是一对多关系。我有 2 张 table :recipe和 ingredient .为简单起见，它们看起来像这样: CREATE TABLE recipe
Neo4J CSV 关系
我是 Neo4J 新手，我有一个带有源和目标 IP 的简单 CSV。我想在具有相同标签的节点之间创建关系。类似于... source_ip >> ALERTS >> dest_ip，或者相反。 "d
来自另一个类的静态调用的 UML 关系
我正在创建一个类图，但我想知道下面显示的两个类之间是否会有任何关联 - 据我了解，对于关联，ClassA 必须有一个 ClassB 的实例，在这种情况下没有但是，它确实需要知道 ClassB 的一个变
visualization - 为什么OWLViz只显示 "is-a"关系？
是否可以显示其他属性，即“hasTopping”等？如何在 OWLViz 中做到这一点？最佳答案 OWLViz 仅显示类层次结构(断言和推断的类层次结构)。仅使用“is-a”关系进行描述。 OW
java - 如何在对象之间建立链接/关系？
public class MainClass { ArrayList mans = new ArrayList(); // I'm filling in this arraylist,
mysql - “多对二”关系
我想知道“多对二”的关系。 child 可以与两个 parent 中的任何一个联系，但不能同时与两个 parent 联系。有什么办法可以加强这一点吗？我也想防止 child 重复条目。一个真实的例子
grails - 从主应用程序向grails插件域类添加行为(关系)？
我有一个已经创建的Grails插件，旨在支持许多应用程序。该插件具有一个Employee域对象。问题在于，当在主应用程序中使用该应用程序中的域对象时，需要将其引用回Employee对象。因此，我的主应
laravel- Eloquent 关系
我有一个类(class)表、类(class)hasMany部分和部分hasMany讲座以及讲座hasMany评论。如果我有评论 ID 并且想知道其类(class)名称，我应该如何在 LectureCo
Laravel 关系一到两列
我有一个模型团队，包含 ID 和名称。所有可能的团队都会被存储。我的模型游戏有两列 team_1 和 team_2..我需要哪种关系？我已经测试了很多，但它只适用于一列.. 最佳答案也许你可以试
corba - 仆人和对象 - 关系
我读了很多关于 ICE 或 Corba 等技术中使用的仆人和对象的文章。有很多资源我可以读到这样的东西: 一个仆人可以处理多个对象(为了节省资源)。一个对象可以由多个仆人处理(为了可靠性)。有人可
Java 向下转型和 is-A has-A 关系
嗨，我有一个令人沮丧的问题，我在这方面有点生疏。我有两个这样的类(class): class A{ int i; String j ; //Getters and setters} class B
java - 类是否必须位于同一继承树上才能具有 Has-A 关系
class Employee { private String name; void setName(String n) { name = n; } String getNam
java - JPA 关系
如果您有这样的关系: 员工与其主管员工之间存在多对一关系员工与其部门的多对一关系部门与其经理一对一我会在 Employee 实体中写入: @ManyToOne (cascade=CascadeT

首页

博学

6Ren·AI

商城

python - 使用 Pyspark 从关系数据集构建层次结构