apache-spark - 复杂类型的模式演化

转载作者：行者123 更新时间：2023-12-04 15:46:34

24

4

spark 中 structs(复杂类型)的 arrays 的模式演化状态如何？

我知道对于常规简单类型的 ORC 或 Parquet 工作得很好(添加一个新列)，但到目前为止我找不到任何适合我所需情况的文档。

我的用例是具有与此类似的结构:

user_id,date,[{event_time, foo, bar, baz, tag1, tag2, ... future_tag_n}, ...]

而且我希望能够向数组中的结构添加新字段。

Map(键值对)复杂类型会导致效率低下吗？我至少会确保添加新字段(标签)是灵活的。

编辑

case class BarFirst(baz:Int, foo:String)
case class BarSecond(baz:Int, foo:String, moreColumns:Int, oneMore:String)
case class BarSecondNullable(baz:Int, foo:String, moreColumns:Option[Int], oneMore:Option[String])
case class Foo(i:Int, date:String, events:Seq[BarFirst])
case class FooSecond(i:Int, date:String, events:Seq[BarSecond])
case class FooSecondNullable(i:Int, date:String, events:Seq[BarSecondNullable])
val dfInitial = Seq(Foo(1, "2019-01-01", Seq(BarFirst(1, "asdf")))).toDF
dfInitial.printSchema
dfInitial.show

root
 |-- i: integer (nullable = false)
 |-- date: string (nullable = true)
 |-- events: array (nullable = true)
 |    |-- element: struct (containsNull = true)
 |    |    |-- baz: integer (nullable = false)
 |    |    |-- foo: string (nullable = true)


scala> dfInitial.show
+---+----------+----------+
|  i|      date|    events|
+---+----------+----------+
|  1|2019-01-01|[[1,asdf]]|
+---+----------+----------+

dfInitial.write.partitionBy("date").parquet("my_df.parquet")

tree my_df.parquet
my_df.parquet
├── _SUCCESS
└── date=2019-01-01
    └── part-00000-fd77f730-6539-4b51-b680-b7dd5ffc04f4.c000.snappy.parquet


val evolved = Seq(FooSecond(2, "2019-01-02", Seq(BarSecond(1, "asdf", 11, "oneMore")))).toDF
evolved.printSchema
evolved.show

scala> evolved.printSchema
root
 |-- i: integer (nullable = false)
 |-- date: string (nullable = true)
 |-- events: array (nullable = true)
 |    |-- element: struct (containsNull = true)
 |    |    |-- baz: integer (nullable = false)
 |    |    |-- foo: string (nullable = true)
 |    |    |-- moreColumns: integer (nullable = false)
 |    |    |-- oneMore: string (nullable = true)


scala> evolved.show
+---+----------+--------------------+
|  i|      date|              events|
+---+----------+--------------------+
|  1|2019-01-02|[[1,asdf,11,oneMo...|
+---+----------+--------------------+

import org.apache.spark.sql._
evolved.write.mode(SaveMode.Append).partitionBy("date").parquet("my_df.parquet")
my_df.parquet
├── _SUCCESS
├── date=2019-01-01
│   └── part-00000-fd77f730-6539-4b51-b680-b7dd5ffc04f4.c000.snappy.parquet
└── date=2019-01-02
    └── part-00000-64e65d05-3f33-430e-af66-f1f82c23c155.c000.snappy.parquet

val df = spark.read.parquet("my_df.parquet")
df.printSchema
scala> df.printSchema
root
 |-- i: integer (nullable = true)
 |-- events: array (nullable = true)
 |    |-- element: struct (containsNull = true)
 |    |    |-- baz: integer (nullable = true)
 |    |    |-- foo: string (nullable = true)
 |-- date: date (nullable = true)

缺少其他列!为什么？

df.show
df.as[FooSecond].collect // AnalysisException: No such struct field moreColumns in baz, foo
df.as[FooSecondNullable].collect // AnalysisException: No such struct field moreColumns in baz, foo

此行为针对 spark 2.2.3_2.11 和 2.4.2_2.12 进行了评估。

最佳答案

在编辑后执行代码(上图)时，架构合并关闭，新列未加载。启用架构合并时:

val df = spark.read.option("mergeSchema", "true").parquet("my_df.parquet")
scala> df.printSchema
root
 |-- i: integer (nullable = true)
 |-- events: array (nullable = true)
 |    |-- element: struct (containsNull = true)
 |    |    |-- baz: integer (nullable = true)
 |    |    |-- foo: string (nullable = true)
 |    |    |-- moreColumns: integer (nullable = true)
 |    |    |-- oneMore: string (nullable = true)
 |-- date: date (nullable = true)

df.as[FooSecond].collect//显然失败 NullPointerException 必须使用选项df.as[FooSecondNullable].collect//工作正常

现在使用 hive

evolved.write.mode(SaveMode.Append).partitionBy("date").saveAsTable("my_df")

似乎工作正常(无一异常(exception))，但是当试图读回数据时:

spark.sql("describe my_df").show(false)
+-----------------------+---------------------------------+-------+
|col_name               |data_type                        |comment|
+-----------------------+---------------------------------+-------+
|i                      |int                              |null   |
|events                 |array<struct<baz:int,foo:string>>|null   |
|date                   |string                           |null   |
|# Partition Information|                                 |       |
|# col_name             |data_type                        |comment|
|date                   |string                           |null   |
+-----------------------+---------------------------------+-------+

当不使用仅使用基本类型的结构数组时:

val first = Seq(Foo(1, "2019-01-01")).toDF
first.printSchema
first.write.partitionBy("dt").saveAsTable("df")
val evolved = Seq(FooEvolved(1,2, "2019-01-02")).toDF
evolved.printSchema
evolved.write.mode(SaveMode.Append).partitionBy("dt").saveAsTable("df")
evolved.write.mode(SaveMode.Append).partitionBy("dt").saveAsTable("df")
org.apache.spark.sql.AnalysisException: The column number of the existing table default.df(struct<first:int,dt:string>) doesn't match the data schema(struct<first:int,second:int,dt:string>);

有明确的错误信息问题:是否仍然可以在 Hive 中发展模式？还是需要手动调整架构？

结论

支持结构数组的模式演化，但在读取文件时必须打开合并选项，并且似乎只有在没有 Hive 的情况下直接读取文件时才能开箱即用。

当从 hive 中读取时，只返回旧模式，因为写入新列时似乎会被静默删除。

Schema evolution in parquet format (手动创建 View ，一个额外的好处是 parquet 不受支持的模式演变(重命名，数据类型更改是可能的))看起来是一个有趣的替代方案，因为 merge-schema 选项设置为 true 是非常耗费资源的，它适用于 Hadoop 上的所有 SQL 引擎。

关于apache-spark - 复杂类型的模式演化，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/55508402/

24

4

0

文章推荐： amazon-web-services - AWS S3 的小文件问题

文章推荐： laravel - TypeError : require. extensions.hasOwnProperty 不是函数

文章推荐： php - 如何使用 curl 发送数组和对象

文章推荐： javascript - 登录后 Firebase 慢重定向？

sql - 连续行之间的日期差异 - 复杂
我之前发布过question已得到答复，但我也需要对此进行查询。我有一个包含这样数据的表结构(日期格式为 dd/mm/yyyy)。 ID Account Number Unit Ad
javascript - 将对象数组转换为包含对象数组的对象(复杂)
我正在使用 React Native Calendars 并尝试为议程组件构建我的数据。预期的数据结构是(一个对象) { '2012-05-22': [{text: 'item 1 - any j
c - 复杂 while 语句的时间和空间复杂度
这个问题不太可能对任何 future 的访客有帮助；它只与一个较小的地理区域、一个特定的时间点或一个非常狭窄的情况相关，通常不适用于全世界的互联网受众。如需帮助使此问题更广泛适用，visit the
Mysql，复杂 ORDER BY
两列城镇和优先级。我需要对表进行排序，以便优先级=1的城镇排在第一位，并且不按名称 ASC 排序，而其余城镇则按名称 ASC 排序。我该怎么做？谢谢;) 更新 SELECT * FROM map
Mysql 复杂 SELECT
我有三个表“Hardware_model”、“Warehouse”和“Brand”，并且表以这种方式一起引用:Hardware_model 仓库Hardware_model 品牌现在我要执行以下
MySQL 复杂 SELECT
我有一个 MySQL 表 (tbl_filters)，包含 3 列:id、cat、val id 和 val 是数字，cat 是 varchar。每个 id 有多行。我还有另一个包含多个列的表 (tb
mysql 条件查询 - 复杂
我想获取字段的不同值，比方说:field1...这需要一个如下查询:“从表中选择不同的(字段1)” 但是，对于某些记录，field1 为空，并且还有另一列可以替代 field1，即 field2。对于
php - 修改MYSQL字段中的一个值有多个值(复杂)
表 1 - 用户 id username items 1 Paul 1(0020);2(0001); 表 2 - 项目 id name 1 name_here 在我的用户的项目中，我输入了 2(000
MySQL join同表按列显示行(复杂)
我想连接同一个表 4 次以获取列的显示方式，我不确定是否可以在 1 个 SQL 语句中完成。 tbl_用户名 id username 1 Adam 2 Bob 3 Chris tbl_机
javascript - 我该如何使其更加“复杂”？
首先，我刚刚开始自己学习JS，没有任何编程经验，这意味着我仍然要了解这种出色的编程语言的基本构建模块。我的问题与我编写的以下代码有关： let orderCount = 0; con
PHP - 从数据库中获取信息(复杂)
关闭。这个问题需要details or clarity .它目前不接受答案。想改进这个问题吗？通过 editing this post 添加细节并澄清问题. 关闭 9 年前。 Improve t
PHP + MySQL 复杂
我正在使用 XMAPP，MySQL 正在正常运行。在 phpMyAdmin 中，我不太明白这一点，所以我尝试在 PHP 中创建一个。使用此代码，它会告诉我数据库 benutzer。尽管我在 phpMy
algorithm - 寻找具有最大平均度数的子图。复杂？
是否有一种高效的算法可以找到平均度最大的子图(可能是图本身)？最佳答案 The paper "Finding a Maximum-Density Subgraph" by Andrew Goldbe
复杂「场景」数据导入导出
目录 1、业务背景 2、场景分析 3、流程设计 1、业务流程 2、导入流程
sql - 复杂(？)SQL 连接查询
我有 2 个表: 1) 包含自 1900 年 1 月 1 日以来所有日期的 Masterdates 表 2) Stockdata 表，其中包含表单中的股票数据日期、交易品种、开盘价、最高价、最低价、
.net - 复杂 UI 上的批量更新
我有一个非常复杂的 UI，其状态栏不断变化，其中包含多种类型的状态消息，并且 UI 具有复杂的图表控件和已加载的指示性地理 map 。现在这些小而复杂的区域的数据上下文具有同样复杂的 ViewMod
big-o - 复杂。为什么常量不重要？
有人可以用简单的方式向我解释为什么常量在大 O 表示法中无关紧要吗？为什么添加常量时复杂性保持不变。这不是作业问题，我只是想更好地理解这一点。让我明白这个大 O 是为了看到一个函数在接近无穷大时的行为
elasticsearch - 复杂 Elasticsearch 查询
我在 flex 搜索索引中有以下文档。 [{ "_index": "ten2", "_type": "documents", "_id": "c323c
LINQ - 如何保持(复杂)结果有序？
我有一个以零碎的方式构建的 LINQ 查询，如下所示: var initialQuery = from item in MyContext where xxx == yyy select item;
java - Hibernate 查询 - 复杂
我目前正在涉足 SQL，并且希望针对我所创建的问题获得一些帮助。为了练习一些编程，我正在制作一个 IOU 应用程序。下面是我存储的表我的借条记录(忽略一些相关栏目)。该表允许用户说“嘿，你欠我 X

首页

博学

6Ren·AI

商城

apache-spark - 复杂类型的模式演化

编辑

缺少其他列!为什么？

现在使用 hive

结论