apache-spark - spark 2.4 Parquet 列无法在文件中转换，列 : [Impressions], 预期为 : bigint, 发现:BINARY-6ren

apache-spark - spark 2.4 Parquet 列无法在文件中转换，列 : [Impressions], 预期为 : bigint, 发现:BINARY

转载作者：行者123 更新时间：2023-12-04 04:21:38

24

4

我正面临一个我无法理解的奇怪问题。

我有一个带有“印象”列的源数据，它有时是一个 bigint/有时是一个字符串(当我手动浏览数据时)。

为该列注册的 HIVE 模式为 Long。

因此，在加载数据时:

spark.sql("""
CREATE OR REPLACE TEMPORARY VIEW adwords_ads_agg_Yxz AS

SELECT
    a.customer_id
    , a.Campaign
    , ...
    , SUM(BIGINT(a.Impressions)) as Impressions
    , SUM(BIGINT(a.Cost))/1000000 as Cost
FROM adwords_ad a
LEFT JOIN ds_ad_mapping m ON BIGINT(a.Ad_ID) = BIGINT(m.adEngineId) AND a.customer_id = m.reportAccountId
WHERE a.customer_id in (...)
AND a.day >= DATE('2019-02-01')
GROUP BY
    a.customer_id
    , ...
""")

我确保所有内容都转换为 BIGINT。
错误发生在稍后的步骤中:

spark.sql("CACHE TABLE adwords_ads_agg_Yxz")

看到此错误后，我在笔记本中运行了相同的代码并尝试进行更多调试，首先确保转换发生在 BIGINT/long 列上:

from pyspark.sql.types import LongType

df = df.withColumn("Impressions", f.col("Impressions").cast(LongType()))
df.createOrReplaceTempView('adwords_ads_agg_Yxz')

然后从这个新转换的 df 打印模式:

root
 |-- customer_id: long (nullable = true)
 |-- Campaign: string (nullable = true)
 |-- MatchType: string (nullable = true)
 |-- League: string (nullable = false)
 |-- Ad_Group: string (nullable = true)
 |-- Impressions: long (nullable = true) <- Here!
 |-- Cost: double (nullable = true)

然后进行缓存，但错误仍然存在:

Spark Job Progress An error occurred while calling o84.sql. : org.apache.spark.SparkException: Job aborted due to stage failure: Task 9 in stage 47.0 failed 4 times, most recent failure: Lost task 9.3 in stage 47.0 (TID 2256, ip-172-31-00-00.eu-west-1.compute.internal, executor 10): org.apache.spark.sql.execution.QueryExecutionException: Parquet column cannot be converted in file s3a://bucket/prod/reports/adwords_ad/customer_id=1111111/date=2019-11-21/theparquetfile.snappy.parquet. Column: [Impressions], Expected: bigint, Found: BINARY

有没有人遇到过这个问题和/或会知道是什么导致了这个问题？

如果我删除缓存，则在尝试将数据写入 parquet 时会发生错误。
当我尝试刷新/编写临时表时，我也不知道为什么此时提到 adwords_ad 表

最佳答案

在 Parquet 上使用 hive table 时，
然后使用 SPARK 读取它，
SPARK 采用 Parquet 的架构，而不是配置单元表的定义。

在您的 Parquet 文件中，架构印象是一个二进制文件是有道理的，并且在 hive 表中它的 Long 无关紧要，因为 spark 从 Parquet 文件中获取架构。

关于apache-spark - spark 2.4 Parquet 列无法在文件中转换，列 : [Impressions], 预期为 : bigint, 发现:BINARY，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/59096125/

24

4

0

文章推荐： apache-kafka - 防止 Kafka 代理关闭空闲连接

文章推荐： cuda - 为CPU编译cuda代码

文章推荐： npm - 你如何在 package-lock.json 中增加一个传递依赖

parquet - parquet 可以支持并发写操作吗？
是否可以对 parquet 格式执行分布式并发写入？是否可以在写入拼花文件时读取它们？如果有并发读/写的方法，我有兴趣了解。提前感谢您的帮助。最佳答案我最终得到了 Parquet 开发人员的
parquet - 从命令行检查 Parquet
如何从命令行检查 Parquet 文件的内容？我现在看到的唯一选择是 $ hadoop fs -get my-path local-file $ parquet-tools head local-f
parquet - 如何使用 parquet-avro 在 parquet 文件中创建日期类型列
我正在使用基于 Java(1.8) 的应用程序使用库创建 Parquet 文件 org.apache.avro.Schema 和 org.apache.parquet.hadoop.ParquetWr
apache-spark - 为什么我不能使用 "cat file1.parquet file2. parquet > result.parquet"合并多个 Parquet 文件？
我已经使用 pyspark 创建了多个 parquet 文件，现在我正在尝试将所有 parquet 文件合并为 1 个。我能够合并这些文件，但是在读取生成的文件时，我遇到了错误。以前有人遇到过这个问题
parquet - 为什么排序后的 parquet 文件比未排序的文件大？
我创建了一个数据框，如下所示: expanded_1 = pd.DataFrame({"Point": [random.choice(points) for x in range(30000000)]
parquet - 如何读取箭头 Parquet 键值元数据？
当我在 R 和 Python 中保存 Parquet 文件(使用 pyarrow)时，我得到一个保存在元数据中的箭头模式字符串。如何读取元数据？它是 Flatbuffer 编码数据吗？架构的定义在哪
parquet - 是否可以分块读取 Parquet 文件？
例如，pandas 的 read_csv有一个 chunk_size允许 read_csv 的参数在 CSV 文件上返回一个迭代器，以便我们可以分块读取它。 Parquet 格式以块的形式存储数据，但
parquet - 无法从命令行获取 Parquet 工具
我正在尝试运行最新版本的 Parquet 工具，但遇到了一些问题。出于某种原因org.apache.hadoop.conf.Configuration不在阴影的 jar 里。 (我对 v1.6.0 也
parquet - 创建 Parquet 文件时如何避免创建.crc文件
我正在使用 Parquet 框架来编写 Parquet 文件。我使用此构造函数创建了 Parquet 作家- public class ParquetBaseWriter extends Parqu
parquet - 使用 presto 查询本地 Parquet
使用 spark 和钻头，我可以查询本地 Parquet 文件。 presto 是否提供相同的功能？换句话说，是否可以使用 presto 查询本地 Parquet 文件 - 无需通过 HDFS 或
parquet - 如何从 InputStream 读取 Parquet 记录
我有一个加密的 parquet 数据文件，它被读取为一个输入流。我想从此输入流中提取单个 Parquet 记录。有什么办法可以做到这一点吗？在 avro 中，使用 DatumReader 是可能的。我
parquet - 写入 Delta 编码的 Parquet 文件
我知道 Apache Arrow Parquet 可以读取符合规范的 Delta 编码文件，但不能将它们写出。我想知道是否有任何常用的开源 C++/Python 库可以写出符合 Parquet 规范的
parquet - 在 DuckDB 中读取分区的 Parquet 文件
背景: DuckDB 允许直接查询 parquet 文件。例如con.execute("从'Hierarchy.parquet'中选择 *) Parquet 允许按列值对文件进行分区。当一个 Parq
python - 使用python将一个 Parquet 文件分成3个 Parquet 文件
有没有办法将一个巨大的 parquet 文件分成较小的文件(使用 Python)？保留所有列并划分行？谢谢最佳答案你可以用 dask 来做. import dask.dataframe as dd
parquet - 使用从 parquet 文件创建的 dask 数据帧时内存使用过多
我的 Parquet 文件为 800K 行 x 8.7K 列。我将其加载到 dask 数据框中: import dask.dataframe as dd dask_train_df = dd.read
parquet - 如何使用 Pyarrow 更改 Parquet 文件中列的名称？
我有数百个用 PyArrow 创建的 Parquet 文件。然而，其中一些文件的字段/列的名称(我们称其为 Orange)与原始列(称其为 Sporange)略有不同，因为其中一个使用了查询的变体。否
hadoop - 如何限制配置单元中 Parquet 表的 Parquet 文件尺寸？
我正在尝试在配置单元中创建 Parquet 表。我可以创建它，但是当我运行 analyze table mytable compute statistics 时；我得到这个结果: numfiles=8
hadoop - 拥有一个大的 parquet 文件还是许多较小的 parquet 文件更好？
我知道 hdfs 会将文件拆分成大约 64mb 的 block 。我们有流式传输的数据，我们可以将它们存储到大文件或中等大小的文件中。列式文件存储的最佳大小是多少？如果我可以将文件存储到最小列为 64
parquet - Apache 的 Parquet Java API 的文档？
我想使用 Apache 的 parquet-mr 项目通过 Java 以编程方式读取/写入 Parquet 文件。我似乎找不到任何有关如何使用此 API 的文档(除了查看源代码并查看它的使用方式)——
sql - 尝试将数据从 Impala Parquet 表复制到非 Parquet 表
我在 Impala 中移动数据，而不是我的设计，我丢失了一些数据。我需要将数据从 Parquet 表复制回它们原来的非 Parquet 表。最初，开发人员使用脚本中的一个简单的一行来完成此操作。由于我

首页

博学

6Ren·AI

商城

apache-spark - spark 2.4 Parquet 列无法在文件中转换，列 : [Impressions], 预期为 : bigint, 发现:BINARY