json - 如何从另一个平面/简单的配置单元表中使用 map[structs] 加载配置单元表-6ren

json - 如何从另一个平面/简单的配置单元表中使用 map[structs] 加载配置单元表

转载作者：可可西里更新时间：2023-11-01 14:22:30

26

4

我在 hive 中有 2 个表，其中包含 Order 和 Order_Detail(具有 1:n 关系并在 order_id 上连接)，我试图利用 hive 复杂数据类型 - map[struct] 加载到单个表。

假设 ORDER 有以下数据，

Order_id total_amount 客户

123 10.00 1

456 12.00 2

和 ORDER_DETAILS 有

Order_id Order_Item_id Item_amount Item_type

123 1 5.00 A

123 2 5.00 B

456 1 6.00 A

456 2 3.00 B

456 3 3.00℃

我想创建单个表 ORDERS，其中包含所有订单列和 order_detail 列作为结构映射。这有助于我将相关数据和查询组合在一起，从而避免频繁连接。我尝试使用带有相应 serde 的 txt/json 文件输入来加载具有复杂数据类型的表，并且效果很好。但在这种情况下，我想将现有的 2 个 ORCFile 格式的配置单元表中的数据加载到新表中。已尝试使用 named_struct 函数进行一些基本插入，但它会分别加载每一行，并且不会将相同的 order_id 合并到一行中。

预期输出类似 ,

123 10.00 1 [1:{5.00,A},2:{5.00,B}]

456 12.00 2 {1:{6.00,A}, 2:{3.00,B},3:{3.00,C}]

但我明白了，

123 10.00 1 [1:{5.00,A}]

123 10.00 1 [2:{5.00,B}]

456 12.00 2 {1:{6.00,A}]

456 12.00 2 {2:{3.00,B}]

456 12.00 2 {3:{3.00,C}]

请帮助我理解仅通过从 2 个表中选择 INSERT INTO 表来实现此目的的方法。提前致谢。

最佳答案

我找到了一种使用 map 、 named_struct 函数和 David Worms 在 to_map UDF blog 上发布的自定义 UDF to_map 来执行此操作的方法。这是示例，

CREATE TABLE ORDER(
  order_id bigint,
  total_amount bigint,
  customer bigint)
ROW FORMAT DELIMITED
FIELDS TERMINATED BY ','
STORED AS INPUTFORMAT 'org.apache.hadoop.mapred.TextInputFormat'
OUTPUTFORMAT 'org.apache.hadoop.hive.ql.io.HiveIgnoreKeyTextOutputFormat';

CREATE TABLE ORDER_DETAILS(
  order_id bigint,
  Order_Item_id bigint,
  Item_amount bigint,
  Item_type string)
ROW FORMAT DELIMITED
FIELDS TERMINATED BY ','
STORED AS INPUTFORMAT
  'org.apache.hadoop.mapred.TextInputFormat'
OUTPUTFORMAT
  'org.apache.hadoop.hive.ql.io.HiveIgnoreKeyTextOutputFormat';

CREATE TABLE ORDERS(
  order_id bigint,
  Order_Items map < bigint, struct < Item_amount: bigint, Item_type: string >> ,
  total_amount bigint,
  customer bigint)
ROW FORMAT SERDE 'org.apache.hadoop.hive.ql.io.orc.OrcSerde'
STORED AS INPUTFORMAT 'org.apache.hadoop.hive.ql.io.orc.OrcInputFormat'
OUTPUTFORMAT 'org.apache.hadoop.hive.ql.io.orc.OrcOutputFormat';

Insert overwrite table ORDERS
select
a.order_id,
  a.order_items,
  b.total_amount,
  b.customer
from
  (select order_id as order_id,
    to_map(order_item_id, named_struct("item_amount", item_amount, "item_type", item_type)) as order_items from ORDER_DETAILS group by order_id) a
JOIN ORDER b ON(a.order_id = b.order_id);

从订单中选择*；

123 {1:{"Item_amount":5,"Item_type":"A"},2:{"Item_amount":5,"Item_type":"B"}} 10 1

456 {1:{"Item_amount":6,"Item_type":"A"},2:{"Item_amount":3,"Item_type":"B"},3:{"Item_amount":3, "Item_type":"C"}} 12 2

希望对大家有帮助。

关于json - 如何从另一个平面/简单的配置单元表中使用 map[structs] 加载配置单元表，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/26403396/

26

4

0

文章推荐： windows - 带引号的任务计划程序参数不起作用

文章推荐： sql - 比较 HIVE 中的两个表

文章推荐： hadoop - 结合 AWS EMR 输出

文章推荐： hadoop - 从命令行在 Hadoop 中检测压缩编解码器

java - 配置 logback 以遵循 Java 配置，也就是 Logback 的纯 Java 配置
我只是不喜欢 Logback 的 XML 或 Groovy 配置，而更喜欢用 Java 进行配置(这也是因为我将在初始化后的不同时间在运行时更改配置)。似乎对 Logback 进行 Java 配置的
yaml - sphinx 配置 ||配置/sphinx.yml
我的 sphinx 配置是: ================================ config/sphinx.yml development: bin_path: "/usr/loc
Sitecore 性能优化 - Sitecore 配置、IIS 配置
我们计划在生产服务器中部署我们的系统。我有兴趣了解更多有关优化网站性能的信息。 Sitecore 有哪些优化建议？ (缓存，网络配置中的其他设置) 我们可以在 IIS 中做哪些优化？找不到关于这些主
python - 根目录上静态站点的 Apache 配置，子位置上的 Django 配置
我有一个 Django 应用程序，可以处理网站的两个(或更多)部分，例如网站的“admin”和“api”部分。我还为网站的其余部分提供了普通的 html 页面，其中不需要 Django。例如，我希望
node.js - 配置 Dockerfile 以设置 AWS 配置
我刚刚开始研究Docker。我有一个 Node 应用程序，可以调整大小和图像，然后在完成后向 aws 发送 SQS 消息。我已成功创建应用程序的 docker 镜像，并从本地计算机复制它，但遇到了无法
ant - 如何在 Hudson 中为 Ant 配置 checkstyle 配置？
如何配置 checkstyle(在 Ant nt Maven 中)任务？我尝试了一点，但没有正确收到报告。这是我的 Ant 脚本。
java - 如何将 xml 配置 bean 转换为 Java 配置 bean？
我正在使用 Quartz 和 Spring 框架重写一个遗留项目。原始配置是 XML 格式，现在我将其转换为 Java Config。 xml 配置使用 jobDetail 设置触发器 bean 的作
mysql - 最佳 Mysql 配置(分区)和索引/Hypertable/RAID 配置(大数据库)
tl;rd: 使用主键对数据库进行分区索引大小问题。数据库大小每天增长约 1-3 GB 突袭设置。您有使用 Hypertable 的经验吗？长版: 我刚刚建立/购买了一个家庭服务器: 至强 E
使用图形 API 配置 GCP 的 Azure AD saml 配置 "Sign on URL"
在安装 gcp 应用程序后，我们尝试使用 GCP 的图形 api 配置 Azure Active Directory saml 配置。我们正在遵循相同的 AWS graph api saml 设置 U
java - 如何使用 Spring-Security 3 和 Hibernate 4 将 spring security xml 配置 hibernate 转换为 java 配置
我刚刚了解了 spring security 并想使用 java hibernate 配置连接到数据库，但我发现的示例或教程很少。我通过使用 xml 配置找到了更多。我在这里使用 Spring 4.0
java - 是否可以通过 jboss-deployment-struction.xml 配置 JPA 2.1，为 Spring 4 和 Hibernate 4.3.10 配置 JBoss EAP 6.4.x？
我们最近切换到 Java 8 以使用 java.time API(LocalDate、LocalDateTime，...)。因此，我们将 Hibernate 依赖项更新到版本 4.3.10。我们编写了
quarkus实战之六：配置
欢迎访问我的GitHub 这里分类和汇总了欣宸的全部原创(含配套源码)：https://github.com/zq2599/blog_demos 本篇概览本文是《quarkus实战》系列的第六篇，咱
NGINX 配置 :
我是 NGINX 的新手，我正在尝试对我们的 ERP 网络服务器进行负载平衡。我有 3 个网络服务器在由 websphere 提供支持的端口 80 上运行，这对我来说是一个黑盒子: * web01.e
Gerrit 配置
我们想使用 gerrit 进行代码审查，但我们在 webview 中缺少一些设置。是否可以禁止提交者审查/验证他们自己的提交？是否有可能两个审稿人给 +1 一个累积它到+2，以便可以提交？谢
AEM 配置
配置根据运行模式应用于 AEM 实例。在多个运行模式和多个配置的情况下，AEM 如何确定要选择的配置文件？假设以下配置在 AEM 项目中可用， /apps /myproject - con
Neo4j 配置
我正在使用 Neo4j 服务器。我遇到了负载相对较低的问题。但是，响应时间相当长。我认为为请求提供服务的线程数太少了。有没有办法调整为 HTTP 请求提供服务的线程池的大小。那可能吗？最佳答案线程
CELERYD_OPTS 配置
我在/etc/default/celeryd 中有以下配置 CELERYD_NODES = "worker1 worker2 worker3" CELERYD_CHDIR = "path to pro
Plone 配置
Plone 在其页面中显示来 self 的母语(巴西葡萄牙语)的特殊字符。但是，当我使用我创建的 spt 页面时，它会显示转义序列，例如: Educa\xc3\xa7\xc3\xa3o 代替 Educ
Emacs 配置
我正在尝试开始使用 Emacs/Clojure。安装 emacs 扩展的正确方法是什么。我正在尝试安装以下插件: https://bitbucket.org/kotarak/vimclojure 我已
CMake 配置
我有一个简单的 C 项目结构: proj/ src/ docs/ build/ tests/ lib/ 尝试编写合适的 CMake 文件。到目前为止我的尝试:http://pas

首页

博学

6Ren·AI

商城

json - 如何从另一个平面/简单的配置单元表中使用 map[structs] 加载配置单元表