sql - Apache Hive 查询 HiveQL-6ren

sql - Apache Hive 查询 HiveQL

转载作者：行者123 更新时间：2023-12-02 21:45:42

24

4

我正在学习 Hive 并想编写优化的 HiveQL/SQL 查询

我的表如下所示:

CREATE TABLE sales (dealer VARCHAR(25), make VARCHAR(25), type VARCHAR(25), day INT);
INSERT INTO sales (dealer, make, type, day) VALUES
("Xyz", "Highlander", "SUV", "0"),
("Xyz", "Prius", "HATCH", "1"),
("Xyz", "Prius", "HATCH", "2"),
("Xyz", "Prius", "HATCH", "3"),
("Xyz", "Versa", "HATCH", "1"),
("Xyz", "Versa", "HATCH", "2"),
("Xyz", "Versa", "HATCH", "3"),
("Xyz", "S3", "SEDAN", "1"),
("Xyz", "S3", "SEDAN", "2"),
("Abc", "Forrester", "SUV", "1");

给定一个“经销商”D，我想在单个查询中计算过去 X 天内每种“类型”的前 N 个“品牌”。

SELECT dealer, make, type, COUNT(*) AS frequency FROM sales
WHERE day > 0 AND dealer LIKE 'Xyz' GROUP BY make, type
ORDER BY frequency DESC LIMIT 5

问题是在前 1 的“make”和“type”上使用 GROUP BY 时，我只会得到:

DEALER, MAKE, TYPE, COUNT
Xyz, Prius, Hatch, 3
Xyz, Versa, Hatch, 3
Xyz, S3, Sedan, 2
...

但我想要

Xyz, Prius, Hatch, 3
Xyz, S3, Sedan, 2
...

对于每个“类型”，前 N 个。

有人可以帮我理解如何编写这样的查询吗？

SQL fiddle
http://sqlfiddle.com/#!2/df9304/5

****更新****

似乎 rank() 会很有用:

Hive getting top n records in group by query

https://blogs.oracle.com/taylor22/entry/hive_0_11_may_15

HiveQL and rank()

最佳答案

在阅读了更多文档和链接问题的提示后:

SELECT dealer, make, rank, type FROM (
    SELECT dealer, make, rank() OVER (PARTITION BY type ORDER BY count DESC) AS rank, type FROM (
        SELECT dealer, make, count(*) AS count, type FROM Sales WHERE dealer = "Xyz" GROUP BY dealer, type, make
    ) CountedSales
) RankedSales
WHERE RankedSales.rank < 3;

内部查询执行计数，中间查询执行 rank()，外部查询限制排名。

销售表内容

hive> select * from Sales;
OK
Xyz      Highlander      SUV    NULL
Xyz      Highlander      SUV    NULL
Xyz      Rouge   SUV    NULL
Xyz      Rouge   SUV    NULL
Xyz      Prius   HATCH  NULL
Xyz      Prius   HATCH  NULL
Xyz      Prius   HATCH  NULL
Xyz      Versa   HATCH  NULL
Xyz      S3      SEDAN  NULL
Xyz      S3      SEDAN  NULL
Xyz      S3      SEDAN  NULL
Xyz      A8      SEDAN  NULL
Xyz      A8      SEDAN  NULL
Xyz      A8      SEDAN  NULL
Xyz      A8      SEDAN  NULL
Time taken: 0.054 seconds, Fetched: 15 row(s)

现在是实际查询。

hive> SELECT dealer, make, rank, type FROM (                                                                          
    >     SELECT dealer, make, rank() OVER (PARTITION BY type ORDER BY count DESC) AS rank, type FROM (
    >         SELECT dealer, make, count(*) AS count, type FROM Sales WHERE dealer = "Xyz" GROUP BY dealer, type, make
    >     ) CountedSales
    > ) RankedSales
    > WHERE RankedSales.rank < 3;
...
Execution completed successfully
MapredLocal task succeeded
OK
Xyz      Prius  1        HATCH
Xyz      Versa  2        HATCH
Xyz      A8     1        SEDAN
Xyz      S3     2        SEDAN
Xyz      Rouge  1        SUV
Xyz      Highlander     1        SUV
Time taken: 28.491 seconds, Fetched: 6 row(s)

关于sql - Apache Hive 查询 HiveQL，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/25465662/

24

4

0

文章推荐： r - 在Mac(iMac OSX)终端中远程运行脚本(r脚本)到其他计算机

文章推荐： reporting-services - 原生模式和集成模式的区别

文章推荐： regex - OpenEdge 中的正则表达式

文章推荐： python - Hadoop流式传输命令失败

hive - 无需定义 hive 表结构即可在 hive 中导入数据平面文件
我可以将 CSV 或任何其他平面文件导入到 hive 中，而无需先在 hive 中创建和定义表结构吗？假设我的 csv 文件有 200 列，需要导入到 hive 表中。所以我必须首先在 hive 中创
hive - hive 中的爆炸功能
我有以下示例数据，我试图在 hive 中爆炸它.. 我使用了 split 但我知道我错过了一些东西.. ["[[-80.742426,35.23248],[-80.740424,35.23184],[
hive - Hive 是否重复数据？
我有一个很大的日志文件，我加载到 HDFS . HDFS将根据机架感知复制到不同的节点。现在我将相同的文件加载到配置单元表中。命令如下: create table log_analysis (log
hive - Hive 中的解析异常
我正在尝试使用 UDF在 hive 中。但是当我尝试使用 userdate as 'unixtimeToDate' 创建一个临时函数时，我得到这个异常(exception) hive> create
hive - Hive 有休眠功能吗？
在Mysql中，我们可以使用DO sleep(5) ;来进行暂停。但它在 Hive 中不起作用。 Hive有 sleep 功能吗？最佳答案你可以通过反射调用Thread让hive在处理每一行后多等
hive - 将数据导入包含空格的 Hive
我正在将数据从 csv 文件导入 Hive。我的表包含字符串和整数。但是，在我的输入文件中，整数周围有空格，所以它看起来像这样: some string, 2 ,another stri
hive - Hive 中的嵌套选择
我可以嵌套吗select在 Hive 中具有不同的条件？例如如果我有以下两个 Hive 查询: select percentile(x, 0.95) from t1 where y = 1; sel
hive - Hive 安装在什么模式下？
hive 安装有什么特定的模式吗？例如，Hadoop 安装有 3 种模式:独立、伪分布式和完全分布式。同样，Hive 是否有任何特定类型的分布？ Hive 可以分布式安装吗？最佳答案 Hive
hive - Hive 中的日期比较
我正在使用 Hive，我有一个结构如下的表: CREATE TABLE t1 ( id INT, created TIMESTAMP, some_value BIGINT ); 我需要找到
hive - hive 、黑斑羚和直线之间的区别
我是 Hadoop 生态系统工具的新手。任何人都可以帮助我了解 hive 、直线和 hive 之间的区别。提前致谢! 最佳答案 Apache hive : 1] Apache Hive 是一个建立
hive - Hive 中的数组字面量
如何在 Hive 中写出数组文字？ SELECT PERCENTILE(my_column, [0.5, 0.25, 0.50, 0.75, 0.95]) AS quantiles FROM my_t
hive - Hive Alter表更改列名
我正在尝试在Hive中重命名columnName。是否可以在Hive中重命名列名称。 tableA(栏1，_c1，_c2) 至 tableA(column1，column2，column3) ?? 最
hive - HIVE 中的减号查询
减号查询似乎在 HIVE 中不起作用。尝试过: select x from abc minus select x from bcd ; 我做错了还是没有为 HIVE 定义负查询？如果是这样，还有其他
hive - 使用 Hive-JDBC 在 Hive 中批量插入
我正在尝试使用 hive-jdbc 连接将数据插入 Hive (NON-ACID) 表。如果我在“语句”中执行单个 SQL 查询，它就可以工作。如果我尝试使用“addBatch”对 SQL 进行批处理
hive - 如何获取列名并输入 hive
我知道这些，要获取表中的列名，我们可以触发: show columns in . 要获取表的描述(包括 column_name、column_type 和许多其他详细信息): describe [f
hive - Hive 表名最大字符数限制是多少？
无法找到有关 Hive 表最大字符限制的合适规范。我正在开发一个涉及 hive 表的 ETL 过程，这些表已指定格式为 _ 的命名约定，并且提供的表名称远大于 30 字节(pl/sql 的正常限制)
hive - Hive 元存储和名称节点在集群中起什么作用？
在安装了Hive的集群中，metastore和namenode有什么？我了解 Metastore 拥有所有表架构、分区详细信息和元数据。现在这个元数据是什么？那么namenode有什么呢？这个元存储在
hive - Hive 动态分区和静态分区的主要区别
Hive 中静态分区和动态分区的主要区别是什么？使用单独的插入意味着静态，而对分区表的单个插入意味着动态。还有什么优点吗？最佳答案在静态分区中，我们需要在每个 LOAD 语句中指定分区列值。假设
hive - Hive 中的数据透视表
我是 hadoop 和 hive 的新手。如果有人研究过pivot in hive的概念，请与我分享。例如:来自 teradata 或 oracle 的数据未转置，这些数据应在 hive 中转置。那
hive - hive 面试问题中的分区
1)如果分区列没有数据，那么当你查询它时，你会得到什么错误？ 2)如果某些行没有分区列，这些行将如何处理？会不会有数据丢失？ 3)为什么需要对数字列进行分桶？我们也可以使用字符串列吗？流程是什么？您将

首页

博学

6Ren·AI

商城

sql - Apache Hive 查询 HiveQL