hadoop - hive 查询 : Is there a way to use UDTF with `cluster by` ?-6ren

hadoop - hive 查询 : Is there a way to use UDTF with `cluster by` ?

转载作者：可可西里更新时间：2023-11-01 14:51:45

25

4

已解决:

原来是我的UDTF出错了。我找到了一个修复程序，但我不太明白为什么它会起作用。当初我实现UDTF的时候，Eclipse提示initialize is deprecated。但是如果我跳过它就会出错，所以我还是实现了它。我在那个方法里放了一个变量初始化，猜测init只做一次。该 jar 适用于一些更简单的场景，但如果我要将 UDTF 输出与 UDF 一起使用，则使用 UDF 输出来做一些事情，例如作弊的 cluster by 或 insert，我得到了前面提到的错误。我的工程师 friend 发现 initialize 实际上被执行了不止一次。所以我只是将初始化放在 process 中，使用 if 检查变量是否为 null，如果是则初始化它。然后一切正常，我的作弊也奏效了。尽管如此，如果有人能给我一个解释，我将不胜感激。

以下是我原来的问题:

我知道我不应该在 UDTF 之后使用 cluster by，所以 select myudtf("stringValue") cluster by rand() 不起作用。

但是由于我的udtf每小时输出7000+行并且还在增长，所以我确实需要将后续处理分发到我所有的hadoop集群从属单元。

而且我想如果不使用 cluster by rand() 就无法做到这一点，所以我尝试了以下作弊:

首先，我用另一个表来包装结果，select key from (select myudtf("stringValue") as key) t limit 1; 它给出了正确的结果，

OK
some/key/value/string
Time taken: 0.035 seconds, Fetched: 1 row(s)

然后我添加 cluster by 部分，select key from (select myudtf("stringValue") as key) t cluster by rand() limit 1，然后我得到错误:

WARNING: Hive-on-MR is deprecated in Hive ...
....

Task with the most failures(4): 
-----
Task ID:
  task_....

URL:
  http:....
....
-----
Diagnostic Messages for this Task:
Error: tried to access class sun.security.ssl.SSLSessionContextImpl from class sun.security.ssl.SSLSessionContextImplConstructorAccess

FAILED: Execution Error, return code 2 from org.apache.hadoop.hive.ql.exec.mr.MapRedTask
MapReduce Jobs Launched: 
Stage-Stage-1: Map: 1  Reduce: 1   HDFS Read: 0 HDFS Write: 0 FAIL
Total MapReduce CPU Time Spent: 0 msec

我这样做是为了欺骗 hive 以将临时表 t 视为“普通”表，我可以将 cluster by 应用于该表，希望它将分发所有 hadoop 从站的工作负载，但不幸的是，hive 足够聪明，可以识破我尝试的拙劣技巧。

那么，有人可以帮我澄清我的误解，或者给我一些正确的方法吗？

仅供引用，我向我公司一位经验丰富的工程人员寻求帮助，他认为这可能是一个更深层次的系统级错误，他在下类前尝试跟踪问题 20 分钟左右，他确实发现了一些库版本问题但终究无法解决问题。 ......我只是猜想这一定是我做错了什么。

最佳答案

原来是我的UDTF出错了。我找到了一个修复程序，但我不太明白为什么它会起作用。当初我实现UDTF的时候，Eclipse提示initialize is deprecated。但是如果我跳过它就会出错，所以我还是实现了它。我在那个方法里放了一个变量初始化，猜测init只做一次。该 jar 适用于一些更简单的场景，但如果我要将 UDTF 输出与 UDF 一起使用，则使用 UDF 输出来做一些事情，例如作弊的 cluster by 或 insert，我得到了前面提到的错误。我的工程师 friend 发现初始化实际上被执行了不止一次。所以我只是将初始化放在 process 中，使用 if 检查变量是否为 null，如果是则初始化它。然后一切正常，我的作弊也奏效了。尽管如此，如果有人能给我更具体的解释，我将不胜感激。

关于hadoop - hive 查询 : Is there a way to use UDTF with `cluster by` ?，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/42812744/

25

4

0

文章推荐： java - Hadoop伪分布式模式下各种守护进程的IP地址

文章推荐： windows - Vb.net 读取文件后不关闭文件

文章推荐： html - 响应式圆形裁剪照片

文章推荐： javascript - 浏览器与 insertUnorderedList 的差异

MySQL相似表的索引使用不一致: 'Using index' and 'Using where; Using index'
我在优化 JOIN 以使用复合索引时遇到问题。我的查询是: SELECT p1.id, p1.category_id, p1.tag_id, i.rating FROM products p1
sql - 优化查询以删除 "Using where; Using temporary; Using filesort"
我有一个简单的 SQL 查询，我正在尝试对其进行优化以删除“使用位置；使用临时；使用文件排序”。这是表格: CREATE TABLE `special_offers` ( `so_id` int
mysql - EXPLAIN 语句说 'Using where; Using index' 如果在查询中设置了 USE INDEX() 否则就说 'Using where'
我有一个具有以下结构的应用程序表 app_id VARCHAR(32) NOT NULL, dormant VARCHAR(6) NOT NULL, user_id INT(10) NOT NULL
mysql - Extra :-Using where; Using temporary; Using filesort如何优化MYSQL
此查询的正确索引是什么。我尝试为此查询提供不同的索引组合，但它仍在使用临时文件、文件排序等。总表数据 - 7,60,346 产品= '连衣裙' - 总行数 = 122 554 CREATE TAB
mysql - 为什么额外的是 "using where;using index"而不是 "using index"
为什么额外的是“使用where;使用索引”而不是“使用索引”。 CREATE TABLE `pre_count` ( `count_id`
按日期排序时，MySQL 数据库使用 "Using where; Using temporary; Using filesort"
我有一个包含大量记录的数据库，当我使用以下 SQL 加载页面时，速度非常慢。 SELECT goal.title, max(updates.date_updated) as update_sort F
MySQL - 'Using index condition' 与 'Using where; Using index'
我想知道 Using index condition 和 Using where 之间的区别；使用索引。我认为这两种方法都使用索引来获取第一个结果记录集，并使用 WHERE 条件进行过滤。 Q1。有什
Cannot setup TypeScript to use `using` keyword(无法将TypeScript设置为使用“using”关键字)
I am using TypeScript 5.2 version, I have following setup:我使用的是TypeScript 5.2版本，我有以下设置： { "
Cannot setup TypeScript to use `using` keyword(无法将TypeScript设置为使用“using”关键字)
I am using TypeScript 5.2 version, I have following setup:我使用的是TypeScript 5.2版本，我有以下设置： { "
Cannot setup TypeScript to use `using` keyword(无法将TypeScript设置为使用“using”关键字)
I am using TypeScript 5.2 version, I have following setup:我使用的是TypeScript 5.2版本，我有以下设置： { "
mysql - 如何避免MySQL中的 "Using index; Using temporary; Using filesort "，21表JOIN
mysql Ver 14.14 Distrib 5.1.58，用于使用 readline 5.1 的 redhat-linux-gnu (x86_64) 我正在接手一个旧项目。我被要求加快速度。我通过
mysql - OrmLite(服务堆栈): Only use temporary db-connections (use 'using' ?)
在过去 10 多年左右的时间里，我一直打开数据库 (mysql) 的连接并保持打开状态，直到应用程序关闭。所有查询都在连接上执行。现在，当我在 Servicestack 网页上看到示例时，我总是看到
sql - 优化 MySQL 查询以避免 "Using where; Using temporary; Using filesort"
我使用 MySQL 为我的站点构建了一个自定义论坛。列表页面本质上是一个包含以下列的表格:主题、上次更新和# Replies。数据库表有以下列: id name body date topic_id
mysql - EXPLAIN中的 "Using index"和 "Using where; Using index"有什么区别
在mysql中解释的额外字段中你可以得到: 使用索引使用where;使用索引两者有什么区别？为了更好地解释我的问题，我将使用下表: CREATE TABLE `test` ( `id` bi
using - Haxe中的 `using`关键字是什么？
我经常看到人们在其Haxe代码中使用关键字using。它似乎在import语句之后。例如，我发现这是一个代码片段: import haxe.macro.Context; import haxe.ma
克洛尤尔 : how do I use use "and" in "reduce"?
这个问题在这里已经有了答案: "reduce" or "apply" using logical functions in Clojure (2 个答案) 关闭 8 年前。 “and”似乎是一个宏，
克洛尤尔 : how do I use use "and" in "reduce"?
这个问题在这里已经有了答案: "reduce" or "apply" using logical functions in Clojure (2 个答案) 关闭 8 年前。 “and”似乎是一个宏，
c++ - 注册表模式 : to use or not to use
我正在考虑在我的应用程序中使用注册表模式来存储指向某些应用程序窗口和 Pane 的弱指针。应用程序的一般结构如下所示。该应用程序有一个 MainFrame 顶层窗口，其中有几个子 Pane 。可以有
When to use == and when to use is?(什么时候使用==，什么时候使用IS？)
奇怪的是：。似乎a是b或多或少被定义为id(A)==id(B)。用这种方式制造错误很容易：。有些名字出人意料地出现在Else块中。解决方法很简单，我们应该使用ext==‘.mp3’，但是如果ext表面
mysql - 优化 'GROUP BY'-查询，消除 'Using where; Using temporary; Using filesort'
我遇到了一个我似乎无法解决的 MySQL 问题。为了能够快速执行用于报告目的的 GROUP BY 查询，我已经将几个表非规范化为以下内容(该表由其他表上的触发器维护，我已经同意了与此): DROP T

首页

博学

6Ren·AI

商城

hadoop - hive 查询 : Is there a way to use UDTF with `cluster by` ?