hadoop - HQL引发的ArrayList无法强制转换为org.apache.hadoop.io.Text-6ren

hadoop - HQL引发的ArrayList无法强制转换为org.apache.hadoop.io.Text

转载作者：行者123 更新时间：2023-12-02 19:53:27

28

4

我有一个查询，当减少时失败，抛出的错误是:

Error: Error while processing statement: FAILED: Execution Error, return code 2 from org.apache.hadoop.hive.ql.exec.mr.MapRedTask (state=08S01,code=2)

但是，当深入了解YARN日志时，我能够找到以下内容:

Error: java.lang.RuntimeException: org.apache.hadoop.hive.ql.metadata.HiveException: Hive Runtime Error while processing row (tag=0) {"key":{"reducesinkkey0":"2020-05-05","reducesinkkey1":10039,"reducesinkkey2":103,"reducesinkkey3":"2020-05-05","reducesinkkey4":10039,"reducesinkkey5":103},"value":{"_col0":103,"_col1":["1","2"]}} at org.apache.hadoop.hive.ql.exec.mr.ExecReducer.reduce(ExecReducer.java:265) at org.apache.hadoop.mapred.ReduceTask.runOldReducer(ReduceTask.java:444) at org.apache.hadoop.mapred.ReduceTask.run(ReduceTask.java:392) at org.apache.hadoop.mapred.YarnChild$2.run(YarnChild.java:164) at java.security.AccessController.doPrivileged(Native Method) at javax.security.auth.Subject.doAs(Subject.java:422) at org.apache.hadoop.security.UserGroupInformation.doAs(UserGroupInformation.java:1920) at org.apache.hadoop.mapred.YarnChild.main(YarnChild.java:158) Caused by: org.apache.hadoop.hive.ql.metadata.HiveException: Hive Runtime Error while processing row (tag=0) {"key":{"reducesinkkey0":"2020-05-05","reducesinkkey1":10039,"reducesinkkey2":103,"reducesinkkey3":"2020-05-05","reducesinkkey4":10039,"reducesinkkey5":103},"value":{"_col0":103,"_col1":["1","2"]}} at org.apache.hadoop.hive.ql.exec.mr.ExecReducer.reduce(ExecReducer.java:253) ... 7 more Caused by: java.lang.ClassCastException: java.util.ArrayList cannot be cast to org.apache.hadoop.io.Text

最相关的部分是:

java.util.ArrayList cannot be cast to org.apache.hadoop.io.Text

这是我正在执行的查询(仅供引用:这是较大查询中的子查询):

SELECT
    yyyy_mm_dd,
    h_id,
    MAX(CASE WHEN rn=1 THEN prov_id ELSE NULL END) OVER (partition by yyyy_mm_dd, h_id) as primary_prov,
    collect_set(api) OVER (partition by yyyy_mm_dd, h_id, p_id) prov_id_api, --re-assemple array to include all elements from multiple initial arrays if there are different arrays per prov_id
    prov_id
FROM(
    SELECT --get "primary prov" (first element in ascending array))
        yyyy_mm_dd,
        h_id,
        prov_id,
        api,
        ROW_NUMBER() OVER(PARTITION BY yyyy_mm_dd, h_id ORDER BY api) rn
    FROM(
        SELECT --explode array to get data at row level
            t.yyyy_mm_dd,
            t.h_id,
            prov_id,
            collect_set(--array of integers, use set to remove duplicates
                CASE
                    WHEN e.apis_xml_element = 'res' THEN 1
                    WHEN e.apis_xml_element = 'av'  THEN 2
                    ...
                    ...
                    ELSE e.apis_xml_element
                END) as api
        FROM
            mytable t
            LATERAL VIEW EXPLODE(apis_xml) e AS apis_xml_element
        WHERE
            yyyy_mm_dd = "2020-05-05"
            AND t.apis_xml IS NOT NULL
        GROUP BY
            1,2,3
        )s
    )s

我进一步将问题缩小到顶级选择，因为内部选择本身可以正常工作，这使我相信问题在这里特别发生:

collect_set(api) OVER (partition by yyyy_mm_dd, h_id, prov_id) prov_id_api

但是，我不确定如何解决。在最内部的选择中， apis_xml是一个 array<string>，它将诸如'res'和'av'之类的字符串保留到一个点。然后使用整数。因此，案例陈述使这些一致。
奇怪的是，如果我通过Spark来运行它，即 spark.sql=(above_query)，它就可以工作。但是，在通过HQL的直线上，工作被杀死了。

最佳答案

在内部查询中删除collect_set，因为它已经产生了数组，所以上面的collect_set应该接收标量。还要在内部查询中删除group by，因为没有collect_set，就不再有聚合。如果需要删除重复项，可以使用DISTINCT

关于hadoop - HQL引发的ArrayList无法强制转换为org.apache.hadoop.io.Text，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/62514737/

28

4

0

文章推荐： javascript - HTML 单选按钮

文章推荐： hadoop - Impala 和 mem_limit

SharePointOnlineCredentials 引发 ComException
我正在使用 SharePoint Online 并使用 Windows Azure 托管访问 SPO 的进程。我们已将启动任务添加到 Azure 角色以安装 http://www.microsoft
python - 引发 FileNotFoundError
我有一个函数，它获取包含时间的源文件(csv 文件)，读取它，然后按顺序对行进行排序并将它们写入目标文件中。但是，如果源 csv 文件不存在，我需要引发 FileNotFoundError。我之前曾引
Python 引发 NotADirectoryError
我试图在目录不存在时引发错误，然后再打开该目录中的文件。根据this response我应该为我的问题使用最具体的异常构造函数，我认为它是 NotADirectoryError。但是运行下面的代码我得
c# - 引发/生成空引用异常背后的CLR实现是什么？
在编码/开发生命的一天或另一天，我们确实遇到了这个特殊的情况，这是最常见的异常(exception)之一。我的问题是关于的而不是。为什么(我知道当我们尝试访问实际上指向null的引用变量的属性时会引发
Python 引发/捕获异常
我想知道在 python 中是否可以在一个 except block 中引发异常并在稍后的 except block 中捕获它。我相信其他一些语言默认会这样做。这是它的样子" try: som
python - Mechanize 引发 BrowserStateError
我有以下代码: br = mechanize.Browser() br._factory.is_html = True br.form = mechanize._form.ParseString(''
oracle - TOO_MANY_ROWS 引发，但变量仍然获得一个值
我刚刚发现，如果您有一个引发 TOO_MANY_ROWS 异常的 SELECT INTO，该变量仍会从查询检索到的第一条记录中分配值。这是预期的行为吗？这是我的例子: for co in my_cu
ssh - 引发 ssh 远程主机标识的所有原因都已更改
当 SSH 显示 WARNING: REMOTE HOST IDENTIFICATION HAS CHANGED! 我知道当您重新安装远程服务器时会发生这种情况，但我尝试列出其他原因 . 我知道如何
java - EnumMap 引发 NullPointerException
我有一个枚举和一个 EnumMap . 我将 map 放入一个类中以隐藏“字节”值。所以我有一个set(Parameter, int)和set(Parameter, boolean)方法。 publi
redis-py 引发 AttributeError
在什么情况下会redis-py引发以下 AttributeError 异常？ redis-py 不是设计来引发仅基于 redis.exceptions.RedisError 的异常吗？什么是合理的处
.net - 如何可重复地导致/引发 ReflectionTypeLoadException？
可悲的是，对此异常的引用通常具有异国情调，并且可能发生在您例如通过 Assembly.GetTypes() 枚举类型- 举个例子，它发生在我们的一个部署上，但同一组程序集在集成服务器上运行良好。为了
android - Python 引发 SyntaxError
我正在为 Android 下的特定平板电脑克隆一个存储库并获取源代码，我必须执行一个 python 脚本。当我执行它时，我收到此错误消息: Traceback (most recent call la
android - 引发 PRIORITY_MAX 通知后隐藏前台服务的状态栏通知图标
首先，执行此操作(在运行 4.4.2 的 Nexus 5 上测试): 将 PRIORITY_LOW 通知传递给 Service.startForeground()。观察通知不显示在状态栏中。使用相
python - get_num_instances 引发 InvalidVersionError
我尝试使用 AppEngine 的 python 模块 api 来获取使用基本缩放的模块的实例数。在我模块的 yaml 文件中，我明确设置了 max_instances 参数。我希望 get_num_
python - Spark 引发 OutOfMemoryError
当我如下运行我的 spark python 代码时: import pyspark conf = (pyspark.SparkConf() .setMaster("local")
python - QXmlStreamReader 引发 UnicodeEncodeError
在我的系统上，一段适用于 Python 2 的代码不适用于 Python 3。 f = open("plotwidget.svg") svgData = f.read() xml_stream = Q
PHP 引发 SQL 语法错误
我是 PHP 和 SQL 的新手，但我正在创建一个登录系统。我遇到的问题是: You have an error in your SQL syntax; check the manual that c
python - error_check 引发 ConnectionError
我有一个使用 ebaysdk 库的 python 代码，当我运行代码并输入关键字进行搜索时，我得到了这个错误。 Traceback (most recent call last): File "eba
python - Werkzeug 引发 BrokenFilesystemWarning
当我将表单数据发送到我的 Flask 应用程序时，出现以下错误。它说它将使用 UTF-8 编码，但语言环境已经是 UTF-8。这个错误是什么意思？ /home/.virtualenvs/project
python - pympler 引发 TypeError
在python2.7中，跟随pympler example : from anotherfile import somefunction, somecustomclass from os import

首页

博学

6Ren·AI

商城

hadoop - HQL引发的ArrayList无法强制转换为org.apache.hadoop.io.Text