python - 使用 python 访问 HDInsight Hive-6ren

python - 使用 python 访问 HDInsight Hive

转载作者：可可西里更新时间：2023-11-01 14:56:03

28

4

我们有一个 HDInsight 群集，其中一些表位于 HIVE 中。我想从客户端计算机(Azure 外部)的 Python 3.6 查询这些表。

我尝试过使用 PyHive、pyhs2 以及 impyla，但我在使用它们时遇到了各种问题。

有人有从 Python 访问 HDInsight HIVE 的工作示例吗？

我对此经验很少，并且不知道如何配置PyHive(这似乎是最有前途的)，尤其是在授权方面。

使用impyla:

from impala.dbapi import connect
conn = connect(host='redacted.azurehdinsight.net',port=443)
cursor = conn.cursor()
cursor.execute('SELECT * FROM cs_test LIMIT 100')
print(cursor.description)  # prints the result set's schema
results = cursor.fetchall()

这给出:

Traceback (most recent call last):
  File "C:/git/ml-notebooks/impyla.py", line 3, in <module>
    cursor = conn.cursor()
  File "C:\Users\chris\Anaconda3\lib\site-packages\impala\hiveserver2.py", line 125, in cursor
    session = self.service.open_session(user, configuration)
  File "C:\Users\chris\Anaconda3\lib\site-packages\impala\hiveserver2.py", line 995, in open_session
    resp = self._rpc('OpenSession', req)
  File "C:\Users\chris\Anaconda3\lib\site-packages\impala\hiveserver2.py", line 923, in _rpc
    response = self._execute(func_name, request)
  File "C:\Users\chris\Anaconda3\lib\site-packages\impala\hiveserver2.py", line 954, in _execute
    .format(self.retries))
impala.error.HiveServer2Error: Failed after retrying 3 times

使用Pyhive:

from pyhive import hive

conn = hive.connect(host="redacted.azurehdinsight.net",port=443,auth="NOSASL")
#also tried other auth-types, but as i said, i have no clue here

这给出:

Traceback (most recent call last):
  File "C:/git/ml-notebooks/PythonToHive.py", line 3, in <module>
    conn = hive.connect(host="redacted.azurehdinsight.net",port=443,auth="NOSASL")
  File "C:\Users\chris\Anaconda3\lib\site-packages\pyhive\hive.py", line 64, in connect
    return Connection(*args, **kwargs)
  File "C:\Users\chris\Anaconda3\lib\site-packages\pyhive\hive.py", line 164, in __init__
    response = self._client.OpenSession(open_session_req)
  File "C:\Users\chris\Anaconda3\lib\site-packages\TCLIService\TCLIService.py", line 187, in OpenSession
    return self.recv_OpenSession()
  File "C:\Users\chris\Anaconda3\lib\site-packages\TCLIService\TCLIService.py", line 199, in recv_OpenSession
    (fname, mtype, rseqid) = iprot.readMessageBegin()
  File "C:\Users\chris\Anaconda3\lib\site-packages\thrift\protocol\TBinaryProtocol.py", line 134, in readMessageBegin
    sz = self.readI32()
  File "C:\Users\chris\Anaconda3\lib\site-packages\thrift\protocol\TBinaryProtocol.py", line 217, in readI32
    buff = self.trans.readAll(4)
  File "C:\Users\chris\Anaconda3\lib\site-packages\thrift\transport\TTransport.py", line 60, in readAll
    chunk = self.read(sz - have)
  File "C:\Users\chris\Anaconda3\lib\site-packages\thrift\transport\TTransport.py", line 161, in read
    self.__rbuf = BufferIO(self.__trans.read(max(sz, self.__rbuf_size)))
  File "C:\Users\chris\Anaconda3\lib\site-packages\thrift\transport\TSocket.py", line 117, in read
    buff = self.handle.recv(sz)
ConnectionResetError: [WinError 10054] An existing connection was forcibly closed by the remote host

最佳答案

根据官方文档Understand and resolve errors received from WebHCat on HDInsight ，如下所述。

What is WebHCat

WebHCat is a REST API for HCatalog, a table, and storage management layer for Hadoop. WebHCat is enabled by default on HDInsight clusters, and is used by various tools to submit jobs, get job status, etc. without logging in to the cluster.

所以解决方法是使用WebHCat在Python中运行Hive QL，请引用Hive document学习和使用它。作为引用，有类似的MSDN thread对此进行了讨论。

希望有帮助。

关于python - 使用 python 访问 HDInsight Hive，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/46369427/

28

4

0

文章推荐： javascript - 如何在 HTML 页面变长时触发事件？

文章推荐： C++: vector 边界

hive - 无需定义 hive 表结构即可在 hive 中导入数据平面文件
我可以将 CSV 或任何其他平面文件导入到 hive 中，而无需先在 hive 中创建和定义表结构吗？假设我的 csv 文件有 200 列，需要导入到 hive 表中。所以我必须首先在 hive 中创
hive - hive 中的爆炸功能
我有以下示例数据，我试图在 hive 中爆炸它.. 我使用了 split 但我知道我错过了一些东西.. ["[[-80.742426,35.23248],[-80.740424,35.23184],[
hive - Hive 是否重复数据？
我有一个很大的日志文件，我加载到 HDFS . HDFS将根据机架感知复制到不同的节点。现在我将相同的文件加载到配置单元表中。命令如下: create table log_analysis (log
hive - Hive 中的解析异常
我正在尝试使用 UDF在 hive 中。但是当我尝试使用 userdate as 'unixtimeToDate' 创建一个临时函数时，我得到这个异常(exception) hive> create
hive - Hive 有休眠功能吗？
在Mysql中，我们可以使用DO sleep(5) ;来进行暂停。但它在 Hive 中不起作用。 Hive有 sleep 功能吗？最佳答案你可以通过反射调用Thread让hive在处理每一行后多等
hive - 将数据导入包含空格的 Hive
我正在将数据从 csv 文件导入 Hive。我的表包含字符串和整数。但是，在我的输入文件中，整数周围有空格，所以它看起来像这样: some string, 2 ,another stri
hive - Hive 中的嵌套选择
我可以嵌套吗select在 Hive 中具有不同的条件？例如如果我有以下两个 Hive 查询: select percentile(x, 0.95) from t1 where y = 1; sel
hive - Hive 安装在什么模式下？
hive 安装有什么特定的模式吗？例如，Hadoop 安装有 3 种模式:独立、伪分布式和完全分布式。同样，Hive 是否有任何特定类型的分布？ Hive 可以分布式安装吗？最佳答案 Hive
hive - Hive 中的日期比较
我正在使用 Hive，我有一个结构如下的表: CREATE TABLE t1 ( id INT, created TIMESTAMP, some_value BIGINT ); 我需要找到
hive - hive 、黑斑羚和直线之间的区别
我是 Hadoop 生态系统工具的新手。任何人都可以帮助我了解 hive 、直线和 hive 之间的区别。提前致谢! 最佳答案 Apache hive : 1] Apache Hive 是一个建立
hive - Hive 中的数组字面量
如何在 Hive 中写出数组文字？ SELECT PERCENTILE(my_column, [0.5, 0.25, 0.50, 0.75, 0.95]) AS quantiles FROM my_t
hive - Hive Alter表更改列名
我正在尝试在Hive中重命名columnName。是否可以在Hive中重命名列名称。 tableA(栏1，_c1，_c2) 至 tableA(column1，column2，column3) ?? 最
hive - HIVE 中的减号查询
减号查询似乎在 HIVE 中不起作用。尝试过: select x from abc minus select x from bcd ; 我做错了还是没有为 HIVE 定义负查询？如果是这样，还有其他
hive - 使用 Hive-JDBC 在 Hive 中批量插入
我正在尝试使用 hive-jdbc 连接将数据插入 Hive (NON-ACID) 表。如果我在“语句”中执行单个 SQL 查询，它就可以工作。如果我尝试使用“addBatch”对 SQL 进行批处理
hive - 如何获取列名并输入 hive
我知道这些，要获取表中的列名，我们可以触发: show columns in . 要获取表的描述(包括 column_name、column_type 和许多其他详细信息): describe [f
hive - Hive 表名最大字符数限制是多少？
无法找到有关 Hive 表最大字符限制的合适规范。我正在开发一个涉及 hive 表的 ETL 过程，这些表已指定格式为 _ 的命名约定，并且提供的表名称远大于 30 字节(pl/sql 的正常限制)
hive - Hive 元存储和名称节点在集群中起什么作用？
在安装了Hive的集群中，metastore和namenode有什么？我了解 Metastore 拥有所有表架构、分区详细信息和元数据。现在这个元数据是什么？那么namenode有什么呢？这个元存储在
hive - Hive 动态分区和静态分区的主要区别
Hive 中静态分区和动态分区的主要区别是什么？使用单独的插入意味着静态，而对分区表的单个插入意味着动态。还有什么优点吗？最佳答案在静态分区中，我们需要在每个 LOAD 语句中指定分区列值。假设
hive - Hive 中的数据透视表
我是 hadoop 和 hive 的新手。如果有人研究过pivot in hive的概念，请与我分享。例如:来自 teradata 或 oracle 的数据未转置，这些数据应在 hive 中转置。那
hive - hive 面试问题中的分区
1)如果分区列没有数据，那么当你查询它时，你会得到什么错误？ 2)如果某些行没有分区列，这些行将如何处理？会不会有数据丢失？ 3)为什么需要对数字列进行分桶？我们也可以使用字符串列吗？流程是什么？您将

首页

博学

6Ren·AI

商城

python - 使用 python 访问 HDInsight Hive