mysql - MySQL Cluster 之上的 Hive 层-6ren

mysql - MySQL Cluster 之上的 Hive 层

转载作者：可可西里更新时间：2023-11-01 15:41:28

26

4

免责声明:我是 Hadoop 和 Hive 的新手。

我们搭建了一个存储海量数据的MySql集群(7.2.5版本)。行数达到数百万，并根据 Mysql 的自动分片逻辑进行分区。尽管我们正在利用 Cluster 7.2 的自适应查询本地化 (AQL)，但我们的一些查询有多个连接并且会运行几分钟甚至几个小时。

在这种情况下，我可以使用 Hive 和 Hadoop 一起查询数据库并检索数据吗？它会使查询更快吗？它是否复制其文件系统中的数据？这种方法的优缺点是什么？

我的意图是使用 Hive 作为 MySQL Cluster 之上的一个层，并使用它来读取/写入 MySQL Cluster DB。我的申请中没有任何交易。那么这真的可能吗？

最佳答案

我觉得是可以的。我所知道的在这个方向上最接近的解决方案是:http://www.hadapt.com/by Daniel Abadi。
它解决方案的想法是在每个节点上都有本地 RDBMS 并在这些节点上运行通常的 hadoop MR 和 Hive。
原则上，如果您将进行智能 Hive 集成并将谓词下推到 MySQL 实例，它可以为您带来一些性能提升。
同时，你应该做一些严肃的黑客攻击，让 hadoop 知道你的分片位置以保护数据局部性。
总结以上所有 - 它应该是可能的，但需要认真的发展。
同时——我不知道开箱即用的解决方案可以按原样在 Mysql 集群上运行配置单元。

关于mysql - MySQL Cluster 之上的 Hive 层，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/10793891/

26

4

0

文章推荐： java - 如何在 Hadoop 中显式指定 map 节点或 reduce 节点

文章推荐： java - SequenceFile 到 .txt 转换

文章推荐： c++ - 在 OpenCV 中将 vector 转换为垫子

文章推荐： Hadoop:未设置 JAVA_HOME

cluster-computing - 野蝇 9 : JGRP000012: discarded message from different cluster hq-cluster (our cluster is ee)
从 Wildfly 8.2.1.Final 升级到 Wildfly 9.0.1.Final 后，我们开始收到很多警告，如下所示: WARNING [org.jgroups.protocols.TCP]
cluster-computing - Terracotta Cluster 仍然是开源的吗？
如果是，在哪里可以找到？!根据this infoq 条目，他们已经开源了。但是现在，他们的网站上没有这样的产品。最佳答案本页，http://terracotta.org/dl/oss-downlo
sql - "clustered"中的 "clustered index"是什么意思？
这个问题已经有答案了: 已关闭12 年前。 Possible Duplicates: Difference between clustered and nonclustered index What
clustered-index - H2数据库: clustered indexes support
我将 H2 数据库用于包含大量时间序列的环境数据。时间序列只是定期(例如每小时一次)记录在数据库中的传感器的测量值。表中存储的数据: CREATE TABLE hydr (dt timestamp
cluster-computing - Cluster 和 MPP super 计算机架构之间有什么区别？
Cluster 和 MPP super 计算机架构之间有什么区别？最佳答案在集群中，每台机器在内存、磁盘等方面都在很大程度上独立于其他机器。它们使用普通网络上的一些变体相互连接。集群主要存在于程序
akka-cluster - 使用akka cluster multi-jvm testkit模拟网络分区
我正在尝试为 akka 集群构建一个大脑 split 解析器。但是很难模拟某些节点无法从原始集群的其余部分访问并形成自己的集群的场景。不能通过停止和重启节点来完成，因为新启动的节点不是同一个节点，因
android - 无法解析导入 com.google.maps (clustering.Cluster)
我正在尝试在我的应用程序中使用集群。但是，在导入语句中，我得到“无法解析导入 com.google.maps (clustering.Cluster)”。此外，在使用 ClusterManager
hadoop - Hive 中 Cluster By 和 CLUSTERED BY 的区别？
我想知道 Hive 中 Cluster By 和 CLUSTERED BY 的主要区别是什么。 Cluster By 用于对表进行分桶。并且会用到Hash函数。 CLUSTERED BY 用于在 re
redis - 如何解决redis cluster "Waiting for the cluster to join"问题？
我有3台机器，为redis集群创建了6个节点，我几个月前创建成功了，但现在它掉线了，我尽力修复它，但它不起作用，所以我清理所有数据并重新创建它从零开始，当我使用以下命令创建集群时，它在这里阻塞，等待节
docker - "--cluster-store"和 "--cluster-advertise"不起作用
我尝试使用 swarm 和 consul 设置 docker 集群。我有 manager、host1 和 host2。我在管理器上运行 consul 和 swarm manager 容器。 $ do
python - tslearn.clustering.TimeSeriesKMeans 与 sklearn.cluster.KMeans
如果我不使用 DTW 作为距离度量，那么 tslearn.clustering.TimeSeriesKMeans 和 sklearn.cluster.KMeans 是否等同？如果不是，谁能告诉我这两
java - Flink Job Cluster 与 Session Cluster - 部署和配置
我正在研究 Flink 1.9.1 的 docker/k8s 部署可能性。我正在阅读/观看 [1][2][3][4]。目前我们确实认为我们会尝试采用作业集群方法，尽管我们想知道这方面的社区趋势是什
r - 层次聚类 : Determine optimal number of cluster and statistically describe Clusters
我可以使用一些关于 R 中方法的建议来确定最佳集群数，然后用不同的统计标准描述集群。我是 R 的新手，对聚类分析的统计基础有基本的了解。确定簇数的方法:在文献中，一种常用的方法是所谓的“肘部准则”，
sql - "Clustered Index Scan (Clustered)"在 SQL Server 执行计划中意味着什么？
我有一个查询无法执行，并显示“由于文件组“DEFAULT”中磁盘空间不足，无法为数据库“TEMPDB”分配新页面”。在排除故障的过程中，我正在检查执行计划。有两个标记为“聚集索引扫描(聚集)”的昂贵
Elasticsearch 索引不工作和错误消息 : node null not part of the cluster Cluster [elasticsearch], 忽略
我刚刚下载了 Elasticsearch 发行版并运行了它。 curl 'localhost:9200' { "status" : 200, "name" : "cbs", "clu
Azure ML : how to change the "cluster purpose" of an existing inference cluster from "dev_test" to "production"?
我有一个集群，其“cluster_ Purpose”设置为“dev_test”。我想将其更改为“生产”。在文档中找不到任何内容。最佳答案回答我自己的问题。这是不可能的。关于Azure ML :
sql-server - SQL Server : Alter a clustered primary index to an non-clustered
如何将主聚集索引更改为非聚集索引。 (作为“辅助”表，我想对“标题”表的外键列使用聚集索引。) 这对我不起作用(错误似乎是合理的:) DROP INDEX ClientUsers.PK_ClientU
python - sklearn 的 KMeans : Cluster centers and cluster means differ. 数值不精确？
我注意到，当使用 sklearn.cluster.KMeans 从方法 .cluster_centers_ 获取集群时，集群中心和每个集群的手动计算均值似乎不会给出完全相同的答案。对于小样本量，差异
java - quartz 调度器 : Trigger some jobs on every cluster node and some only once per cluster
我在集群环境中使用 Quartz Scheduler 作为 Spring bean。我有一些用@NotConcurrent 注释的作业，它们在每个集群中运行一次(即仅在一个节点中，仅在一个线程中)。
javascript - Node.js 的 Cluster 模块和 Learnboost 的 Cluster 模块有什么区别？
Node.js 本身有一个名为 Cluster 的核心模块(引用:http://nodejs.org/docs/v0.8.3/api/cluster.html)，Learnboost 发布了一个名为

首页

博学

6Ren·AI

商城

mysql - MySQL Cluster 之上的 Hive 层