hadoop - Hive动态分区-Spark的并发写入会破坏数据-6ren

hadoop - Hive动态分区-Spark的并发写入会破坏数据

转载作者：行者123 更新时间：2023-12-02 18:23:38

26

4

我们已经设置了一个 Spark 作业，以插入到Hive中(使用数据框)。配置单元表用于创建动态分区。只要我们运行一个spark作业以将数据插入Hive，一切都将正常运行。

我们遇到的问题是，我们期望运行并发的Spark作业以将数据加载到Hive中。这似乎不起作用。我读过，动态分区不提供排他锁，而是提供共享锁。在我们的案例中，我们可以看到，如果同时运行4-5个Spark作业，则数据将被破坏，某些记录将丢失。几乎每次都非常容易复制。

有人解决了吗？即使用带有并发作业的动态分区将其插入配置单元表，并仍确保不会发生数据损坏。任何输入，不胜感激!

Spark 代码的片段:

// Set hive conf to allow dynamic partitions to be created
sqlContext.setConf("hive.exec.dynamic.partition.mode", "nonstrict")

//Create temp table to load data into Hive
parsedDataDF.registerTempTable("parsedDatatempTable")

//Insert data into Hive, dynamic partitioning   
sqlContext.sql("insert into table " + hiveDBToLoad + "." + hiveTableToLoad + " partition (partition_1, partition_2, partition_3) " +
    "select * from parsedDatatempTable")

最佳答案

    $partition_tbl=array();
$partition_tbl[]=array(
    'tbl'=>$wpdb->prefix.'postmeta',
    'field'=>'meta_id',
    'limit'=>2,
    'part_key'=>'p',
);
$partition_tbl[]=array(
    'tbl'=>$wpdb->prefix.'posts',
    'field'=>'ID',
    'limit'=>2,
    'part_key'=>'pos',
);
        
if(!empty($partition_tbl)){
    foreach($partition_tbl as $ppptt){
        $field=$ppptt['field'];
        $tbl=$ppptt['tbl'];
        $limit=$ppptt['limit'];
        $part_key=$ppptt['part_key'];
        $get_max = $wpdb->get_results("SELECT * FROM ".$wpdb->prefix."postmeta ORDER BY $field DESC LIMIT 0, 1");
        if(!empty($get_max)){
            $max=$get_max[0]->$field;
            if($max > $limit){                              
                $partcc=ceil($max/$limit);          
                $has_partitions = $wpdb->get_results("EXPLAIN partitions SELECT * FROM ".$tbl);     
                $haspartarr=array('none');
                if(!empty($has_partitions)){
                    if(!empty($has_partitions[0]->partitions)){
                        $haspartarr=explode(",",$has_partitions[0]->partitions);
                        if(count($haspartarr) > 1){
                             unset($haspartarr[count($haspartarr)-1]);
                        }
                    }
                }
                $part_sql='';
                $part_arr=array();
                $first=true;
                for($i=0;$i<$partcc;$i++){
                    $cpart=$part_key.$i;
                    $reclim=$limit*($i+1);
                    if(!in_array($cpart,$haspartarr)){
                        if(empty($has_partitions[0]->partitions)){
                            $part_arr[]="PARTITION $cpart VALUES LESS THAN ($reclim)";
                        }else{
                            $nwlmn=($reclim-$limit);                        
                            if($first){
                                $part_sql.="ALTER TABLE $tbl REORGANIZE PARTITION $cpart INTO (";
                                $first=false;
                                $morel=$nwlmn-$limit;                                       
                            }
                            $part_arr[]="PARTITION $cpart VALUES LESS THAN ($reclim)";                                          
                        }
                    }
                }
                if(empty($has_partitions[0]->partitions) && !empty($part_arr)){
                    $cpart=$part_key.$i;                
                    $part_arr[]="PARTITION $cpart VALUES LESS THAN MAXVALUE";               
                    $part_sql.="ALTER TABLE $tbl PARTITION BY RANGE($field)(";
                    $part_sql.=implode(",",$part_arr);
                    $part_sql.=")";
                    $wpdb->get_results($part_sql);
                }else{
                    if(!empty($part_arr)){
                        $cpart=$part_key.$i;
                        $part_arr[]="PARTITION $cpart VALUES LESS THAN MAXVALUE";
                        $part_sql.=implode(",",$part_arr);      
                        $part_sql.=");";
                        $wpdb->get_results($part_sql);
                    }           
                }
            }
        }

    }
}

关于hadoop - Hive动态分区-Spark的并发写入会破坏数据，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/41349118/

26

4

0

文章推荐： docker - docker compose版本2在不应创建容器时重新创建容器

文章推荐： docker - docker如何在容器内使主机脚本可用

文章推荐： ubuntu - cassandra 错误键空间不存在

文章推荐： docker - Docker Swarm服务网络

canvas - 破坏 Canvas
我正在尝试完成撤消/重做。我正在使用loadFromJSON(...)从我存储在数组中的 Canvas 状态重新构建 Canvas 。基本上，我的想法是破坏现有的 Canvas 并重新构建 Canva
JavaScript iframe 破坏
在某些情况下，我有一个在 iframe 中打开的网页。当它被加载到那个 iframe 中时，我需要它将窗口位置设置为资源以下载文件(所有这些都是为了更新 GreaseMonkey 脚本......所有
android - 破坏 Intent ？
当我创建 Intent 时: Intent in = new Intent(this, myclass.class); this.startActivity(in); 我创建了一个新的 Intent
php - 破坏 Wordpress 网站的简码
我正在我本地版本的 Wordpress 网站上为 Wordpress 创建新的短代码。在 functions.php 中，我添加了例如: function shortTest() { re
javascript - 破坏 JavaScript 代码的特殊字符
我正在为机械网站制作 JavaScript 闪卡游戏。因为我想将方程写在卡片上，所以我需要使用 delta(Δ) 符号。一张卡片可能有:一侧是“功率方程”，另一侧是“P=W/Δt”。如果卡片从第一面
javascript - addClass 破坏 JS
我编写了以下代码: document.addEventListener("DOMContentLoaded", ()=>{ let menu = document.querySelector(
javascript - 破坏 Chrome 缓存以进行浏览器同步重新加载
我的浏览器同步工作正常，但我仍然很难处理之前的 html 的缓存。即使选中了 Chrome 的“禁用缓存”，甚至在隐身模式下也是如此! 要加载页面更改，我总是必须“清除缓存并硬重新加载”。我想知道，
extjs - 破坏 ExtJS 中的上下文菜单？
我注意到每次打开和关闭(通过单击菜单项或单击菜单外的某个区域)时，上下文菜单 ( Ext.menu.Menu ) s 不会从 DOM 中删除，它们只是以某种方式变得不可见。如何改变这个？最佳答案
coq - 破坏 coq 中依赖记录的相等性
给定依赖记录类型: Record FinPath : Type := mkPath { fp_head : S i; fp_tail
teamcity - 破坏 Teamcity 中构建的电子邮件用户
在 Husdon/Jenkins 中，我可以在构建被破坏时设置通知，以向进行破坏构建的 checkin 的用户发送电子邮件。如何在 Teamcity 中执行此操作？我知道个人用户可以通过 Teamc
extjs - 破坏 ExtJS 中的上下文菜单？
我注意到每次打开和关闭(通过单击菜单项或单击菜单外的某个区域)时，上下文菜单 ( Ext.menu.Menu ) s 不会从 DOM 中删除，它们只是以某种方式变得不可见。如何改变这个？最佳答案
django html2text anchor 破坏
使用 MIMEMultipart('alternative') 发送 html 和 pain-text 时将 html 转换为文本时，html 的 anchor 换行 http://127.0.0.
java - 破坏 Activity 导致服务丢失数据
每当我的应用程序最小化时，我都会启动一个服务，该服务向我的 HTTP 服务器发送拉取请求以检查通知，当应用程序恢复时，服务将被终止(以及计划的可运行项)。一切正常，直到我决定终止该应用程序(将其从正在
jQuery Mobile 破坏 OmniAuth
我意识到该框架处于 alpha 阶段，但正在实现 jQuery Mobile破坏了我的omniauth 身份验证。当我尝试登录时，一旦我尝试点击/auth/twitter Controller ，jQ
jquery 破坏 Angular 指令
我对 Angular 比较陌生，经过几个小时的调试，我发现添加 jquery 时存在一些不兼容性。该指令在没有 jquery 的情况下工作正常，但在使用 jquery 时会中断:/ 这是一个 plnk
JQuery .trigger ('submit' )破坏
我发现，因为我正在处理的所有表单都有一个包含“name =“submit””属性的提交按钮，所以当我单击应该触发表单提交的链接时，触发器提交会中断. 有谁知道我该如何解决这个问题。下面的 JQuer
Javascript 破坏 CSS 悬停
我遇到了一个问题:/我得到了一个 CSS 东西，它使悬停时背景位置发生变化。但是当我在 javascript 中运行一个改变悬停的函数后，CSS 停止工作。这是函数: function tree()
javascript - qooxdoo 破坏，处置
谁能给出一个完整的例子来说明 qooxdoo 1.6 中的 dispose 和 destruct 是如何工作的？，我在 qooxdoo 演示或文档中找不到任何好的示例。谢谢你的建议。最佳答案处
java - JFormattedTextField 破坏 DocumentFilter
我对 JFormattedTextField 有疑问(我将它用作我们所有文本字段的基类)。今天我尝试向该字段的文档添加一个文档过滤器，它工作得很好，但前提是它没有设置格式化程序工厂。问题是，当设置
javascript - 破坏 JavaScript 函数
我有一个点击事件 $('#ship_Move').click(function (event) { event.stopPropagation();

首页

博学

6Ren·AI

商城

hadoop - Hive动态分区-Spark的并发写入会破坏数据