oracle - 从Oracle将数据导入Hive时Sqoop作业卡住了-6ren

oracle - 从Oracle将数据导入Hive时Sqoop作业卡住了

转载作者：行者123 更新时间：2023-12-02 21:04:41

28

4

因此，我试图使用Sqoop将表从Oracle导入Hive。这是我的查询

sqoop-import --hive-import --connect jdbc:oracle:thin:@10.35.10.180:1521:dms 
--table DEFECT 
--hive-database inspex 
--username INSPEX 
--password inspex

yarn 似乎将工作分为四个部分。

17/02/17 15:15:17 INFO sqoop.Sqoop: Running Sqoop version: 1.4.6-cdh5.9.1
17/02/17 15:15:17 WARN tool.BaseSqoopTool: Setting your password on the command-line is insecure. Consider using -P instead.
17/02/17 15:15:17 INFO tool.BaseSqoopTool: Using Hive-specific delimiters for output. You can override
17/02/17 15:15:17 INFO tool.BaseSqoopTool: delimiters with --fields-terminated-by, etc.
17/02/17 15:15:18 INFO oracle.OraOopManagerFactory: Data Connector for Oracle and Hadoop is disabled.
17/02/17 15:15:18 INFO manager.SqlManager: Using default fetchSize of 1000
17/02/17 15:15:18 INFO tool.CodeGenTool: Beginning code generation
17/02/17 15:15:18 INFO manager.OracleManager: Time zone has been set to GMT
17/02/17 15:15:18 INFO manager.SqlManager: Executing SQL statement: SELECT t.* FROM "DEFECT" t WHERE 1=0
17/02/17 15:15:18 INFO orm.CompilationManager: HADOOP_MAPRED_HOME is /opt/cloudera/parcels/CDH/lib/hadoop-mapreduce
Note: /tmp/sqoop-root/compile/72422bf2a67c745893ae440ad77e3049/DEFECT.java uses or overrides a deprecated API.
Note: Recompile with -Xlint:deprecation for details.
17/02/17 15:15:20 INFO orm.CompilationManager: Writing jar file: /tmp/sqoop-root/compile/72422bf2a67c745893ae440ad77e3049/DEFECT.jar
17/02/17 15:15:20 INFO manager.OracleManager: Time zone has been set to GMT
17/02/17 15:15:20 INFO manager.OracleManager: Time zone has been set to GMT
17/02/17 15:15:20 INFO mapreduce.ImportJobBase: Beginning import of DEFECT
17/02/17 15:15:20 INFO Configuration.deprecation: mapred.jar is deprecated. Instead, use mapreduce.job.jar
17/02/17 15:15:20 INFO manager.OracleManager: Time zone has been set to GMT
17/02/17 15:15:21 INFO Configuration.deprecation: mapred.map.tasks is deprecated. Instead, use mapreduce.job.maps
17/02/17 15:15:21 INFO client.RMProxy: Connecting to ResourceManager at vn1.localdomain/10.35.10.17:8032
17/02/17 15:15:23 INFO db.DBInputFormat: Using read commited transaction isolation
17/02/17 15:15:23 INFO db.DataDrivenDBInputFormat: BoundingValsQuery: SELECT MIN("DEFECT_INDEX"), MAX("DEFECT_INDEX") FROM "DEFECT"
17/02/17 15:15:45 INFO mapreduce.JobSubmitter: number of splits:4
17/02/17 15:15:45 INFO mapreduce.JobSubmitter: Submitting tokens for job: job_1487360998088_0003
17/02/17 15:15:45 INFO impl.YarnClientImpl: Submitted application application_1487360998088_0003
17/02/17 15:15:45 INFO mapreduce.Job: The url to track the job: http://vn1.localdomain:8088/proxy/application_1487360998088_0003/
17/02/17 15:15:45 INFO mapreduce.Job: Running job: job_1487360998088_0003
17/02/17 15:15:51 INFO mapreduce.Job: Job job_1487360998088_0003 running in uber mode : false
17/02/17 15:15:51 INFO mapreduce.Job:  map 0% reduce 0%
17/02/17 15:15:57 INFO mapreduce.Job:  map 50% reduce 0%
17/02/17 15:16:35 INFO mapreduce.Job:  map 75% reduce 0%

然后，它卡在了75％的位置，并且可以永远运行。我注意到4个工作中有3个很快完成了。除了以下之一:

似乎这项工作没有取得任何进展，只是停留在0％。我检查了系统日志:

2017-02-17 15:15:53,795 INFO [main] org.apache.hadoop.metrics2.impl.MetricsConfig: loaded properties from hadoop-metrics2.properties
2017-02-17 15:15:53,851 INFO [main] org.apache.hadoop.metrics2.impl.MetricsSystemImpl: Scheduled snapshot period at 10 second(s).
2017-02-17 15:15:53,851 INFO [main] org.apache.hadoop.metrics2.impl.MetricsSystemImpl: MapTask metrics system started
2017-02-17 15:15:53,859 INFO [main] org.apache.hadoop.mapred.YarnChild: Executing with tokens:
2017-02-17 15:15:53,859 INFO [main] org.apache.hadoop.mapred.YarnChild: Kind: mapreduce.job, Service: job_1487360998088_0003, Ident: (org.apache.hadoop.mapreduce.security.token.JobTokenIdentifier@41480ec1)
2017-02-17 15:15:53,948 INFO [main] org.apache.hadoop.mapred.YarnChild: Sleeping for 0ms before retrying again. Got null now.
2017-02-17 15:15:54,426 INFO [main] org.apache.hadoop.mapred.YarnChild: mapreduce.cluster.local.dir for child: /yarn/nm/usercache/root/appcache/application_1487360998088_0003
2017-02-17 15:15:55,409 INFO [main] org.apache.hadoop.conf.Configuration.deprecation: session.id is deprecated. Instead, use dfs.metrics.session-id
2017-02-17 15:15:55,813 INFO [main] org.apache.hadoop.mapreduce.lib.output.FileOutputCommitter: File Output Committer Algorithm version is 1
2017-02-17 15:15:55,822 INFO [main] org.apache.hadoop.mapred.Task:  Using ResourceCalculatorProcessTree : [ ]
2017-02-17 15:15:56,278 INFO [main] org.apache.sqoop.mapreduce.db.DBInputFormat: Using read commited transaction isolation
2017-02-17 15:15:56,411 INFO [main] org.apache.hadoop.mapred.MapTask: Processing split: "DEFECT_INDEX" >= 1 AND "DEFECT_INDEX" < 545225318
2017-02-17 15:15:56,491 INFO [main] org.apache.sqoop.mapreduce.db.OracleDBRecordReader: Time zone has been set to GMT
2017-02-17 15:15:56,564 INFO [main] org.apache.sqoop.mapreduce.db.DBRecordReader: Working on split: "DEFECT_INDEX" >= 1 AND "DEFECT_INDEX" < 545225318
2017-02-17 15:15:56,610 INFO [main] org.apache.sqoop.mapreduce.db.DBRecordReader: Executing query: SELECT "DEFECT_INDEX", "LAYER_SCAN_INDEX", "DEFECT_SITE_ID", "CLUSTER_ID", "CARRY_OVER", "VERIFIED_ADDER", "REPEATING_DEFECT", "TEST_NUMBER", "X_DIE_COORDINATE", "Y_DIE_COORDINATE", "X_COORDINATE", "Y_COORDINATE", "X_DEFECT_SIZE", "Y_DEFECT_SIZE", "D_SIZE", "INSPECT_INTENSITY", "PATTERN_ID", "SURFACE", "ANGLE", "HOT_SPOT", "ASPECT_RATIO", "GRAY_SCALE", "MACROSIGID", "REGIONID", "SEMREVSAMPLE", "POLARITY", "DBGROUP", "CAREAREAGROUPCODE", "VENNID", "SEGMENTID", "MDAT_OFFSET", "DESIGNFILEFLOORPLANID", "DBSCRITICALITYINDEX", "CELLSIZE", "PCI", "LINECOMPLEXITY", "DCIRANGE", "GDSX", "GDSY" FROM "DEFECT" WHERE ( "DEFECT_INDEX" >= 1 ) AND ( "DEFECT_INDEX" < 545225318 )

日志在开始执行查询时结束。我等了10个小时，仍然没有更新。这不应该是正确的，因为它并不大。

我在日志中没有发现任何错误。在此之前，我已经成功地将几个表从oracle导入到hive。所以我认为我的配置很好。

我试图将mapper设置为1到100，但仍然无法正常工作。而且我注意到PK从1到某个数字开始的任务总是显示0％的进度，而其他工作正常。

我在寻找任何建议或帮助。谢谢。

最佳答案

默认情况下，sqoop根据表的PK将您的工作分配到4个映射器中，但是根据数据的分布，效率可能非常低。您没有谈论集群或数据的大小，但我会建议您查看数据的分布情况，并尝试使用其他列设置更多的 map (-m选项)来拆分负载(拆分选项) )。您的工作正在使用fault_index列拆分工作

关于oracle - 从Oracle将数据导入Hive时Sqoop作业卡住了，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/42306865/

28

4

0

文章推荐： docker - 在 GCP 启动脚本期间查找用户名

文章推荐： django - 如何使用geodjango扩大或缩小多边形？

文章推荐： docker - ssh端口转发语法说明

sqoop - sqoop 导入时的部分和重复记录
当我们使用以下设置时，Sqoop 导入会导致重复/部分记录 --query - 自定义查询 --split-by - 非整数列(字符) --num-mappers - 超过 2 Verified th
apache - Sqoop - 无法找到或加载主类 org.apache.sqoop.Sqoop
我安装了 Hadoop、Hive、HBase、Sqoop 并将它们添加到 PATH 中。当我尝试执行 sqoop 命令时，出现此错误: Error: Could not find or load m
sqoop - Apache Sqoop 通信链路故障
当我连接到一个集群 ( aaaaaa1 ) 上的 mysql 和不同服务器 ( aaaaaa2 ) 上的 sqooop 时，我收到以下错误，尽管在 mySql 中创建了一个表，并授予另一个集群的完全权
sqoop - 使用 sqoop 列出列
我发现以下命令对于查看我的源数据库的样子非常有用: sqoop-list-databases sqoop-list-tables 但是，似乎没有列出表中列的命令，这将是一个合乎逻辑的步骤。我现在的问
Java - com.cloudera.sqoop 与 org.apache.sqoop 哪个要从 sqoop jar 导入？
我很困惑虽然导入库(com.cloudera.sqoop 和 org.apache.sqoop)并在 eclipse 中获取它(包含 jar sqoop-1.4.4-hadoop200.jar)- I
sqoop - Sqoop 中 $conditions 的意义
sqoop import命令中$conditions子句的意义是什么？ select col1, col2 from test_table where \$CONDITIONS 最佳答案 Sqoop
sqoop - Sqoop 中 $conditions 的意义
sqoop import命令中$conditions子句的意义是什么？ select col1, col2 from test_table where \$CONDITIONS 最佳答案 Sqoop
mysql - 错误 sqoop.Sqoop : Got exception running Sqoop: java. lang.RuntimeException : Could not load db driver class: com. mysql.jdbc.Driver
我正在使用共享节点集群 Hadoop 2.5.0-cdh5.3.2 请共享要加载的所有兼容版本的 MySql jar 文件的名称以及 HDFS 和 MySQL 之间成功导入和导出的所有路径文件夹。我
sqoop - 为什么我在 Azkaban 中的 Sqoop 任务在选择列后卡住了？
我在Azkaban中使用shell命令，并将Sqoop命令放在shell脚本中。今天 Sqoop 任务无缘无故卡住了，sqoop_task1。几天前发生在另一个 sqoop 任务上，我们称它为 s
java - 运行sqoop时找不到类异常:org/apache/sqoop/Sqoop
我已经在计算机上安装了sqoop (来自http://www.apache.org/dist/sqoop/1.4.4/的sqoop-1.4.4.bin__hadoop-1.0.0.tar.gz)。当
sqoop - Apache Sqoop - 未找到 addtowar.sh
我刚刚下载了Sqoop安装文件sqoop-1.99.3-bin-hadoop100.tar.gz。我无法在其中找到文件 addtowar.sh。我按照此处的安装说明进行操作 - https://sqo
sqoop - 在 oozie 中捕获 sqoop 输出
我有一个 Oozie 工作流，它应该每 X 分钟运行一次。它从 HBase 表中读取一个值。在此之后，基于上一步从 HBase 读取的值运行(增量)Sqoop 操作。为了使工作流正常工作，我需要以某种
database - 我无法通过 sqoop 所有表在 sqoop 中导入数据
[cloudera@quickstart ~]$ **sqoop import-all-tables -m=4 --connect "jdbc:mysql://quickstart.cloudera:
mysql - 使用任何 sqoop 命令时出现 Sqoop 错误
我正在使用 hadoop 2.6.0，现在我正在尝试 sqoop-1.4.5.bin__hadoop-2.0.4-alpha.tar.gz。我正在使用 sqoop 版本 sqoop version 2
hadoop - 执行 sqoop 作业时覆盖多个 sqoop 属性
我发现在运行时覆盖 sqoop 作业属性时，我只能覆盖一个属性。例子1:如果我提交 sqoop job --exec test123 -- --query "select * from test w
hadoop - 如何使用 sqoop 作业自动化 sqoop 增量导入？
如何使用sqoop job自动化sqoop增量导入？据我所知，sqoop job 会记住最后一个值。如果我们创建一个类似的 sqoop 作业 sqoop job --create myjob --
mysql - 在 sqoop 导出中，对于长文本，Sqoop 将列设为空
我正在尝试使用 sqoop export 将记录从 S3 导出到 Mysql Aurora。 S3 中的数据类型之一是 clob，它的长文本和 XML 文件作为 string 存储在其中。当我运行我
hadoop - Sqoop-2 在使用 sqoop shell 进行自定义查询时无法对单个节点进行大量导入
我正在对由计算量大的自定义查询生成的大型记录集进行原型(prototype)迁移。此查询大约需要 1-2 小时才能在 SQL Developer 中返回结果集我正在尝试将此查询传递给一个简单的 Sq
hadoop - Apache Sqoop Where 子句在使用 SQOOP IMPORT 时不起作用
谁能告诉我这个命令的输出是什么:这里的 departments 表有默认的 6 行(从 dept_id 2 到 7)，然后我向 Mysql db 'retail_db.departments' 表(d
hadoop - Sqoop 2 提供了哪些 Sqoop 1 没有提供的内容？
根据 sqoop.apache.org 的说法，Sqoop 2 的功能并不完整，不应该用于生产系统。很公平，有些人可能想在他们的测试环境中测试 Sqoop 2 的新功能。 Cloudera 对 Sqo

首页

博学

6Ren·AI

商城

oracle - 从Oracle将数据导入Hive时Sqoop作业卡住了