java - 排查 AWS Redshift 上的 COPY 错误-6ren

java - 排查 AWS Redshift 上的 COPY 错误

转载作者：行者123 更新时间：2023-11-30 06:09:57

25

4

更新:如果弄清楚了这一点，但我仍然对解释感兴趣。问题是我在运行下面的代码的同时也从 SqlWorkbenchJ 连接到我的 Redshift 集群(两者都在同一台笔记本电脑上运行)。第二次我断开 SqlWorkbenchJ session 并重新运行我的代码时，它没有挂起。为什么？

<小时/>

请注意:虽然我在这个问题中提到了 Java/JDBC，但这严格来说是一个有关 Redshift 故障排除的问题，并且与语言/框架无关!!!

<小时/>

这里还有一个 SSCCE 存储库，它完美地重现了挂起问题: https://github.com/bitbythecron/redshift-copy-troubleshooting

我正在尝试从 Java 代码运行以下 Redshift COPY 命令(使用 Postgres JDBC 驱动程序):

COPY my_schema.mytable
FROM 's3://com.example.mybucket/mydata.csv/part-00000-bc1b179d-b4c1-459f-8f5e-8fe361d4b40f-c000.csv'
iam_role 'arn:aws:iam::blah:role/MyRedshiftRole'
csv;

如果我正确阅读了文档，这应该是:

读取存储在 S3 上的 CSV 文件
将其内容复制到 Redshift 表 ( my_schema.mytable )

当我在 Redshift UI 客户端 (SqlWorkbenchJ) 中运行此命令时，它会正确执行并在几秒钟内运行。但是，当我执行以下 JDBC 代码(使用完全相同相同的连接 URL、凭据等)时，代码只是卡在 executeUpdate 处。命令:

Connection conn = null;
Statement statement = null;
try {
  Class.forName("org.postgresql.Driver");
  Properties props = new Properties();
  props.setProperty("user", redshiftInfo.username);
  props.setProperty("password", redshiftInfo.password);

  log.info("\n\nAttempting to connect!\n\n");

  conn = DriverManager.getConnection("jdbc:postgresql://<sameExactUrl_thatIUser_inSqlWorkbenchJ>", props);

  log.info("\n\nConnection made!\n\n");

  statement = conn.createStatement();

  String command = "COPY my_schema.my_table FROM 's3://com.example.mybucket/mydata.csv/part-00000-bc1b179d-b4c1-459f-8f5e-8fe361d4b40f-c000.csv' iam_role 'arn:aws:iam::blah:role/MyRedshiftRole' csv";

  log.info("\n\nExecuting...\n\n");

  statement.executeUpdate(command);

  log.info("\n\nHey I think it worked!!!\n\n");

  statement.close();
  conn.close();
} catch (Exception ex) {
    log.info(ExceptionUtils.getStackTrace(ex));
}

运行时，在日志中我会看到Executing... log 语句，但随后软件就挂起。我等了长达30分钟，看看是不是因为某种原因速度慢了。我还在这 30 分钟内(以及之后)刷新了我的 SqlWorkbenchJ 连接并运行 SELECT COUNT(*) FROM my_schema.my_table并且计数始终为 0。因此它建立了连接，但实际上没有复制任何内容，或者如果复制了，则没有提交。

我想看看 Redshift 方面发生了什么:是否有任何表或日志(在 AWS 控制台或其他地方)我可以跟踪或检查记录是否确实被复制并暂存在某处，或者查看从 Redshift 的角度是否报告了任何错误？

最佳答案

您的Java代码没有问题。如果记录数量较少，它工作得很好。

create table my_table (
  c_name            varchar(25)    not null,
  c_address         varchar(25)    not null,
  c_city            varchar(25)    not null);

使用 data# 创建一个 CSV 并将其放入仅包含 2-3 条记录的 S3 中，

one,two,three
example1,example2,example3

然后，运行您的代码，它将出现以下输出。

 Attempting to connect!
 Connection made!
 Executing...
 Hey I think it worked!!!

现在，做

Select * from my_table;

 c_name  | c_address |  c_city
 ----------+-----------+----------
 one      | two       | three
 example1 | example2  | example3

回到你的问题，为什么你在 Select * from my_table; 中看到 0 条记录

事实:Amazon Redshift 完全满足 ACID 要求，这意味着在您的复制命令完成并提交之前，您将不会在 SELECT 中看到任何记录。

解决方案:您想看看您的查询发生了什么，是被执行还是被终止？

您可以运行以下命令来查看所有当前正在运行的查询。

  select pid, user_name, starttime, query from stv_recents where status='Running';

  //OR

  select query, pid, elapsed, substring from svl_qlog where userid = 100 order by starttime desc limit 5;

请参阅 AWS Redshift system query文档以获取更多详细信息。

关于java - 排查 AWS Redshift 上的 COPY 错误，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/50474428/

25

4

0

文章推荐： java - 如何从 SOAP 逻辑处理程序获取有效负载对象

文章推荐： javascript - 无法使 div/元素在嵌套的 shadowdom 中移动

文章推荐： java - 无法在 Eclipse 中使用 htmlunitsdriver

文章推荐： java - 让所有子节点处于二叉树的同一层

amazon-redshift - 将表从一个 redshift 集群复制到另一个 redshift 集群(不使用 s3)
我们可以直接将一张表从一个 Redshift 集群复制到另一个 Redshift 集群吗？我知道可以使用 s3 作为临时存储来实现表复制(即从第一个集群卸载到 s3，然后从 s3 复制到另一个集群)
amazon-redshift - 使用 Redshift Spectrum 读取 AWS Redshift 外部表中的数据
我在 AWS Redshift 集群中执行了以下操作以从 S3 读取 Parquet 文件。 create external schema s3_external_schema from data c
amazon-redshift - 使用 Redshift Spectrum 读取 AWS Redshift 外部表中的数据
我在 AWS Redshift 集群中执行了以下操作以从 S3 读取 Parquet 文件。 create external schema s3_external_schema from data c
amazon-redshift - Redshift 列编码会影响查询执行速度吗？
在 Amazon Redshift 中创建数据表时，您可以指定各种 encodings，例如 MOSTLY32 或 BYTEDICT 或 LZO。这些是在磁盘上存储列值时使用的压缩。我想知道我选择的
amazon-redshift - 将压缩文件插入 RedShift
我在 s3 中有一个压缩文件。我想将它插入到 RedShift 数据库中。我的研究发现做到这一点的唯一方法是启动一个 ec2 实例。将文件移到那里，解压缩，然后将其发送回 S3。然后将其插入到我的 R
amazon-redshift - Redshift 和超宽表
为了在 Multi-Tenancy 维度 DW 中处理特定对象的自定义字段，我创建了 Redshift 不太喜欢的超宽非规范化维度表(数百列，列的硬编码限制)；)。 user1|attr1|attr2
amazon-redshift - Redshift 时间序列表加载问题
Redshift 文档将时间序列表确定为最佳实践: http://docs.aws.amazon.com/redshift/latest/dg/c_best-practices-time-series
amazon-redshift - Redshift 复制和自动增量不起作用
我正在使用 redshift 的 COPY 命令从 S3 复制 json 数据。表定义如下: CREATE TABLE my_raw ( id BIGINT IDENTITY(1,1), ... .
amazon-redshift - Redshift - 提取约束
如何获取导出的键(数据库元数据)。即使 redshift 不支持外键和主键，我也可以在系统表中看到它们。这里的问题是在系统表中，外键的多列作为数组存在于一列中(尽管redshift不支持数组)。是否可
amazon-redshift - Redshift 查询每日生成的表
我正在寻找一种创建 Redshift 查询的方法，该查询将从每天生成的表中检索数据。我们集群中的表具有以下形式: event_table_2016_06_14 event_table_2016_06_
amazon-redshift - 如何在 Redshift 的结果中保留列别名中的大写和小写字母
在 Redshift 中，当我们将结果导入 TABLEAU 时，我们试图为从查询返回的列提供更有意义的别名，问题是 RedShift 将所有字母转换为小写字母，即从“事件日期” ” 然后它返回“事件日
amazon-redshift - 实现 Redshift 的高可用性？
据我了解，Redshift 是为性能而不是可用性而构建的。文档 https://aws.amazon.com/redshift/faqs/建议一旦任何一个节点宕机，整个集群都会宕机，直到该节点恢复。在
amazon-redshift - 如何找出 redshift 中中止查询的原因？
我试图找出与中止查询相关的原因/错误，其中可以从 STL_query 表中找到中止的查询。我为此使用了 STL_errors，但发现错误上下文与 process id 相关，而不是特定的查询 id。有
amazon-redshift - AWS Redshift 是否支持副本？
我们正在使用 AWS Redshift DB 并希望创建一个在线复制(这样也可以完全更新更改)？原因是我们希望为我们的一个部门提供一个单独的环境来运行他们自己的查询，因为他们可能会“发疯”并做一些
amazon-redshift - 检索 Redshift 错误消息
我在使用 DataGrip 的 Redshift 集群上运行查询需要超过 10 个小时才能运行，不幸的是，这些查询经常失败。唉，DataGrip 与数据库的连接保持的时间不够长，我无法看到查询失败的错
amazon-redshift - 如何使用查询获取 redshift 中查询的总运行时间？
我正在对 redshift 中的一些查询进行基准测试，以便我可以对我对表所做的更改进行一些智能说明，例如添加编码和运行 vacuum。我可以查询stl_query带有 LIKE 子句的表来查找我感兴趣
amazon-redshift - 删除表后由 Redshift 回收磁盘空间
删除表后，redshift 是否回收可用磁盘空间，或者我们是否需要运行 vaccum。最佳答案 drop table 释放空间。如果您正在对表的行进行删除操作，那么您应该触发 vaccumm de
amazon-redshift - Amazon Redshift 中的加权移动平均线
有没有办法在 Amazon Redshift 中计算具有固定窗口大小的加权移动平均值？更详细地说，给定一个带有日期列和值列的表，对于每个日期计算指定大小窗口的加权平均值，并在辅助表中指定权重。到目前
amazon-redshift - 在 RedShift 中第一次执行查询时的运行时间长
我注意到第一次在 RedShift 上运行查询需要 3-10 秒。当我再次运行相同的查询时，即使在 WHERE 条件中使用不同的参数，它也会运行得很快(0.2 秒)。我正在谈论的查询在一个约 1M
amazon-redshift - 我可以在 Redshift 中从一张表复制到另一张表吗
我明白 the COPY command非常有效地导入大量数据。但是使用 the INSERT command 将数据从一个表复制到另一个表是慢的。有没有更有效的方法将数据从一个表复制到另一个表？或者

首页

博学

6Ren·AI

商城

java - 排查 AWS Redshift 上的 COPY 错误