amazon-dynamodb - 使 DynamoDB 数据在 Athena 中可搜索的正确方法？-6ren

amazon-dynamodb - 使 DynamoDB 数据在 Athena 中可搜索的正确方法？

转载作者：行者123 更新时间：2023-12-04 23:54:46

27

4

我需要一个缓慢变化的 AWS DynamoDb 定期转储到 S3 上，以便在 Athena 上查询它。需要确保 Athena 可用的数据与 DynamoDb 上的可用数据相差不大(最大滞后 1 小时)
我知道以下两种方法:

使用 EMR(来自数据管道)到 export整个 DynamoDb
这种方法的优点是使用单个 EMR 脚本(每小时运行一次)，可以在 S3 上转储可直接在 Athena 上搜索的压缩 Parquet 文件。但是，这种方法的一个很大的缺点是，虽然一个小时内只有少量记录发生变化，但需要进行整个转储，这需要 DynamoDb 中的读取容量和EMR 资源显着增加。

使用 DynamoDB Streams反射(reflect) S3 上 DynamoDb 中的任何更改。
这样做的优点是不需要在 DynamoDb 上处理未更改的数据，从而减少了对比正常操作所需的读取容量高得多的需求。但是，需要一个后续脚本(可能是另一个 EMR 作业)来整合 DynamoDb 流生成的每个记录文件，否则 Athena 的性能会因大量文件而受到严重影响。

有没有其他方法可以做得比这些更好？

最佳答案

我认为从性能/成本的角度来看，最好的解决方案是使用 DynamoDB Streams 和 Glue Job 每天一次(或每周一次，取决于您的数据速度)整合文件。

DynamoDB Streams 方法(以及所有增量读取数据的解决方案)的一个缺点是您必须处理从 Parquet 文件更新/删除记录的复杂性。

如果您的负载不是专门将新数据“附加”到表中，您应该在某处写入任何更新/删除的项目(可能是 DynamoDB 表或 S3 文件)，并让 Glue 在将合并文件写入 S3 之前删除这些记录。

所有 Actor 将是:

Lambda 处理流应该:

将新添加的项目写入 S3 中的 Parquet 文件，

将更新(甚至是现有项目的 PutItem)和删除写入 DynamoDB 表；

胶水作业 运行频率较低，应该:

将第一个 lambda 创建的许多较小的文件合并为较少的较大的 Parquet ，

将 DynamoDB 表中记录的所有更新/删除操作合并到生成的 Parquet。

这比使用 EMR 每小时转储整个表要花费更多的精力:您应该自己判断是否值得。 :)

关于amazon-dynamodb - 使 DynamoDB 数据在 Athena 中可搜索的正确方法？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/52866902/

27

4

0

文章推荐： r - 打印多行而不打印print()

文章推荐： oracle - 插入空行

文章推荐： tinymce - tinymce 4.x (mceAddControl) 的命令标识符

amazon-athena - Amazon athena 无法读取 S3 访问日志文件，Athena 选择查询为每一列返回空结果集
我在 Athena 中成功创建了数据库表。请参阅下面的查询。 CREATE EXTERNAL TABLE IF NOT EXISTS s3_access_logs_db.wafbucket_lo
amazon-athena - athena 跳过以下划线开头的键
我正在尝试与 aws athena 合作，对我们存储在 s3 中的 json 文件进行一些查询。所以，我设法创建了一个简单的模式，一切似乎都很好，直到我注意到我的一些文件没有被考虑在内。文件的键是用
amazon-athena - presto athena 表作为变量
这个问题在这里已经有了答案: AWS ATHENA: user-defined variables (4 个答案) 关闭去年。我在 aws-athena 中有一个 SQL，它看起来或多或少像这样
amazon-athena - 如何处理 Athena 结果文件？
刚接触 AWS，第一次使用 Athena。将不胜感激任何帮助/澄清。我将查询结果位置设置为 s3://aws-athena-query-results-{ACCOUNTID}-{Region}，无论
amazon-athena - Aws Athena - 创建外部表跳过第一行
我正在尝试使用 Aws Athena 在 csv 文件上创建一个外部表，代码如下，但行 TBLPROPERTIES ("skip.header.line.count"="1")不起作用:它不会跳过 c
amazon-athena - Amazon Athena 允许查看访问并拒绝表访问
我需要将表中的某些字段隐藏到特定用户组。我想到了创建一个查看这允许我屏蔽这些字段。但是，一旦将权限设置为仅授予对 View 的访问权限，查询就会失败，因为它们还需要访问在 View 下正在查询的表
amazon-athena - 为 athena 选择特定文件
在 Athena 中创建表时，我无法使用特定文件创建表。有没有办法从给定的存储桶中选择以“year_2019”开头的所有文件？例如 s3://bucketname/prefix/year_2019*.
amazon-athena - 在 Amazon Athena 中按顺序显示分区
我有这个查询: SHOW PARTITIONS tablename; 结果是: dt=2018-01-12 dt=2018-01-20 dt=2018-05-21 dt=2018-04-07 dt=2
amazon-athena - 在 Amazon Athena 中创建表时转换时间戳
我一直在使用以下查询在 Athena 中创建一个表， CREATE EXTERNAL TABLE IF NOT EXISTS test.test_table ( `converteddat
amazon-athena - 如何在 Presto (Athena) 中将字符串转换为时间戳？
我想将字符串的数据类型(例如:'2018-03-27T00:20:00.855556Z')转换为时间戳(例如:'2018-03-27 00:20:00')。实际上我在 Athena 中执行查询: s
amazon-athena - AWS Athena map 查询
该表有一列像这样， data MAP 和行喜欢， id | data 1 | {"foo": 123} 2 | {"bar": 456} 那么，如何搜索 data["bar"] = 456？我
amazon-athena - 在 Athena/Presto 中将数组拆分为列
我觉得这应该很简单，但我一直在努力寻找正确的术语，请耐心等待。我有两列，timestamp和 voltages这是数组如果我做一个简单的 SELECT timestamp, voltages FR
amazon-athena - Apache 超集 : cannot read metadata from Athena
我正在尝试从超集访问 Athena，连接成功并且可以在 SQL 编辑器中看到所有模式和表(启用在 SQL 实验室中公开此数据库)。在 SQL 编辑器上加载元数据时返回以下错误: ERROR OCCU
amazon-athena - AWS Athena ODI JDBC 连接
有没有人尝试过从 Oracle Data Integrator 连接 AWS Athena。我一直在尝试这个，但我找不到合适的 JDBC 连接字符串。我遵循的步骤 https://docs.aws
amazon-athena - Athena MSCK 修复表返回 'tables not in metastore'
运行 MSCK repair tablename 命令时，athena查询编辑器返回错误 tables not in metastore . 但是表存在，我可以在该表上查询。我有数据保存在 S3形式
amazon-athena - 如何通过 API 创建 Athena 数据库
我想通过 API 在 Athena 中创建一个数据库。我在 S3 中有 Parquet 文件，我想使用 API 进行查询，我想使用 Athena 进行查询。无论如何，我可以通过 Athena 的 A
amazon-athena - 从嵌套的 json 源创建 Athena 表
如何从嵌套的 json 文件创建 Athena 表？这是我的示例 json 文件。我只需要选定的键值对，例如 roofcondition 和 garagestalls。 { "reportId":
amazon-athena - 从嵌套的 json 源创建 Athena 表
如何从嵌套的 json 文件创建 Athena 表？这是我的示例 json 文件。我只需要选定的键值对，例如 roofcondition 和 garagestalls。 { "reportId":
amazon-athena - 如何提取存储在 amazon Athena 中的 XML 数据？
我在 Amazon Athena 中获得了一张表，其中一列包含 XML 数据。这可能不是最好的方法，但我需要利用现有的资源。据我所知，没有原生支持从这些 XML 中提取数据(比如使用 XPATH 等
amazon-athena - 在 AWS Athena 中查询嵌套的 JSON 结构
我得到了以下格式的带有嵌套结构的 JSON 文档 { "id": "p-1234-2132321-213213213-12312", "name": "athena to the re

首页

博学

6Ren·AI

商城

amazon-dynamodb - 使 DynamoDB 数据在 Athena 中可搜索的正确方法？