google-cloud-dataflow - Apache 光束 : why is the timestamp of aggregate value in Global Window 9223371950454775?-6ren

google-cloud-dataflow - Apache 光束 : why is the timestamp of aggregate value in Global Window 9223371950454775?

转载作者：行者123 更新时间：2023-12-02 00:49:56

25

4

我们从 Google Dataflow 1.9 迁移到 Apache Beam 0.6。我们注意到应用全局窗口后时间戳的行为发生了变化。在 Google Dataflow 1.9 中，我们将在窗口/组合函数之后在 DoFn 中获得正确的时间戳。现在我们得到了时间戳的一些巨大值，例如9223371950454775，Apache Beam 版本中全局窗口的默认行为是否发生变化？

input.apply(name(id, "Assign To Shard"), ParDo.of(new AssignToTest()))
      .apply(name(id, "Window"), Window
          .<KV<Long, ObjectNode >>into(new GlobalWindows())
          .triggering(Repeatedly.forever(
              AfterProcessingTime
                  .pastFirstElementInPane()
                  .plusDelayOf(Duration.standardMinutes(1))))
          .discardingFiredPanes())
      .apply(name(id, "Group By Shard"), GroupByKey.create())
      .appy(.....) }

最佳答案

TL;DR:当您组合一堆带时间戳的值时，您需要为聚合结果选择一个时间戳。对于这个输出时间戳有多个很好的答案。在 Dataflow 1.x 中，默认值是输入时间戳的最小值。根据我们在 Beam 1.x 中的经验，默认值已更改为窗口末尾。您可以通过将 .withTimestampCombiner(TimestampCombiner.EARLIEST) 添加到 Window 转换来恢复之前的行为。

<小时/>

我会打开这个。让我们使用 @ 符号将一个值及其时间戳配对。仅关注一个键，您就有带时间戳的值 v1@t1、v2@t2，...等。我将继续使用您的原始 示例GroupByKey 即使这也适用于组合值的其他方式。因此值的输出可迭代是 [v1, v2, ...] 以任意顺序。

以下是时间戳的一些可能性:

分钟(t1，t2，...)
max(t1, t2, ...)
这些元素所在窗口的末尾(忽略输入时间戳)

这些都是正确的。这些都可以作为 Dataflow 1.x 中的 OutputTimeFn 和 Apache Beam 中的 TimestampCombiner 的选项。

时间戳有不同的解释，它们对于不同的事情很有用。聚合值的输出时间控制下游水印。因此，选择较早的时间戳可以更好地保留下游水印，而较晚的时间戳则可以使其继续前进。

min(t1, t2, ...) 允许您解压可迭代并重新输出v1@t1
max(t1, t2, ...) 准确地模拟聚合值完全可用的逻辑时间。由于实现细节的原因，Max 确实往往是最昂贵的。
窗口结束:
- 模拟了该聚合代表窗口所有数据的事实
- 非常容易理解
- 允许下游水印尽快前进
- 非常高效

出于所有这些原因，我们将默认值从分钟切换为窗口结束。

在 Beam 中，您可以通过将 .withTimestampCombiner(TimestampCombiner.EARLIEST) 添加到 Window 转换来恢复之前的行为。在 Dataflow 1.x 中，您可以通过添加 .withOutputTimeFn(OutputTimeFns.outputAtEndOfWindow()) 迁移到 Beam 的默认设置。

另一个技术细节是用户定义的 OutputTimeFn 被删除并被 TimestampCombiner 枚举取代，因此只有这三个选择，而不是一个完整的 API 来编写您的拥有。

关于google-cloud-dataflow - Apache 光束 : why is the timestamp of aggregate value in Global Window 9223371950454775?，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/45286321/

25

4

0

文章推荐： java - 如何使用java获取hashmap中XML的键值

文章推荐： django - 登录后重定向到最后一个 View

文章推荐： RMarkdown - 更改内联代码颜色

aggregate - 什么是 "aggregate"
刚刚收到一条错误消息，内容为“union __anonymous 只能是聚合的一部分”。我对此并不感到困惑，因为我正在尝试一些我知道不应该起作用的东西。但这让我想知道 D 中“聚合”的确切定义是什么
elasticsearch - “Filter then Aggregation”还是“Filter Aggregation”？
我最近在研究ES，发现可以达到几乎相同的结果，但是对于这两者之间的 DIFFERENCE ，我不清楚。 "Filter then Aggregation" POST kibana_sample_dat
sql - 更改查询以避免 Bigquery 中的 "Aggregations of aggregations are not allowed"
给定用户和订单表，我需要计算在注册日期后的第二天首次下单的用户。我设法通过以下查询列出了此类用户: SELECT users.first_name as first_name, users.
elasticsearch - Bucket_script aggregation on filters aggregation over nested documents
我有我的文档，它们包含嵌套的“事件”(如网站上的点击)文档。现在我想计算 name=x 的嵌套事件和 name=y 的嵌套事件之间的比率这是我的查询: curl -XGET http://192.
architecture - 领域驱动设计 : Aggregate root & Sub Aggregate roots
在我的项目中，我发现需要以分层方式打破我的聚合，使用顶级根级别聚合，以确保根级别的规则一致性，然后我的根下的对象可以分组为各种聚合。在计算根级聚合的完整性时，根验证自己的规则，然后委托(delegat
Spring 数据 MongoDB : How to describe aggregation $merge with Spring Aggregation?
我想通过 MongoTemplate 执行的代码: { $merge: { into: 'someCollection', on: "_id",
domain-driven-design - DDD : Getting aggregate roots for other aggregates
在过去的两周里，我一直在研究DDD，而真正令我难忘的一件事是聚合根如何包含其他聚合根。从存储库中检索聚合根，但是如果一个根包含另一个根，该存储库是否具有对另一个存储库的引用，并要求其构建子根？最佳答
domain-driven-design - DDD : Aggregate design - Referencing between aggregates
我对如何设计聚合有疑问。我有Company , City , Province和 Country实体。其中每一个都需要是其自身聚合的聚合根。 City , Province和 Country实体在整
domain-driven-design - DDD : Aggregate design - Referencing between aggregates
我对如何设计聚合有疑问。我有Company , City , Province和 Country实体。其中每一个都需要是其自身聚合的聚合根。 City , Province和 Country实体在整
c# - DDD : Aggregate Root accessed by another aggregate root
我目前正在开发 DDD 应用程序，我对如何处理似乎必须从另一个聚合根访问聚合根的场景感到困惑。这是我的边界上下文的概述: 用户可以加入该站点并就他们感兴趣的主题创建帖子。他们还可以创建群组并针对他们创
domain-driven-design - 解决框架 : How to properly derive an aggregate's state from the state of other aggregates?
我正在用 reSolve 做我的第一个项目，但在 DDD、ES 和 CQRS 方面的经验有限。所以，也许有一个非常简单的解决方案，但我还没有找到。我的问题:在我的项目中，一个聚合的状态(订单状态)实
azure - Azure Cosmos cassandra 数据库中的 "Cannot have aggregate and non-aggregate selectors in query"
https://howtoprogram.xyz/2017/02/18/using-group-apache-cassandara/ 我试图在 azure cosmos cassandra db 中执
java - 西提 CEP : Aggregate functions with time window don't "remove" values from aggregation
使用 Siddhi 3.0.3 作为 Java 库。我通过扩展 AttributeAggregator 类开发了自定义聚合函数，并且在调用 processRemove() 方法后我看到了一些奇怪的行
design-patterns - DDD : Can an Aggregate Root be an Entity within another Aggregate Root?
我正在尝试对一个公司拥有许多团队的问题进行建模。有一条业务规则“每个公司的团队名称必须是唯一的”。然而，团队还有许多其他行为，例如加入。此外，一个团队可以有许多报告 - 它们维护对Team.Id的引用
sql-server - T-SQL : Cannot perform an aggregate function on an expression containing an aggregate or a subquery
我正在尝试将总计的结果相加并将其减去总计，但我看到以下错误: 想象一下这样的事情第一个子查询:1 3 5 7第二个子查询:2 4 6 总计:(1+3+5+7) - (2+4+6) = 4 这是我的查
c# - DDD : one-to-many relationship between user aggregate root and almost all entities in other aggregates
我有以下 DDD 场景，分为以下聚合: 用户， friend (用户协会)，文件(供用户上传)，图库(文件分组)，消息(用户通信)，群组(用户可以创建，其他成员可以加入)， GroupMess
SQL Server "cannot perform an aggregate function on an expression containing an aggregate or a subquery"，但 Sybase 可以
这个问题之前已经讨论过，但没有一个答案能解决我的具体问题，因为我正在处理内部和外部选择中的不同 where 子句。该查询在 Sybase 下执行得很好，但在 SQL Server 下执行时会出现本文标
azure - 流分析: How can I start and stop a TUMBLINGWINDOW aggregation job inorder to reduce costs while still getting the same aggregation results?
上下文我使用 Azure 门户创建了一个流作业，该门户使用每日 TUMBLINGWINDOW 聚合数据。下面附上了一个代码片段，修改自 docs ，这显示了类似的逻辑。 SELECT DAT
mysql错误 "ERROR 3029 (HY000): Expression #1 of ORDER BY contains aggregate function and applies to the result of a non-aggregated query"
我正在执行以下查询 SELECT DISTINCT n.nid AS entity_id FROM node n INNER JOIN og_membership om ON n.nid=om.eti
aggregation - 如何聚合普罗米修斯指标
我的各种 docker 容器都导出 prometheus 指标，但是我们的 prometheus 安装只需要从一个端点提取所有指标。不幸的是，这无法更改。因此，我需要通过安装普罗米修斯来收集所有指标。

首页

博学

6Ren·AI

商城

google-cloud-dataflow - Apache 光束 : why is the timestamp of aggregate value in Global Window 9223371950454775?