Flink测试利器之DataGen初探

转载作者：我是一只小鸟更新时间：2023-10-13 15:02:12

26

4

什么是 Flinksql

Flink SQL 是基于 Apache Calcite 的 SQL 解析器和优化器构建的，支持ANSI SQL 标准，允许使用标准的 SQL 语句来处理流式和批处理数据。通过 Flink SQL，可以以声明式的方式描述数据处理逻辑，而无需编写显式的代码。使用 Flink SQL，可以执行各种数据操作，如过滤、聚合、连接和转换等。它还提供了窗口操作、时间处理和复杂事件处理等功能，以满足流式数据处理的需求.

Flink SQL 提供了许多扩展功能和语法，以适应 Flink 的流式和批处理引擎的特性。他是Flink最高级别的抽象，可以与 DataStream API 和 DataSet API 无缝集成，利用 Flink 的分布式计算能力和容错机制.

使用 Flink SQL处理数据的基本步骤:

定义输入表：使用 CREATE TABLE 语句定义输入表，指定表的模式（字段和类型）和数据源（如 Kafka、文件等）.
执行 SQL 查询：使用 SELECT、INSERT INTO 等 SQL 语句来执行数据查询和操作。您可以在 SQL 查询中使用各种内置函数、聚合操作、窗口操作和时间属性等.
定义输出表：使用 CREATE TABLE 语句定义输出表，指定表的模式和目标数据存储（如 Kafka、文件等）.
提交作业：将 Flink SQL 查询作为 Flink 作业提交到 Flink 集群中执行。Flink会根据查询的逻辑和配置自动构建执行计划，并将数据处理任务分发到集群中的任务管理器进行执行.

总而言之，我们可以通过Flink SQL 查询和操作来处理流式和批处理数据。它提供了一种简化和加速数据处理开发的方式，尤其适用于熟悉 SQL 的开发人员和数据工程师.

什么是 connector

Flink Connector 是指用于连接外部系统和数据源的组件。它允许 Flink 通过特定的连接器与不同的数据源进行交互，例如数据库、消息队列、文件系统等。它负责处理与外部系统的通信、数据格式转换、数据读取和写入等任务。无论是作为输入数据表还是输出数据表，通过使用适当的连接器，可以在 Flink SQL 中访问和操作外部系统中的数据。目前实时平台提供了很多常用的连接器

例如:

JDBC ：用于与关系型数据库（如 MySQL、PostgreSQL）建立连接，并支持在 Flink SQL 中读取和写入数据库表的数据.
JDQ ：用于与 JDQ 集成，可以读取和写入 JDQ 主题中的数据.
Elasticsearch ：用于与 Elasticsearch 集成，可以将数据写入 Elasticsearch 索引或从索引中读取数据.
File Connector：用于读取和写入各种文件格式（如 CSV、JSON、Parquet）的数据.
...... 。

还有如HBase、JMQ4、Doris、Clickhouse，Jimdb，Hive等，用于与不同的数据源进行集成。通过使用 Flink SQL Connector，我们可以轻松地与外部系统进行数据交互，将数据导入到 Flink 进行处理，或将处理结果导出到外部系统.

DataGen Connector

DataGen 是 Flink SQL 提供的一个内置连接器，用于生成模拟的测试数据，以便在开发和测试过程中使用.

使用 DataGen，可以生成具有不同数据类型和分布的数据，例如整数、字符串、日期等。这样可以模拟真实的数据场景，并帮助验证和调试 Flink SQL 查询和操作.

demo

以下是一个使用 DataGen 函数的简单示例:

                        
                          -- 创建输入表
CREATE TABLE input_table (
 order_number BIGINT,
 price DECIMAL(32,2),
 buyer ROW<first_name STRING, last_name STRING>,
 order_time TIMESTAMP(3)
) WITH (
 'connector' = 'datagen',
);

在上面的示例中，我们使用 DataGen 连接器创建了一个名为 `input_table` 的输入表。该表包含了 `order_number`、`price` 和 `buyer` ,`order_time`四个字段。默认是random随机生成对应类型的数据,生产速率是10000条/秒，只要任务不停，就会源源不断的生产数据。当然也可以指定一些参数来定义生成数据的规则，例如每秒生成的行数、字段的数据类型和分布.

生成的数据样例:

                        
                          {"order_number":-6353089831284155505,"price":253422671148527900374700392448,"buyer":{"first_name":"6e4df4455bed12c8ad74f03471e5d8e3141d7977bcc5bef88a57102dac71ac9a9dbef00f406ce9bddaf3741f37330e5fb9d2","last_name":"d7d8a39e063fbd2beac91c791dc1024e2b1f0857b85990fbb5c4eac32445951aad0a2bcffd3a29b2a08b057a0b31aa689ed7"},"order_time":"2023-09-21 06:22:29.618"}
{"order_number":1102733628546646982,"price":628524591222898424803263250432,"buyer":{"first_name":"4738f237436b70c80e504b95f0d9ec3d7c01c8745edf21495f17bb4d7044b4950943014f26b5d7fdaed10db37a632849b96c","last_name":"7f9dbdbed581b687989665b97c09dec1a617c830c048446bf31c746898e1bccfe21a5969ee174a1d69845be7163b5e375a09"},"order_time":"2023-09-21 06:23:01.69"}

支持的类型

字段类型	数据生成方式
BOOLEAN	random
CHAR	random / sequence
VARCHAR	random / sequence
STRING	random / sequence
DECIMAL	random / sequence
TINYINT	random / sequence
SMALLINT	random / sequence
INT	random / sequence
BIGINT	random / sequence
FLOAT	random / sequence
DOUBLE	random / sequence
DATE	random
TIME	random
TIMESTAMP	random
TIMESTAMP_LTZ	random
INTERVAL YEAR TO MONTH	random
INTERVAL DAY TO MONTH	random
ROW	random
ARRAY	random
MAP	random
MULTISET	random

连接器属性

属性	是否必填	默认值	类型	描述
connector	required	(none)	String	'datagen'.
rows-per-second	optional	10000	Long	数据生产速率
number-of-rows	optional	(none)	Long	指定生产的数据条数，默认是不限制。
fields.#.kind	optional	random	String	指定字段的生产数据的方式 random还是sequence
fields.#.min	optional	(Minimum value of type)	(Type of field)	random生成器指定字段 # 最小值, 支持数字类型
fields.#.max	optional	(Maximum value of type)	(Type of field)	random生成器的指定字段 # 最大值, 支持数字类型
fields.#.length	optional	100	Integer	char/varchar/string/array/map/multiset 类型的长度.
fields.#.start	optional	(none)	(Type of field)	sequence生成器的开始值
fields.#.end	optional	(none)	(Type of field)	sequence生成器的结束值

DataGen使用

了解了dategen的基本使用方法，那么下面来结合其他类型的连接器实践一下吧.

场景1 生成一亿条数据到hive表

                        
                          CREATE TABLE dataGenSourceTable
 (
 order_number BIGINT,
 price DECIMAL(10, 2),
 buyer STRING,
 order_time TIMESTAMP(3)
 )
WITH
 ( 'connector'='datagen', 
 'number-of-rows'='100000000',
 'rows-per-second' = '100000'
 ) ;


CREATECATALOG myhive
WITH (
 'type'='hive',
 'default-database'='default'
);
USECATALOG myhive;
USE dev;
SETtable.sql-dialect=hive;
CREATETABLEifnotexists shipu3_test_0932 (
 order_number BIGINT,
 price DECIMAL(10, 2),
 buyer STRING,
 order_time TIMESTAMP(3)
) PARTITIONED BY (dt STRING) STORED AS parquet TBLPROPERTIES (
 'partition.time-extractor.timestamp-pattern'='$dt',
 'sink.partition-commit.trigger'='partition-time',
 'sink.partition-commit.delay'='1 h',
 'sink.partition-commit.policy.kind'='metastore,success-file'
);
SETtable.sql-dialect=default;
insert into myhive.dev.shipu3_test_0932
select order_number,price,buyer,order_time, cast( CURRENT_DATE as varchar)
from default_catalog.default_database.dataGenSourceTable;

当每秒生产10万条数据的时候，17分钟左右就可以完成，当然我们可以通过增加Flink任务的计算节点、并行度、提高生产速率'rows-per-second'的值等来更快速的完成大数据量的生产.

场景2 持续每秒生产10万条数到消息队列

                        
                          CREATE TABLE dataGenSourceTable (
 order_number BIGINT,
 price INT,
 buyer ROW< first_name STRING, last_name STRING >,
 order_time TIMESTAMP(3),
 col_array ARRAY < STRING >,
 col_map map < STRING, STRING >
 )
WITH
 ( 'connector'='datagen', --连接器类型
 'rows-per-second'='100000', --生产速率
 'fields.order_number.kind'='random', --字段order_number的生产方式
 'fields.order_number.min'='1', --字段order_number最小值
 'fields.order_number.max'='1000', --字段order_number最大值
 'fields.price.kind'='sequence', --字段price的生产方式
 'fields.price.start'='1', --字段price开始值
 'fields.price.end'='1000', --字段price最大值
 'fields.col_array.element.length'='5', --每个元素的长度
 'fields.col_map.key.length'='5', --map key的长度
 'fields.col_map.value.length'='5' --map value的长度
 ) ;
CREATE TABLE jdqsink1
 (
 order_number BIGINT,
 price DECIMAL(32, 2),
 buyer ROW< first_name STRING, last_name STRING >,
 order_time TIMESTAMP(3),
 col_ARRAY ARRAY < STRING >,
 col_map map < STRING, STRING >
 )
WITH
 (
 'connector'='jdq',
 'topic'='jrdw-fk-area_info__1',
 'jdq.client.id'='xxxxx',
 'jdq.password'='xxxxxxx',
 'jdq.domain'='db.test.group.com',
 'format'='json'
 ) ;
INSERTINTO jdqsink1
SELECT*FROM dataGenSourceTable;

思考

通过以上案例可以看到,通过Datagen结合其他连接器可以模拟各种场景的数据。

性能测试 ：我们可以利用Flink的高处理性能，来调试任务的外部依赖的阈值(超时，限流等)到一个合适的水位，避免自己的任务有过多的外部依赖出现木桶效应；
边界条件测试 ：我们通过使用 Flink DataGen 生成特殊的测试数据，如最小值、最大值、空值、重复值等来验证 Flink 任务在边界条件下的正确性和鲁棒性；
数据完整性测试 ：我们通过Flink DataGen 可以生成包含错误或异常数据的数据集，如无效的数据格式、缺失的字段、重复的数据等。从而可以测试 Flink 任务对异常情况的处理能力，验证 Flink任务在处理数据时是否能够正确地保持数据的完整性。

总之，Flink DataGen 是一个强大的工具，可以帮助测试人员构造各种类型的测试数据。通过合理的使用，测试人员可以更有效地进行测试，并发现潜在的问题和缺陷.

作者：京东零售石朴。

来源：京东云开发者社区转载请注明来源。

最后此篇关于Flink测试利器之DataGen初探的文章就讲到这里了,如果你想了解更多关于Flink测试利器之DataGen初探的内容请搜索CFSDN的文章或继续浏览相关文章，希望大家以后支持我的博客！。

26

4

0

文章推荐：浅析斐波那契数列在代码中的应用

【Flink】Flink 源码阅读笔记（15）- Flink SQL 整体执行框架
1.概述转载：Flink 源码阅读笔记（15）- Flink SQL 整体执行框架在数据处理领域，无论是实时数据处理还是离线数据处理，使用 SQL 简化开发将会是未来的整体发展趋势。尽管 SQL
【Flink】Flink 计算资源管理
1.概述转载：Flink 源码阅读笔记（6）- 计算资源管理在 Flink 中，计算资源的是以 Slot 作为基本单位进行分配的。本文将对 Flink 中计算资源的管理机制加以分析。 2.Task
【Flink】Flink jvm参数配置GC日志
1.概述转载：Flink jvm参数配置GC日志生产环境上，或者其他要测试 GC 问题的环境上，一定会配置上打印GC日志的参数，便于分析 GC 相关的问题。但是可能很多人配置的都不够“完美”，要
【Flink】Flink 源码阅读笔记（20）- Flink 基于 Mailbox 的线程模型
1.概述转载：Flink 源码阅读笔记（20）- Flink 基于 Mailbox 的线程模型相似文章：【Flink】Flink 基于 MailBox 实现的 StreamTask 线程模型 Fl
【FLink】Flink SQL代码生成与UDF重复调用的优化
1.概述转载：Flink SQL代码生成与UDF重复调用的优化 2. 代码生成简介代码生成（code generation）是当今各种数据库和数据处理引擎广泛采用的物理执行层技术之一。通过代码生成
【Flink】Flink 部署性能优化
1.概述转载：面向流批一体的 Flink Runtime 新进展首先是关于调度部分的性能优化。Flink 由于存在 all to all 的连接关系，两个并发为 n 的算子之间会有 n² 条边，这
apache-flink - 为什么我们在 flink 源代码中有 flink-streaming-java 和 flink-streaming-scala 模块
在Fink源码中，有flink-stream-java和flink-stream-scala模块。 flink streaming 为什么需要两个模块？ https://github.com/apac
apache-flink - Flink : How to handle external app configuration changes in flink
我的要求是在一天内流式传输数百万条记录，并且它对外部配置参数有很大的依赖性。例如，用户可以随时在 Web 应用程序中更改所需的设置，并且在进行更改后，必须使用新的应用程序配置参数进行流式传输。这些是应
apache-flink - 在 Apache Flink 服务器上哪里可以找到我使用 Apache Flink 仪表板提交的 jar
我开发了一个 Flink 作业并使用 Apache Flink 仪表板提交了我的作业。根据我的理解，当我提交作业时，我的 jar 应该在 Flink 服务器上可用。我试图找出我的 jar 的路径，但无
apache-flink - 在 Apache Flink 服务器上哪里可以找到我使用 Apache Flink 仪表板提交的 jar
我开发了一个 Flink 作业并使用 Apache Flink 仪表板提交了我的作业。根据我的理解，当我提交作业时，我的 jar 应该在 Flink 服务器上可用。我试图找出我的 jar 的路径，但无
【FLink】Flink 源码阅读笔记（4）- RPC
1.概述转载：Flink 源码阅读笔记（4）- RPC 相关文章：【Flink】Flink 源码之RPC调用 Flink】FLink 通讯组件 RPC 作为一个分布式系统，Flink 内部不同组件
【FLink】flink keyby 分布不均匀问题
1.概述转载并且补充： flink keyby 分布不均匀问题我使用随机数random.nextint(8)作为key，生成keyedstream之后，直接sink到存储中，但是sink算子只有四
【Flink】Flink Sort-Shuffle写流程简析
1.概述转载：Flink Sort-Shuffle写流程简析转载并且补充。 2.配置 taskmanager.network.sort-shuffle.min-parallelism 核心配置。设
【Flink】Flink 批处理模式Map端数据聚合 NormalizedKeySorter
1.概述转载：Flink源码分析——批处理模式Map端数据聚合在flink的批处理模式下，数据的计算也有着map/reduce两端的计算模型，这一点和MR、spark计算框架是类似的。在数据进行分
【Flink】Flink on yarn 远程调试
1.概述转载：Flink on yarn 远程调试大家好，我是 JasonLee。前几天有小伙伴问我，我写的 Flink 代码是提交到 yarn 上去运行的，那我怎么能远程调试代码呢？在本地调试
apache-flink - Flink 中的事件时间窗口不会触发
当我使用 flink 事件时间窗口时，窗口就是不触发。请问如何解决，有什么debug的方法吗？最佳答案由于您使用的是事件时间窗口，所以很可能是水印问题。该窗口仅在水印取得进展时输出。事件时间没有提
apache-flink - Flink 一个作业中的多个作业或多个管道
我有一个用例，我想在 Flink 上运行 2 个独立的处理流程。所以 2 个流程看起来像 Source1 -> operator1 -> Sink1 Source2 -> operator2 -> S
apache-flink - Flink 广播状态如何初始化？
我们正在尝试构建一个用例，其中来自流的数据通过计算公式运行，但公式本身也应该(很少)是可更新的。通过阅读文档，在我看来，Flink 广播状态很适合这种情况。作为实验，我构建了一个简化版本:假设我有一
apache-flink - flink 连接被对等方重置
我有一个 Flink Streaming 作业，它失败了，我得到如下日志。谁能告诉我如何解决这个问题？有时运行一天就失效，有时运行几个小时就失效。 09:30:25 948 INFO (org.ap
apache-flink - Flink 中的预洗牌聚合
我们正在将 spark 作业迁移到 flink。我们在 spark 中使用了 pre-shuffle 聚合。有没有办法在 spark.xml 中执行类似的操作？我们正在使用来自 apache kafk

首页

博学

6Ren·AI

商城