python - 如何迭代谷歌云存储中的所有文件以用作数据流输入？-6ren

python - 如何迭代谷歌云存储中的所有文件以用作数据流输入？

转载作者：行者123 更新时间：2023-12-02 09:32:21

25

4

用例

我想解析云存储中的多个文件并将结果插入 BigQuery 表中。

选择一个特定文件来读取效果很好。然而，当我使用 * glob 模式切换一个文件以包含所有文件时，我遇到了困难。

我正在执行这样的工作:

python batch.py --project foobar --job_name foobar-metrics --runner DataflowRunner --staging_location gs://foobar-staging/dataflow --temp_location gs://foobar-staging/dataflow_temp --output foobar.test

这是第一个 Dataflow 实验，我不确定如何调试它或这样的管道有哪些最佳实践。

预期结果

我希望作业上传到数据流运行程序，并且收集文件列表并迭代每个文件将在运行时在云中发生。我希望能够以与读取一个文件时相同的方式传递所有文件的内容。

实际结果

作业在尝试将其提交到 Cloud Dataflow 运行程序时已被阻止。

batch.py 的内容

"""A metric sink workflow."""

from __future__ import absolute_import

import json
import argparse
import logging

import apache_beam as beam
from apache_beam.io import ReadFromText
from apache_beam.io import WriteToText
from apache_beam.metrics import Metrics
from apache_beam.metrics.metric import MetricsFilter
from apache_beam.utils.pipeline_options import PipelineOptions
from apache_beam.utils.pipeline_options import SetupOptions
from apache_beam.utils.pipeline_options import GoogleCloudOptions

class ExtractDatapointsFn(beam.DoFn):
    """
    Parse json documents and extract the metrics datapoints.
    """
    def __init__(self):
        super(ExtractDatapointsFn, self).__init__()
        self.total_invalid = Metrics.counter(self.__class__, 'total_invalid')

    def process(self, element):
        """
        Process json that contains metrics of each element.

        Args:
            element: the element being processed.

        Returns:
            unmarshaled json for each metric point.
        """
        try:
            # Catch parsing errors as well as our custom key check.
            document = json.loads(element)
            if not "DataPoints" in document:
                raise ValueError("missing DataPoints")
        except ValueError:
            self.total_invalid.inc(1)
            return

        for point in document["DataPoints"]:
            yield point

def run(argv=None):
    """
    Main entry point; defines and runs the pipeline.
    """
    parser = argparse.ArgumentParser()
    parser.add_argument('--input',
                        dest='input',
                        default='gs://foobar-sink/*',
                        help='Input file to process.')
    parser.add_argument('--output',
                        required=True,
                        help=(
                            'Output BigQuery table for results specified as: PROJECT:DATASET.TABLE '
                            'or DATASET.TABLE.'))
    known_args, pipeline_args = parser.parse_known_args(argv)
    # We use the save_main_session option because one or more DoFn's in this
    # workflow rely on global context (e.g., a module imported at module level).
    pipeline_options = PipelineOptions(pipeline_args)
    pipeline_options.view_as(SetupOptions).save_main_session = True
    pipeline_options.view_as(GoogleCloudOptions)
    pipe = beam.Pipeline(options=pipeline_options)

    # Read the json data and extract the datapoints.
    documents = pipe | 'read' >> ReadFromText(known_args.input)
    metrics = documents | 'extract datapoints' >> beam.ParDo(ExtractDatapointsFn())

    # BigQuery sink table.
    _ = metrics | 'write bq' >> beam.io.Write(
        beam.io.BigQuerySink(
            known_args.output,
            schema='Path:STRING, Value:FLOAT, Timestamp:TIMESTAMP',
            create_disposition=beam.io.BigQueryDisposition.CREATE_IF_NEEDED,
            write_disposition=beam.io.BigQueryDisposition.WRITE_TRUNCATE))

    # Actually run the pipeline (all operations above are deferred).
    result = pipe.run()
    result.wait_until_finish()

    total_invalid_filter = MetricsFilter().with_name('total_invalid')
    query_result = result.metrics().query(total_invalid_filter)
    if query_result['counters']:
        total_invalid_counter = query_result['counters'][0]
        logging.info('number of invalid documents: %d', total_invalid_counter.committed)
    else:
        logging.info('no invalid documents were found')

if __name__ == '__main__':
    logging.getLogger().setLevel(logging.INFO)
    run()

最佳答案

我们在提交作业时对源进行大小估计，以便数据流服务可以在初始化作业时使用该信息(例如，确定初始的工作人员数量)。为了估计 glob 的大小，我们需要扩展 glob。如果 glob 扩展到超过 100k 个文件，这可能需要一些时间(我相信 GCS 需要几分钟)。我们将在此处研究改善用户体验的方法。

关于python - 如何迭代谷歌云存储中的所有文件以用作数据流输入？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/43095445/

25

4

0

文章推荐： spring - 在哪里放置组件scan

文章推荐： mapreduce - 适用于大型列表的 Spark FlatMap 函数

文章推荐： sails.js - 如何在 Sails 中访问 Assets 中的全局变量？

文章推荐：使用基本 String 对象使用 MD5 进行 Spring Security Salt 配置

SSIS 数据流 - 具有所需外键值的顺序插入
是否可以插入到初始表，然后使用插入的 ID 插入到主表中，该主表在一个数据流的列之间具有外键约束？我是集成服务的新手，不知道这些功能场景: 表 A - ID - DESC 表 B - ID - A
Azure 数据流 - 动态分组依据
在 Azure 数据流中，在聚合转换中是否可以在分组依据中动态包含列？我在分组依据中可能需要 8 列，具体取决于它们的值，即如果值为 1，则包含在分组依据中。简化为 2 列: Column1
Azure 数据流/数据工厂错误处理
我想要实现的是在azure数据流中包含错误处理，如果在传输行时发生错误，它不应该失败，它会处理其他行并将发生错误的行的ID保存在文本文件或日志中示例: 假设我们有 10 行要沉入表中，不知何故我们在
Azure 数据流-源查询下推
我的数据流作业将源和接收器作为突触数据库。我在从突触数据库提取数据时有一个源查询，其中包含数据流中的联接和转换。众所周知，底层的数据流将启动 databricks 集群来执行数据流代码。我的问题
java - 同步和合并消息/数据流
这是关于非常常见的传感器数据处理问题。为了同步和合并来自不同来源的传感器数据，我想用 Java 实现它，而不需要太复杂的第三个库或框架。假设我定义了一个对象 (O)，它由 4 个属性 (A1,..
适合初学者的 HTTP 数据流？
我开始从事一个项目，我需要使用 PowerTrack/GNIP 流式传输 Twitter 数据，老实说，我在网络方面非常非常缺乏经验，而且我完全不了解网络方面的知识到数据流 (HTTP)，它们如何工作
javascript - HTTP 数据流
我有一个后端要用 Python 实现，它应该将数据流式传输到 JavaScript 正在创建表示的 Web 浏览器(例如，不断更新变量或绘制到 )。该数据将以高达 100 Hz 的速率更新(最坏情
javascript - Mongoose 数据流
我构建了一个简单的 MERN 应用程序，用户可以在其中对电话号码进行评分。用户只需填写电话号码，选择评级(1 - 5 星评级)、城市和短文本。该应用程序具有带过滤和排序选项的搜索功能。这一切都足够好
c# - 如何以优雅的方式关闭发生致命异常的 TPL 数据流？
我在 TPL 数据流上使用顺序管道构建，它由 3 个块组成: B1 - 准备消息 B2 - 将消息发布到远程服务 B3 - 保存结果问题是如何在发生服务关闭等错误时关闭管道。管道必须以受控方式关闭，
Azure 数据工厂(数据流)- 数据预览中出现不存在的列
我在 ADF 数据流中有一个数据集(ADLS Gen2 中存在的 csv 文件)。我第一次尝试进行数据预览时，原始文件中的所有列都正确显示。然后，我从 csv 文件中删除了第一列并刷新了“数据预览”选
Azure数据工厂-数据流-完成后-移动
我正在使用 ADF v2 DataFlow ativity 将数据从 Blob 存储中的 csv 文件加载到 Azure SQL 数据库中的表中。在数据流(源 - Blob 存储)中，在源选项中，有一
azure - 动态展平 - 数据流 ADF
我有很多带有嵌套列表的 json 文件需要展平。问题是它们是不同的，我不想为它们每一个创建一个分支。如何通过输入参数动态执行具有“展开依据”和“输入列”字段的展平事件？谢谢! 最佳答案对于展开方式
azure - 数据流 - Azure - isDecimal
我一直在尝试使用 Azure 数据工厂的数据流在文件的小数列中进行数据类型检查，但它没有按预期工作。我的问题如下: 我想检查数字 121012132.12 是否为小数，因此我使用数据流的派生列并编写表
Azure 数据流 md5 函数不将十进制值识别为唯一
我们使用 Azure 数据流在 Azure SQL 数据仓库中生成数据表的历史记录。在数据流中，我们在所有列上使用 md5 或 sha1 函数来生成唯一的行指纹来检测记录中的更改，或识别已删除/新记录
Azure 数据流 md5 函数不将十进制值识别为唯一
我们使用 Azure 数据流在 Azure SQL 数据仓库中生成数据表的历史记录。在数据流中，我们在所有列上使用 md5 或 sha1 函数来生成唯一的行指纹来检测记录中的更改，或识别已删除/新记录
Python bz2 - 文本与交互式控制台(数据流)
我之前使用 bz2 来尝试解压缩输入。我想要解码的输入已经是压缩格式，因此我决定将格式输入到交互式 Python 控制台中: >>> import bz2 >>> bz2.decompress(inp
c# - 涉及递归未完成的 TPL 数据流
在测试 WPF 项目中，我尝试使用 TPL 数据流来枚举给定父目录的所有子目录，并创建具有特定文件扩展名的文件列表，例如“.xlsx”。我使用 2 个 block ，第一个 dirToFilesBlo
c# - TPL 数据流 block
问题:为什么使用 WriteOnceBlock (或 BufferBlock )用于从另一个 BufferBlock 取回答案(类似回调) (取回答案发生在发布的 Action 中)导致死锁(在此代码
C# TPL 数据流 - 完成不起作用
此代码永远不会到达最后一行，因为完成不会从 saveBlock 传播到 sendBlock。我做错了什么？ var readGenerateBlock = new TransformBlock(n =
c# - 为网站抓取工具实现的 TPL 数据流
好吧，我知道我的问题需要更多的指导，而不是技术细节，但我希望 SO 成员不会介意 TPL 数据流的新手提出一些非常基础的问题。我有一个简单的 Windows 窗体应用程序，它负责从我系统上的 Exc

首页

博学

6Ren·AI

商城