databricks - Delta Lake 存储层

databricks - Delta Lake 存储层 - 概念

转载作者：行者123 更新时间：2023-12-04 17:17:28

25

4

我是 Databricks 的新手，有以下疑问 -
Databricks 提出了 3 层存储 Bronze(原始数据)、Silver(干净数据)和 Gold(聚合数据)。这些存储层要存储的内容很明确。但我怀疑这些是如何实际创建或识别的。从 Silver 或 Gold 检索数据时我们如何指定。这些是不同的数据库或不同的格式还是其他什么？
请帮助我弄清楚这个概念。

最佳答案

这些逻辑层:

Bronze 层存储未经修改的原始数据 - 最常见的更改通常只是更改数据格式，例如，将输入数据作为 CSV 并将数据存储为 Delta。拥有 Bronze 层的主要目标是确保您拥有原始数据，并且您可以在必要时重建 Silver & Gold 数据，例如，如果您在生成 Silver 层的代码中发现错误。 Bronze 层的必要性在很大程度上取决于数据的来源。例如，如果您的数据来自某个数据库，那么您可以期望那里的数据已经干净，在这种情况下，您可以将它们直接摄取到 Silver 层中。最终用户通常不会直接访问青铜层

Silver 层是通过应用一些转换、丰富和清理程序从 Bronze 创建的。例如，如果某列中的数据必须非空，或者在某个范围内，则可以添加类似bronze_df.filter("col1 is not null")的代码。并存储结果。如果您在转换中发现错误，或者需要添加额外的检查，则可以从 Bronze 重新生成 Silver 层。 Silver 层通常可供需要行级详细数据的最终用户访问

Gold 层通常是某种聚合数据，将用于报告、仪表板等。 Gold 层中可能有多个表，这些表由一个或多个 Silver 表生成。

Databricks 通常建议对所有这些层使用 Delta Lake，因为它更容易在层之间以增量方式处理数据，通常使用结构化流。但你不受此限制。我见过很多客户将 Gold 层的结果输出到 Azure SQL 数据库、NoSQL 数据库或其他东西中，从中它可以被只能在这些系统上工作的应用程序使用。

关于databricks - Delta Lake 存储层 - 概念，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/68330189/

25

4

0

文章推荐： erpnext - 如何在 Frappe/ERPNext 中正确删除自定义文档类型

文章推荐： node.js - 在 golang 中为 http 响应创建自定义错误

文章推荐： javascript - Apexcharts - 悬停在一个非常小的列上

文章推荐： flutter - 使用交互式查看器 (FLUTTER) 时的手势检测器问题

databricks - Databricks 中的目录
我已经开始阅读 Databricks 推出的 Unity Catalog。我了解它试图解决的基本问题，但我不了解目录到底是什么。这在 Databricks 文档中可用， A catalog cont
databricks - 为什么我不使用 Databricks 作为我的数据集市？
我正在努力了解 Databricks。我发现文档逐步从 S3 或 Azure Datalake 导入数据，然后输出到 Azure Synapse Analytics 或其他数据仓库解决方案。快速播
databricks - 以编程方式将库导入到 Databricks 中的工作区
我想以编程方式将(Python Wheel)库添加到 /Shared Databricks 上的工作区。在 GUI(工作区 > 导入 > 库)中很容易做到，但我无法弄清楚如何在 Databricks
databricks - 在 Databricks 笔记本错误中显示图像
我正在创建一个带有公司 Logo 的 databricks 笔记本模板。使用以下代码显示图像会引发错误。代码: %md 错误: HTTP ERROR 403: Invalid or missing
databricks - 如何在现有数据库之上创建具有只读访问权限的 databricks 数据库
我将使用这张图片来形象化我的问题: Databricks1 在 Databricks 中创建数据库(和表)并将其数据存储在存储帐户中。在Databricks2中我想读取数据:Databricks2只有
databricks - Azure Databricks secret 范围 : Azure Key Vault-backed or Databricks-backed
有没有办法通过 python 笔记本确定现有的 Azure Databricks Secret Scope 是否由 Key Vault 或 Databricks 支持？ dbutils.secrets
databricks - 无法将 dbt 连接到 Databricks
我正在尝试连接到 Databricks 上的 Spark 集群，并且正在学习本教程:https://docs.databricks.com/dev-tools/dbt.html .我安装了 dbt-d
databricks - 从 Databricks Autoloader 获取已加载文件的列表
我们可以使用Autoloader跟踪是否已从 S3 存储桶加载的文件。我关于 Autoloader 的问题:有没有办法读取 Autoloader 数据库以获取已加载文件的列表？我可以在 AWS Gl
databricks - 如何将日志从 Azure Databricks 重定向到另一个目的地？
我们可以使用一些帮助来了解如何将 Spark Driver 和 worker 日志发送到 Azure Databricks 之外的目的地，例如Azure Blob 存储或使用 Eleastic-bea
databricks - 如何启用 Databricks Delta 功能
将我的 Azure Databricks 从标准升级到主要，尝试开始使用 Databricks Delta: create table t using delta as select * from t
databricks - 我们可以从 Databricks Autoloader 中排除或仅包含特定的文件扩展名吗？
现在，databricks 自动加载器需要一个目录路径，从中加载所有文件。但是，如果其他类型的日志文件也开始进入该目录 - 有没有办法让 Autoloader 在准备数据帧时排除这些文件？ df =
databricks - 如何使用 Databricks dbutils 从文件夹中删除所有文件
有人可以让我知道如何使用 databricks dbutils 从文件夹中删除所有文件。我尝试了以下但不幸的是，Databricks 不支持通配符。 dbutils.fs.rm('adl://azu
Azure Databricks - 解释 databricks 中的安装语法
我是 azure 的新手和databricks ，我学会了如何安装 blob 和利用，但我有一些疑问，而且我还没有找到任何文档的任何答案。所以请帮我解释一下: dbutils.fs.mount(
azure - Databricks FileInfo : java. lang.ClassCastException : com. databricks.backend.daemon.dbutils.FileInfo 无法转换为 com.databricks.service.FileInfo
尝试遍历已安装的 Databricks 卷中的目录时遇到 ClassCastException。 java.lang.ClassCastException: com.databricks.backen
azure - Databricks FileInfo : java. lang.ClassCastException : com. databricks.backend.daemon.dbutils.FileInfo 无法转换为 com.databricks.service.FileInfo
尝试遍历已安装的 Databricks 卷中的目录时遇到 ClassCastException。 java.lang.ClassCastException: com.databricks.backen
databricks - 如何从 Databricks mnt 目录中删除文件夹/文件
我正在运行 Databricks Community Edition，我想从以下 mnt 目录中删除文件 /mnt/driver-daemon/jars 我运行 dbutils 命令: dbutils
databricks - 如何使用 .netrc 文件验证 Databricks API
我已经在我的机器上创建了“.netrc”文件并尝试在 databricks rest api 调用下面。但它总是给出未经授权的错误。如何在 Databricks 中创建 .netrc 文件？ curl
azure-databricks - 有没有办法恢复 Azure Databricks 中已删除的数据？
没有意识到 shift+enter 运行一个单元格。我正在写一个 delete from table 并按下 shift enter 删除了表中的所有数据。最佳答案在 Delta Lake 表中，
azure-databricks - Databricks 和 Azure 文件
我需要访问 Azure Files来自 Azure Databricks .根据文档 Azure Blobs受支持，但我需要此代码来处理 Azure 文件: dbutils.fs.mount( s
azure-databricks - 使用服务主体从 DataBricks 连接到 Synapse
我正在尝试使用服务主体从 Databricks 连接到 Synapse。我已经在集群配置中配置了服务主体 fs.azure.account.auth.type..dfs.core.windows.n

首页

博学

6Ren·AI

商城

databricks - Delta Lake 存储层 - 概念