HDFS重要机制之checkpoint-6ren

HDFS重要机制之checkpoint

转载作者：撒哈拉更新时间：2024-10-22 14:18:59

56

4

核心概念

hdfs checkpoint 机制对于 namenode 元数据的保护至关重要, 是否正常完成检查点是评估 hdfs 集群健康度和风险的重要指标。

editslog : 对 hdfs 操作的事务记录，类似于 wal ，edit log文件以 edits_ 开头，后面跟一个txid范围段，并且多个edit log之间首尾相连,正在使用的 edit log 名字为 edits_inprogress_txid（dfs.namenode.edits.dir）
fsimage：文件系统的元数据，snn会定时合并将内存中的元数据落盘生成新的fsimage，默认会保存两个fsimage文件，文件格式为fsimage_txid（dfs.namenode.name.dir）
seen_txid：记录了最后一次 checkpoint 或者 edit 回滚（将 edits_inprogress_xxx 文件回滚成一个新的 Edits 文件）之后的 transaction ID。主要用来检查 NameNode 启动过程中 Edits 文件是否有丢失的情况

$Pasted image 20221207103015.png$

检查点将从旧的 fsimage 和编辑日志进行合并,创建一个新的 fsimage 。

Pasted image 20221128143125.png

checkpoint 触发由三个参数控制。

dfs.namenode.checkpoint.period
dfs.namenode.checkpoint.txns
dfs.namenode.checkpoint.check.period

HA 集群的 checkpoint 过程

Pasted image 20221128160510.png

这里 standby namenode 称为 SBNN，active namenode 称为 ANN 。

SBNN 查看是否满足创建检查点的条件（距离上次 checkpoint 的时间间隔大于等于 dfs.namenode.checkpoint.period
edits log 中的事务条数达到 dfs.namenode.checkpoint.txns 限制）
SBNN 将内存中当前的状态保存成一个新的文件，命名为fsimage.ckpt_txid。其中 txid 是最后一个 edit log 中的最后一条事务的 ID（transaction ID，不包括 inprogress）。然后为该 fsimage 文件创建一个MD5 文件，并将 fsimage 文件重命名为 fsimage_txid。
SBNN 向 ANN 发送一条 HTTP GET 请求。请求中包含了 SBNN 的域名，端口以及新 fsimage 的 txid。
ANN 收到请求后，用获取到的信息反过来向 SBNN 再发送一条 HTTP GET 请求，获取新的 fsimage 文件。这个新的 fsimage 文件传输到 ANN 上后，也是先命名为 fsimage.ckpt_txid，并为它创建一个 MD5 文件。然后再改名为 fsimage_txid，checkpoint过程完成。

。

生产实践

对于大规模的集群,如果长期未成功完成 checkpoint ,那么会积累非常多的 editlog 文件.重启 namenode 的时候,必须要回放 editlog ,以使内存中的目录树恢复到最新状态.回放 editlog 必然是逐个文件来回放的,此时如果积累了大量的 editlog 文件,那么这个过程会长达三个小时以上.增大 namenode 的内存可以适当加快这个过程. 。

edit 文件堆积处理

如果长期 edit 日志文件有堆积,可以进入安全模式后,手动运行 saveNamespace 命令来进行一次合并. 但是线上环境中,不能进入安全模式,这个时候可以通过重启 standynamenode 来触发一次 checkpoint 。

遇到过一次线上问题,由于 ann 锁的问题导致 sbnn 无法 put fsimage 到 ann,重启 sbnn 也无法完成最终完成 checkpoint ,这个时候可以等 sbnn namespace 正常启动后,然后进行一次主备切换,使之前锁住的 ann 变成了 sbnn,然后重启这个节点,此时就能够完成 checkpoint 了,堆积的 edit 文件也能够被清理了。

手动 checkpoint 方法

hdfs dfsadmin -fs 10.0.0.26:4007 -safemode enter hdfs dfsadmin -fs 10.0.0.26:4007 -saveNamespace hdfs dfsadmin -fs 10.0.0.26:4007 -safemode leave hdfs dfsadmin -safemode forceExit //强制退出安全模式。

监控 checkpoint

有两个重要指标

TransactionsSinceLastCheckpoint 表示距离上次checkpoint的事务数，建议超过3000000 告警
LastCheckpointTime 上次checkpoint的时间，建议距离当前时间超过12小时告警

谨慎重启 NameNode

hdfs 在重启流程需要加载 edit logs,如果 edit logs 遗留有没被注意到的错误, hdfs 将会无法启动完成,导致生产事故。

比较常见的原因是: 误删editslog、JournalNode节点有断电、数据目录磁盘占满、网络持续异常等。

常见报错如下

java.io.IOException: Gap in transactions. Expected to be able to read up until at least txid 813248390 but unable to find any edit logs containing txid 363417469

可以动态开启DEBUG 日志级别定位报错位置。

解决办法:

查看其它的JournalNode的数据目录或NameNode数据目录中，有没有连续的该序号相关的连续的edits文件。如果可以找到，复制一个连续的片段到该JournalNode
使用namenode recovery 模式跳过 edits 错误
使用 edits viewer 修复错误 edit 文件
从 active nn 恢复 standy nn
以上如不能解决,只能从fsimage恢复namenode 来上线 namenode

高频故障 issue: https://issues.apache.org/jira/browse/HDFS-15175 。

。

最后此篇关于HDFS重要机制之checkpoint的文章就讲到这里了,如果你想了解更多关于HDFS重要机制之checkpoint的内容请搜索CFSDN的文章或继续浏览相关文章，希望大家以后支持我的博客！。

56

4

0

文章推荐： LaMI-DETR：基于GPT丰富优化的开放词汇目标检测|ECCV'24

文章推荐： k8s中的GatewayAPI的背景和简介【k8s系列之四】

文章推荐： Vue最受欢迎的七大跨端框架，你都用过哪几个？

文章推荐：一文彻底弄懂并解决Redis的缓存雪崩，缓存击穿，缓存穿透

python - Azure Eventhub (Python) : checkpointing with blob storage - keyerror issue in EventProcessor when checkpointing is enabled
我在 eventhub 中遇到了 Blob 存储检查点问题。如果我在获取消费者客户端时没有设置 checkpoint_store，我的应用程序运行正常。每当我尝试设置 checkpoint_store
hadoop - 检查点在 HDFS 中是如何工作的？我想弄清楚 fs.checkpoint.period 和 fs.checkpoint.size
当它说时，辅助名称节点检查点每小时(fs.checkpoint.period 以秒为单位)或如果编辑日志已达到 64 MB(fs.checkpoint.size 以字节为单位)则更早？究竟是什么意思？
postgresql - Postgres Checkpointer 进程始终运行
我正在运行 PostgreSQL 服务器并将 shared_buffers 限制为 4GB。当我在数据库中插入大量记录时，检查点进程开始消耗 RAM。即使在一天后，此过程既不会结束也不会减少 RAM
apache-spark - RDD.checkpoint() 不在检查点目录中存储任何数据
我已经用 sc.setCheckpointDir 设置了检查点目录方法。 /checkpointDirectory/ 然后我创建了一个 rdd 的检查点:rdd.checkpoint()在目录中，我现
tensorflow 错误: restore checkpoint file
我建立了自己的卷积神经网络，在其中跟踪所有可训练变量的移动平均值(tensorflow 1.0): variable_averages = tf.train.ExponentialMovingAver
postgresql - Postgres : Checkpoints Are Occurring Too Frequently
我们有一个强大的 Postgres 服务器(64 核，384 GB RAM，16 个 15k SAS 驱动器，RAID 10)，并且在一天中我们多次重建几个写入密集型的大型数据集。 Apache 和
python - tensorflow : how to get a list of checkpoints
我需要以编程方式获取不依赖于目录列表和文件扩展验证的现有检查点列表，如果您键入: tf.train.get_checkpoint_state('checkpoints') 您可以看到已打印此列表，但我
python - PyCharm:将变量存储在内存中以便能够从 "checkpoint"运行代码
我一直在到处寻找这个问题的答案，但无济于事。我希望能够运行我的代码并将变量存储在内存中，以便我可以设置一个“检查点”，我可以在将来运行它。原因是我有一个相当昂贵的函数，它需要一些时间来计算(以及用户输
python - 有没有一种简单的方法可以在扩展的 python 脚本中使用 "checkpoints"？
作为我的问题的序言，让我提供一些背景信息:我目前正在研究一个包含许多不同步骤的数据管道。每一步都可能出错，而且很多都需要一些时间(不是很多，但在几分钟的数量级)。因此，管道目前受到人工的严格监督。分
org.apache.flink.runtime.checkpoint.ZooKeeperCompletedCheckpointStore类的使用及代码示例
本文整理了Java中org.apache.flink.runtime.checkpoint.ZooKeeperCompletedCheckpointStore类的一些代码示例，展示了ZooKeeper
org.apache.flink.runtime.checkpoint.ZooKeeperCheckpointIDCounter类的使用及代码示例
本文整理了Java中org.apache.flink.runtime.checkpoint.ZooKeeperCheckpointIDCounter类的一些代码示例，展示了ZooKeeperCheck
org.apache.flink.runtime.checkpoint.ZooKeeperCheckpointRecoveryFactory类的使用及代码示例
本文整理了Java中org.apache.flink.runtime.checkpoint.ZooKeeperCheckpointRecoveryFactory类的一些代码示例，展示了ZooKeepe
apache-spark - CheckPointing 时在 foreachRDD() 中使用的对象的序列化
根据 this question和我读过的文档，Spark Streaming 的 foreachRDD(someFunction) 将让 someFunction 本身仅在驱动程序进程中执行，但如果
tensorflow - TF/Keras 错误 : InputLayer not a Checkpointable
我正在使用简单的猫与狗数据集在 Google Colab 上尝试新添加的 TPU 支持。在创建了一个简单的 CNN 之后，我尝试将模型导出到 TPU。但它因错误而失败 TypeError: Chec
tensorflow - 如何获取重新训练的 inception-v3 模型的 'checkpoint'？
我正在尝试在tensorflow-serving中使用重新训练的inception-v3模型。但看来我必须提供一个“检查点”。我想知道如何获得这些“检查点”？ retrain.py 返回一个 retr
python - 谷歌云机器学习引擎 "Skipping evaluation due to same checkpoint"
所以我有一个基于 census tutorial 的 ML 引擎包我尝试使用 --min-eval-Frequency 标志每 N 个步骤执行一次评估，但我不断在 stackdriver 日志中收到消
python - 如何使用 tf.train.Checkpoint 保存大量变量
我可以通过以下方式在检查点( https://www.tensorflow.org/beta/guide/checkpoints#manually_inspecting_checkpoints )中保
ios - 室内图集 : Get checkpoint list created
我刚刚在 IndoorAtlas 上进行了分析，并使用 ios SDK 尝试了示例应用程序。当我四处走动时，我在创建的平面图中更新了我的位置。我想知道当我到达我在楼层内创建检查点的位置时应该如何接收
python - 错误 :tensorflow:Couldn't match files for checkpoint
我正在训练一个 tensorflow 模型，在每个 epoch 之后我保存模型状态并 pickle 一些数组。到目前为止，我的模型做了 2 个时期，保存状态的文件夹包含以下文件: checkpoint
java - rdd.checkpoint 在 spark 作业中被跳过
您好，我正在尝试运行一个经常因 StackoverflowError 而失败的长 sparkjob。该作业读取一个 parquetfile 并在 foreach 循环中创建一个 rdd。在做了一些研究

首页

博学

6Ren·AI

商城