Tensorflow 对象检测 API : Train from exported model checkpoint-6ren

Tensorflow 对象检测 API : Train from exported model checkpoint

转载作者：行者123 更新时间：2023-12-05 03:43:41

25

4

我之前导出了一个 RetinaNet 模型(最初来自对象检测动物园)，该模型已使用 Tensorflow 对象检测 API(Tensorflow 版本 2.4.1)在自定义数据集上进行了微调。以下是导出模型文件夹的外观。

在模型上运行评估(如下所示)时，它的 mAP@0.5IOU 为 0.5。

python model_main_tf2.py --model_dir=exported-models/retinanet --pipeline_config_path=exported-models/retinanet/pipeline.config --checkpoint_dir=exported-models/retinanet/checkpoint

问题

由于不幸的情况，我没有训练模型时的训练文件夹。随着我最近获得更多数据，我想使用导出的模型作为进一步训练的起点，并在新训练的pipeline.config:

  fine_tune_checkpoint: "exported-models/retinanet/checkpoint/ckpt-0"
  num_steps: 25000
  startup_delay_steps: 0.0
  replicas_to_aggregate: 8
  max_number_of_boxes: 100
  unpad_groundtruth_tensors: false
  fine_tune_checkpoint_type: "detection"
  use_bfloat16: false
  fine_tune_checkpoint_version: V2

但是，当使用 model_main_tf2.py 脚本开始训练时，第一个检查点(在第 0 步)的分数很糟糕 - 即使在运行评估的同一数据集上也是如此导出的模型。

我希望第一个检查点与导出模型的分数具有相同的分数(至少对于相同的测试集)。这是错误的假设吗？在那种情况下，为什么？

最佳答案

终于找到下面的here :

// Whether to load all checkpoint vars that match model variable names and
// sizes. This option is only available if `from_detection_checkpoint` is
// True.  This option is *not* supported for TF2 --- setting it to true
// will raise an error. **Instead, set fine_tune_checkpoint_type: 'full'.**
  optional bool load_all_detection_checkpoint_vars = 19 [default = false];

通过将 fine_tune_checkpoint_type 设置为“full”，我得到了第一个检查点的正确 map (在 0 步处)。

关于Tensorflow 对象检测 API : Train from exported model checkpoint，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/66673499/

25

4

0

文章推荐： Micronaut 重用测试容器

文章推荐： javascript - 使用 process.env 时 axios baseUrl 无法正常工作

python - Azure Eventhub (Python) : checkpointing with blob storage - keyerror issue in EventProcessor when checkpointing is enabled
我在 eventhub 中遇到了 Blob 存储检查点问题。如果我在获取消费者客户端时没有设置 checkpoint_store，我的应用程序运行正常。每当我尝试设置 checkpoint_store
hadoop - 检查点在 HDFS 中是如何工作的？我想弄清楚 fs.checkpoint.period 和 fs.checkpoint.size
当它说时，辅助名称节点检查点每小时(fs.checkpoint.period 以秒为单位)或如果编辑日志已达到 64 MB(fs.checkpoint.size 以字节为单位)则更早？究竟是什么意思？
postgresql - Postgres Checkpointer 进程始终运行
我正在运行 PostgreSQL 服务器并将 shared_buffers 限制为 4GB。当我在数据库中插入大量记录时，检查点进程开始消耗 RAM。即使在一天后，此过程既不会结束也不会减少 RAM
apache-spark - RDD.checkpoint() 不在检查点目录中存储任何数据
我已经用 sc.setCheckpointDir 设置了检查点目录方法。 /checkpointDirectory/ 然后我创建了一个 rdd 的检查点:rdd.checkpoint()在目录中，我现
tensorflow 错误: restore checkpoint file
我建立了自己的卷积神经网络，在其中跟踪所有可训练变量的移动平均值(tensorflow 1.0): variable_averages = tf.train.ExponentialMovingAver
postgresql - Postgres : Checkpoints Are Occurring Too Frequently
我们有一个强大的 Postgres 服务器(64 核，384 GB RAM，16 个 15k SAS 驱动器，RAID 10)，并且在一天中我们多次重建几个写入密集型的大型数据集。 Apache 和
python - tensorflow : how to get a list of checkpoints
我需要以编程方式获取不依赖于目录列表和文件扩展验证的现有检查点列表，如果您键入: tf.train.get_checkpoint_state('checkpoints') 您可以看到已打印此列表，但我
python - PyCharm:将变量存储在内存中以便能够从 "checkpoint"运行代码
我一直在到处寻找这个问题的答案，但无济于事。我希望能够运行我的代码并将变量存储在内存中，以便我可以设置一个“检查点”，我可以在将来运行它。原因是我有一个相当昂贵的函数，它需要一些时间来计算(以及用户输
python - 有没有一种简单的方法可以在扩展的 python 脚本中使用 "checkpoints"？
作为我的问题的序言，让我提供一些背景信息:我目前正在研究一个包含许多不同步骤的数据管道。每一步都可能出错，而且很多都需要一些时间(不是很多，但在几分钟的数量级)。因此，管道目前受到人工的严格监督。分
org.apache.flink.runtime.checkpoint.ZooKeeperCompletedCheckpointStore类的使用及代码示例
本文整理了Java中org.apache.flink.runtime.checkpoint.ZooKeeperCompletedCheckpointStore类的一些代码示例，展示了ZooKeeper
org.apache.flink.runtime.checkpoint.ZooKeeperCheckpointIDCounter类的使用及代码示例
本文整理了Java中org.apache.flink.runtime.checkpoint.ZooKeeperCheckpointIDCounter类的一些代码示例，展示了ZooKeeperCheck
org.apache.flink.runtime.checkpoint.ZooKeeperCheckpointRecoveryFactory类的使用及代码示例
本文整理了Java中org.apache.flink.runtime.checkpoint.ZooKeeperCheckpointRecoveryFactory类的一些代码示例，展示了ZooKeepe
apache-spark - CheckPointing 时在 foreachRDD() 中使用的对象的序列化
根据 this question和我读过的文档，Spark Streaming 的 foreachRDD(someFunction) 将让 someFunction 本身仅在驱动程序进程中执行，但如果
tensorflow - TF/Keras 错误 : InputLayer not a Checkpointable
我正在使用简单的猫与狗数据集在 Google Colab 上尝试新添加的 TPU 支持。在创建了一个简单的 CNN 之后，我尝试将模型导出到 TPU。但它因错误而失败 TypeError: Chec
tensorflow - 如何获取重新训练的 inception-v3 模型的 'checkpoint'？
我正在尝试在tensorflow-serving中使用重新训练的inception-v3模型。但看来我必须提供一个“检查点”。我想知道如何获得这些“检查点”？ retrain.py 返回一个 retr
python - 谷歌云机器学习引擎 "Skipping evaluation due to same checkpoint"
所以我有一个基于 census tutorial 的 ML 引擎包我尝试使用 --min-eval-Frequency 标志每 N 个步骤执行一次评估，但我不断在 stackdriver 日志中收到消
python - 如何使用 tf.train.Checkpoint 保存大量变量
我可以通过以下方式在检查点( https://www.tensorflow.org/beta/guide/checkpoints#manually_inspecting_checkpoints )中保
ios - 室内图集 : Get checkpoint list created
我刚刚在 IndoorAtlas 上进行了分析，并使用 ios SDK 尝试了示例应用程序。当我四处走动时，我在创建的平面图中更新了我的位置。我想知道当我到达我在楼层内创建检查点的位置时应该如何接收
python - 错误 :tensorflow:Couldn't match files for checkpoint
我正在训练一个 tensorflow 模型，在每个 epoch 之后我保存模型状态并 pickle 一些数组。到目前为止，我的模型做了 2 个时期，保存状态的文件夹包含以下文件: checkpoint
java - rdd.checkpoint 在 spark 作业中被跳过
您好，我正在尝试运行一个经常因 StackoverflowError 而失败的长 sparkjob。该作业读取一个 parquetfile 并在 foreach 循环中创建一个 rdd。在做了一些研究

首页

博学

6Ren·AI

商城

Tensorflow 对象检测 API : Train from exported model checkpoint

问题