python - 如何解释 Tensorflow DNNRegressor Estimator 模型中的损失函数？-6ren

python - 如何解释 Tensorflow DNNRegressor Estimator 模型中的损失函数？

转载作者：太空狗更新时间：2023-10-30 01:26:24

25

4

我正在使用 Tensorflow DNNRegressor Estimator 模型制作神经网络。但是调用 estimator.train() 函数的输出如下:

即我的损失函数在每一步都变化很大。但据我所知，我的损失函数应该随着迭代次数的减少而减少。另外，找到附加的 Tensorboard 损失函数可视化屏幕截图:

我想不通的疑惑是:

是总体损失函数值(到目前为止处理的每个步骤的综合损失)还是该步骤的损失值？
如果是那一步的损失值，那么如何获得整体损失函数的值并查看其趋势，我觉得它应该随着迭代次数的增加而减少？据我所知，这是我们在训练数据集时应该考虑的值(value)。
如果这是整体损失值，那么为什么波动如此之大？我错过了什么吗？

最佳答案

首先，让我指出tf.contrib.learn.DNNRegressor使用具有 mean_squared_loss 的线性回归头，即简单的 L2 损失。

Whether it is overall loss function value (combined loss for every step processed till now) or just that step's loss value?

图表上的每个点都是到目前为止学习后最后一步的损失函数值。

If it is that step's loss value, then how to get value of overall loss function and see its trend, which I feel should decrease with increasing no of iterations?

没有整体损失函数，您可能指的是每一步后损失如何变化的图表。这正是 tensorboard 向您展示的内容。你是对的，它的趋势并没有像它应该的那样向下。这表明您的神经网络没有在学习。

If this is overall loss value, then why is it fluctuating so much? Am I missing something?

神经网络无法学习的一个常见原因是超参数选择不当(尽管 there are many more mistakes 您可能会选择)。例如:

学习率太大
也有可能是学习率太小，这意味着神经网络正在学习，但是非常非常慢，以至于你看不到它
权重初始化可能太大，尝试降低它
批量大小也可能太大
您为输入传递了错误的标签
训练数据包含缺失值，或未规范化
...

为了检查神经网络是否至少以某种方式工作，我通常会做的是将训练集减少到几个例子并尝试过度拟合网络。这个实验非常快，所以我可以尝试各种学习率、初始化方差和其他参数来找到最佳点。一旦我有了一个稳定下降的损失图表，我就会继续使用更大的一组。

关于python - 如何解释 Tensorflow DNNRegressor Estimator 模型中的损失函数？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/46538710/

25

4

0

文章推荐： c# - 使用 C# 查询 SQlite 数据库时出现 ConstraintException

文章推荐： c# - WPF事件捕获新添加的控件？

文章推荐： c# - 如何在 LoginView 控件中更改登录状态

SQL - NOT IN 解释
我在一个项目中工作，该项目需要 SQL 结果的最佳性能，并且希望优化查询，但经过反复试验后，我在 IN 方面遇到了一些问题。 -- THIS RETURNS NO RESULTS AT ALL. SE
SQL NOT IN 解释
在尝试创建一个实际上非常简单的 SQL 语句时，我发现自己迷失了方向。我有一个包含 3 个表的数据库: 食谱 - 存储一些用于 cooking 的食谱名称配料食谱 - 将配料与食谱链接成分 -
PHP函数hebrev()解释
我正在尝试理解 PHP 中的 Hebrev 函数。 https://php.net/manual/en/function.hebrevc.php 它说:“将逻辑希伯来语文本转换为视觉文本”。但我不明白
Java语法解释
嗨，我在 Grid view 的 android 文档中发现了一段代码对于以下代码。 gridview.setOnItemClickListener(new OnItemClickListener()
InfiniBand 解释
谁能解释一下 InfiniBand 是什么？与以太网相比的主要区别是什么，这些差异如何使其比以太网更快？在官方description从 mellanox 写到 Introduce InfiniBan
Java运算符，解释
这个问题已经有答案了: How are java increment statements evaluated in complex expressions (1 个回答) 已关闭 8 年前。我知道
MySQL :/*! */解释
我正在阅读 MySQL 教程，我遇到了这个: SELECT /*! SQL_NO_CACHE */ user FROM users; 为什么优化提示 SQL_NO_CACHE 包含在: /*!
javascript - 解释 $(this)
我无法理解$(this)，我做了一个剪刀石头布的版本，并应用了 jQuery 让用户在计算机上选择按钮选项。我希望有人能解释一下 $(this) 指的是什么，它是 btn-primary 吗？该函数在
C++ "while"解释
我不是很确定 while(choice == 1 || choice ==2);谁能解释一下。我明白这一点 if(choice ==1) displayMonthly(rainfall); e
iOS图层动画-解释
let flyRight = CABasicAnimation(keyPath: "position.x") flyRight.toValue = view.bounds.size.width/2 f
解释:int型默认值为0的问题
目录解释:int型默认值为0 但我们尝试发现并不能通过：原因： int的默认值为0，而Integer的默认值为null
sql - 合并和案例陈述 - 解释？
我正在处理一个查询，自从一个 SSRS 服务器传输到另一个服务器后，它似乎没有按预期执行，并且 where 语句的一部分中出现了以下行找出不同之处，或者至少从我能找到的地方来看。 where COA
email - 解释 VERP
我正在制作一个退回检测程序，读取退回邮件。我们的设置是发送电子邮件，在发送的邮件中添加一个 noreply@domain.tl。一些收件人不再存在，因此我们想要读取退回邮件，并检测它发送给谁。我已经崩
math - 解释 - 通过控制点曲线的公式
我有一个关于公式通过控制点弯曲的问题。如您所知，HTML Canvas 有 quadraticCurveTo(x1, y1, x2, y2)与 x1 and x2作为控制点。但是，当您尝试使用它绘
Erlang emakefile 解释
我有一个 Emakefile看起来像: %% -- %% %% -- {'/Users/user/projects/custom_test/trunk/*', [debug_info, {out
scala - 解释 - 不涉及反射
我有一个非常简单的问题。这不仅适用于 spray-json，而且我已经阅读了 argonaut 和 circe 的类似声明。所以请赐教。在 spray-json 中，我遇到了 There is no
ffmpeg scale2ref 解释？
我正在为视频添加水印。我试图让水印与视频尺寸成比例。我已经使用 scale2ref 看到了十几个不同的答案，但没有解释实际发生了什么，所以我发现很难知道如何实现/更改配置以适应我的情况。当前覆盖命令
Haskell长度+ map 解释？
因为我正在学习语言，所以我在玩 Haskell，我只是发现了一些我不理解的东西，我找不到解释。如果我尝试运行此代码: map (`div` 0) [1,2,3,4] 我得到一个除以 0 的异常，这是预
.net - 未将对象引用设置为对象的实例 - 解释？
我正在寻找解决错误对象引用未设置到对象实例的步骤/指南。以及问题发生原因的解释。我正在寻找更一般的解释，所以如果我收到错误，我应该采取什么步骤来查找问题。我经常看到有人提供特定代码段的帖子，而其他人
reactjs - `componentWillReceiveProps` 解释
我最近想升级我的知识React ，所以我从组件生命周期方法开始。让我好奇的第一件事是这个componentWillReceiveProps .所以，文档说当组件接收新的(不一定是更新的) Prop 时

首页

博学

6Ren·AI

商城

python - 如何解释 Tensorflow DNNRegressor Estimator 模型中的损失函数？