python - NumPy 的 : calculate the derivative of the softmax function-6ren

python - NumPy 的 : calculate the derivative of the softmax function

转载作者：太空狗更新时间：2023-10-29 19:31:45

25

4

我正在尝试通过 MNIST 理解简单的 3 层神经网络中的反向传播。

输入层有weights 和bias。标签是 MNIST，因此它是一个 10 类向量。

第二层是一个线性变换。第三层是 softmax 激活函数，以获取概率输出。

反向传播 计算每一步的导数，并将其称为梯度。

Previous layers 将 global 或 previous 渐变附加到 local gradient。我在计算 softmax

的 local gradient 时遇到问题

一些在线资源解释了 softmax 及其导数，甚至给出了 softmax 本身的代码示例

def softmax(x):
    """Compute the softmax of vector x."""
    exps = np.exp(x)
    return exps / np.sum(exps)

关于何时 i = j 和何时 i != j 解释导数。这是我想出的一个简单的代码片段，希望能验证我的理解:

def softmax(self, x):
    """Compute the softmax of vector x."""
    exps = np.exp(x)
    return exps / np.sum(exps)

def forward(self):
    # self.input is a vector of length 10
    # and is the output of 
    # (w * x) + b
    self.value = self.softmax(self.input)

def backward(self):
    for i in range(len(self.value)):
        for j in range(len(self.input)):
            if i == j:
                self.gradient[i] = self.value[i] * (1-self.input[i))
            else: 
                 self.gradient[i] = -self.value[i]*self.input[j]

那么self.gradient就是局部梯度，它是一个向量。这个对吗？有没有更好的写法？

最佳答案

我假设您有一个带有 W1 的 3 层 NN，b1 与从输入层到隐藏层的线性变换以及 W2, b2 与从隐藏层到输出层的线性变换相关联。 Z1 和Z2 是隐藏层和输出层的输入向量。 a1和a2代表隐藏层和输出层的输出。 a2 是您的预测输出。 delta3 和 delta2 是误差(反向传播)，您可以看到损失函数相对于模型参数的梯度。

这是 3 层 NN(输入层，只有一个隐藏层和一个输出层)的一般场景。您可以按照上述过程计算梯度，这应该很容易计算!由于这篇文章的另一个答案已经指出了您代码中的问题，因此我不再重复。

关于python - NumPy 的 : calculate the derivative of the softmax function，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/40575841/

25

4

0

文章推荐： angular - 动态渲染组件

文章推荐： python - "from flask import request"与 "import requests"相同吗？

文章推荐： Angular 6 : downloading file issue

softmax - Softmax 交叉熵是否适用于多标签分类？
如前所述 here ，交叉熵不是多标签分类的合适损失函数。我的问题是“这个事实是否也适用于 softmax 的交叉熵？”。如果是，如何与this part匹配的文件。我应该提到我的问题的范围在cnt
machine-learning - softmax 和 log-softmax 有什么区别？
这两个函数之间的区别已在这篇 pytorch 帖子中描述:What is the difference between log_softmax and softmax? 是:exp(x_i) / ex
python - Tensorflow tf.nn.softmax() 函数比手写的 softmax 性能好很多
我正在使用 tensorflow 编写一个简单的逻辑回归。我发现当使用 tf.nn.softmax 时，算法收敛得更快，最终精度更高。如果切换到我自己的 softmax 实现，网络收敛速度较慢，最终精
python - 使用 softmax 作为 tf.keras 中的连续层和使用 softmax 作为密集层的激活函数有什么区别？
使用 softmax 作为 tf.keras 中的连续层和使用 softmax 作为密集层的激活函数有什么区别？ tf.keras.layers.Dense(10, activation=tf.nn.
machine-learning - keras.activations.softmax 和 keras.layers.Softmax 之间有什么区别？
keras.activations.softmax 和 keras.layers.Softmax 之间有什么区别？为什么同一个激活函数有两种定义？ keras.activations.softmax:
使用 Softmax 进行二元分类
我正在使用带有二进制交叉熵的 Sigmoid 激活函数训练一个二进制分类器，它提供了大约 98% 的良好准确度。当我使用带有 categorical_crossentropy 的 softmax 进
tensorflow - 全卷积网络的每像素 softmax
我正在尝试实现类似完全卷积网络的东西，其中最后一个卷积层使用过滤器大小 1x1 并输出“分数”张量。分数张量的形状为 [Batch, height, width, num_classes]。我的问题
java - Softmax 激活实现
我目前正在用 Java 实现我自己的神经网络。我已经实现了一些常见的激活函数，例如 Sigmoid 或 ReLU，但我不知道如何实现 Softmax。我想要一个像这样的方法 private doub
java - Softmax 激活实现
我目前正在用 Java 实现我自己的神经网络。我已经实现了一些常见的激活函数，例如 Sigmoid 或 ReLU，但我不知道如何实现 Softmax。我想要一个像这样的方法 private doub
python - 将正态分布转换为 softmax
我在 github 上找到了一个很好的强化学习示例，我想使用它。我的问题是输出是正态分布层(下面的代码)，因为它用于连续 Action 空间，而我想将它用于离散 Action 空间，其中模型有 4 个
tensorflow - softmax 回归中的权重是一维还是二维？
我已经学习了 ML，并且一直在 Andrew N.G 的 coursera 类(class)中学习 DL，每次他谈到线性分类器时，权重都只是一个一维向量。即使在分配期间，当我们将图像滚动到一维向量(像
r - softmax 输出的神经网络无法收敛
我一直在研究斯坦福的深度学习教程，但我在其中一个练习(带有 softmax 输出层的神经网络)上遇到了问题。这是我在 R 中的实现: train <- function(training.set, l
matlab - Softmax 回归的向量化实现
我正在 Octave 中实现 softmax 回归。目前，我正在使用使用以下成本函数和导数的非矢量化实现。来源:Softmax Regression 现在我想在 Octave 中实现它的矢量化版本。
python - softmax python计算
我是机器学习的新手，正在学习如何在 python 中实现 softmax，我正在关注以下线程 Softmax function - python 我在做一些分析，如果我们有一个数组 batch = n
python - 大量错误的 Softmax
下面是我尝试计算 softmax 的一小段代码。它适用于单个阵列。但是对于更大的数字，比如 1000 等，它会爆炸 import numpy as np def softmax(x): print
keras - 如果可以激活多个输出，softmax 层的替代品是什么？
例如，我有一个 CNN，它试图从 MNIST 数据集(使用 Keras 编写的代码)中预测数字。它有 10 个输出，形成 softmax 层。只有一个输出可以为真(独立于 0 到 9 的每个数字):
pytorch - 我应该在交叉熵之前应用 softmax 吗？
pytorch教程 ( https://pytorch.org/tutorials/beginner/blitz/cifar10_tutorial.html#sphx-glr-beginner-bli
python - 理解 softmax 输出层的目标数据
我找到了一些 MNIST 手写字符分类问题的示例代码。代码开头如下: import tensorflow as tf # Load in the data mnist = tf.keras.datas
python - Keras softmax 输出和准确率
这是 Keras 模型的最后一层。 model.add(Dense(3, activation='softmax')) model.compile(loss='categorical_crossent
math - 为什么使用 softmax 而不是标准标准化？
在神经网络的输出层中，通常使用softmax函数来近似概率分布: 由于指数的原因，计算成本很高。为什么不简单地执行 Z 变换，使所有输出均为正，然后通过将所有输出除以所有输出之和来进行归一化？最佳答

首页

博学

6Ren·AI

商城

python - NumPy 的 : calculate the derivative of the softmax function