java - 神经网络反向传播无法正确计算权重-6ren

java - 神经网络反向传播无法正确计算权重

转载作者：塔克拉玛干更新时间：2023-11-02 07:52:54

25

4

目前，我在反向传播算法方面遇到了问题。我正在尝试实现它并使用它来识别面孔的方向(左、右、下、直)。基本上，我有 N 个图像，读取像素并将其值(0 到 255)更改为 0.0 到 1.0 之间的值。所有图像均为 32*30。我有一个包含 960 个神经元的输入层、一个包含 3 个神经元的隐藏层和一个包含 4 个神经元的输出层。例如，输出 <0.1,0.9,0.1,0.1> 表示此人向右看。我遵循了伪代码。但是，它无法正常工作——它无法计算正确的权重，因此无法处理训练和测试示例。以下是部分代码:

    // main function - it runs the algorithm
     private void runBackpropagationAlgorithm() {
        for (int i = 0; i < 900; ++i) {
            for (ImageUnit iu : images) {
                double [] error = calcOutputError(iu.getRatioMatrix(), iu.getClassification());
                changeHiddenUnitsOutWeights(error);
                error = calcHiddenError(error);
                changeHiddenUnitsInWeights(error,iu.getRatioMatrix());
            }
        }
    }

  // it creates the neural network
    private void createNeuroneNetwork() {
            Random generator = new Random();
            for (int i = 0; i < inHiddenUnitsWeights.length; ++i) {
                for (int j = 0; j < hiddenUnits; ++j) {
                    inHiddenUnitsWeights[i][j] = generator.nextDouble();
                }
            }
            for (int i = 0; i < hiddenUnits; ++i) {
                for (int j = 0; j < 4; ++j) {
                    outHddenUnitsWeights[i][j] = generator.nextDouble();
                }
            }
        }
   // Calculates the error in the network. It runs through the whole network.
private double [] calcOutputError(double[][] input, double [] expectedOutput) {
        int currentEdge = 0;
        Arrays.fill(hiddenUnitNodeValue, 0.0);
        for (int i = 0; i < input.length; ++i) {
            for (int j = 0; j < input[0].length; ++j) {
                for (int k = 0; k < hiddenUnits; ++k) {
                    hiddenUnitNodeValue[k] += input[i][j] * inHiddenUnitsWeights[currentEdge][k];
                }
                ++currentEdge;
            }
        }
        double[] out = new double[4];
        for (int j = 0; j < 4; ++j) {
            for (int i = 0; i < hiddenUnits; ++i) {
                out[j] += outHddenUnitsWeights[i][j] * hiddenUnitNodeValue[i];
            }
        }
        double [] error = new double [4];
        Arrays.fill(error, 4);
        for (int i = 0; i < 4; ++i) {
            error[i] = ((expectedOutput[i] - out[i])*(1.0-out[i])*out[i]);
            //System.out.println((expectedOutput[i] - out[i]) + " " + expectedOutput[i] + " " +  out[i]);
        }
        return error;
    }

// Changes the weights of the outgoing edges of the hidden neurons
private void changeHiddenUnitsOutWeights(double [] error) {
        for (int i = 0; i < hiddenUnits; ++i) {
            for (int j = 0; j < 4; ++j) {
                outHddenUnitsWeights[i][j] += learningRate*error[j]*hiddenUnitNodeValue[i];
            }
        }
    }

// goes back to the hidden units to calculate their error.
private double [] calcHiddenError(double [] outputError) {
        double [] error = new double[hiddenUnits];
        for (int i = 0; i < hiddenUnits; ++i) {
            double currentHiddenUnitErrorSum = 0.0;
            for (int j = 0; j < 4; ++j) {
                currentHiddenUnitErrorSum += outputError[j]*outHddenUnitsWeights[i][j];
            }
            error[i] = hiddenUnitNodeValue[i] * (1.0 - hiddenUnitNodeValue[i]) * currentHiddenUnitErrorSum;
        }
        return error;
    }

// changes the weights of the incomming edges to the hidden neurons. input is the matrix of ratios
private void changeHiddenUnitsInWeights(double [] error, double[][] input) {
        int currentEdge = 0;
        for (int i = 0; i < input.length; ++i) {
            for (int j = 0; j < input[0].length; ++j) {
                for (int k = 0; k < hiddenUnits; ++k) {
                    inHiddenUnitsWeights[currentEdge][k] += learningRate*error[k]*input[i][j];
                }
                ++currentEdge;
            }
        }
    }

随着算法的运行，它计算出越来越大的权重，最终接近无穷大(NaN 值)。我检查了代码。 las，我没有设法解决我的问题。我将非常感谢任何愿意帮助我的人。

最佳答案

我没有检查你的所有代码。我只想给你一些一般性的建议。我不知道您的目标是 (1) 学习人脸的方向还是 (2) 实现您自己的神经网络。

在情况 (1) 中，您应该考虑 those 之一图书馆。它们只是工作，并为您提供更灵活的配置选项。例如，标准反向传播是神经网络最差的优化算法之一。收敛取决于学习率。我看不到您在实现中选择了哪个值，但它可能太高了。还有其他优化算法不需要学习率或在训练期间对其进行调整。此外，隐藏层中的 3 个神经元很可能是不够的。大多数用于图像的神经网络都有成百上千个隐藏单元。我建议您首先尝试使用完全开发的库来解决您的问题。如果它确实有效，请尝试实现您自己的 ANN 或高兴。 :)

在情况 (2) 中，您应该首先尝试解决一个更简单的问题。取一个很简单的人工数据集，然后取一个standard benchmark然后用你的数据试试。验证反向传播实现是否有效的一个好方法是与 numerical differentation method 进行比较。 .

关于java - 神经网络反向传播无法正确计算权重，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/11991651/

25

4

0

文章推荐： java - Grails 应用程序中的 HttpSession

文章推荐： ios - UISegmentedControl iOS 13 清晰配色

文章推荐： ios - 如何删除 SwiftUI NavigationView 中的默认导航栏空间

文章推荐： java - 使用 pax-exam 在 native 容器中配置 pax-logging

java - @Transactional(传播=传播。需要)
如果有人能解释这个注释的作用以及我们何时使用它: @Transactional(propagation=Propagation.REQUIRED) 谢谢最佳答案如果您需要在 Spring Docs
Javascript - 阻止模态键盘事件冒泡/传播
我有一个页面，它有一个 keydown 事件监听器，用于监听 Escape 键，以便返回。我还有一个简单的模态类，它也监听 Escape 键以关闭它。主页监听器检查模式是否打开，如果打开，则不执行任何
Modelica 传播/默认变量名
我想在模型中设置默认变量名称 T (=xx) - 将该模型拖到新模型中并在其中定义变量 xx。我收到错误消息:使用未声明的变量 xx。这是子模型 model test parameter Rea
jqueryMobile 水龙头和冒泡/传播
在 android 2.x 浏览器中查看此示例..它是在我的应用程序中复制场景的示例.. http://johnchacko.net/samples/tap.html 它是关于监听“tap”并从监听器
C# 捕获特定异常类型的重新抛出/传播
如您所见，我正在尝试将 GatewayConnectionFailedException 传播到我的 UI。我希望此代码捕获除异常之外的所有内容，我希望表示层捕获该异常以通知用户数据库是问题所在，以便
CMake 静态库依赖项不随 ExternalProject_Add 传播
我目前正在尝试让可执行文件与它需要的所有依赖项正确链接。这是依赖项的示例结构: exe -> libA -> libB exe和 libA有自己的存储库。 exe拉入libA像这样的东西: add_
scala - Scala中的“传播”参数？
有什么方法可以调用带有单个参数的 Scala 函数，给定一个数组 (类似于 JavaScript Spreads在 ECMAScript 6) 中？ ys = [10.0, 2.72, -3.14]
Cmake:包含目录的 target_link_libraries 传播
我有一个小型静态库，它需要 boost 头文件，并且需要包含目录中的“include”目录。 ... add_library(alib STATIC ...) target_include_direc
javascript - 传播 Promise 并在新对象中扩展
我有一些 promise 可以返回对象。现在我想将它们合并/扩展为一个新对象，因此我使用 Lodash's extend . var whenEverythingIsDone = Promise.a
scala - 传播 Scala 类型参数
这是我认为人们通常希望在 Scala 中做的事情，但如果我能在任何地方找到一个例子，我就该死了。这段代码由于类型删除而无法编译，但它演示了我正在努力完成的事情: def parse[T](json:
scala - 传播 Scala 类型参数
这是我认为人们通常希望在 Scala 中做的事情，但如果我能在任何地方找到一个例子，我就该死了。这段代码由于类型删除而无法编译，但它演示了我正在努力完成的事情: def parse[T](json:
Sharepoint default.master 传播？
我们有大量 MOSS 2007 站点需要添加大量的 javascript。我编辑、 checkin 、发布并批准了对 default.master 的更改，更改反射(reflect)在根网站上，但没有
jQuery:函数被调用两次。传播？为什么会出现这种情况？
请看一下下面的 fiddle :http://jsfiddle.net/K9NjY/ 我在这段代码上花了 3-4 个小时，并将其缩小到最短的版本，但现在我陷入了困境。问题:1. 点击“divOne”
java - Spring 集成中的错误处理/传播
我读到如果在流程中抛出异常，框架要做的第一件事就是检查消息头中的错误 channel 属性。总是这样吗？在我的特殊情况下，我将自定义错误 channel 分配给消息 header ，但该消息似乎已向
c++ - 不能通过carry让值(value)传播
创建一个小的 C++ 大型精度类，一切似乎都运行良好，但是添加，如果我将 0xffffffff 和 0x04 加在一起，我会得到 0xffff0003，而我应该得到 0x0100000003。这是有问
javascript - react : problems with . ..传播
我正在尝试重新创建 Dan Abramov 类(class)中的 Redux 示例。传播{...store.getState()}在应用程序级别不起作用，Redux 正在更改状态并且 React 不会
mysql - 传播.REQUIRES_NEW 锁定
考虑一个需要很长时间的事务。在此期间，我想对 TableSmall 执行一些小更新。，它应该立即执行，并且主事务的回滚不应该回滚那些小的更新。我当前的问题是这些小更新将锁定 TableSmall\
c - 如何处理子函数中的 const 传播
我需要对现有函数进行修改，具有一些 const 输入参数: int f(const owntype *r1, const owntype *r2) 为了做到这一点，我想调用一个使用相同类型但没有 co
c# - 传播 DependencyProperty 默认值
我有一个带有 ViewModel 的 WPF UserControl: 这个 UserControl 有一个 De
android - 停止 SMS 传播
我试图在收到这样的短信时不传播 public class SMSReceiver extends BroadcastReceiver { @Override public void onRec

首页

博学

6Ren·AI

商城

java - 神经网络反向传播无法正确计算权重