python - 不同模型的训练精度不同，但测试精度相同-6ren

python - 不同模型的训练精度不同，但测试精度相同

转载作者：行者123 更新时间：2023-11-30 09:58:20

25

4

我正在努力开发一个深度学习分类器 - 2 个类。我正在使用的数据集不平衡。我做了下采样来解决同样的问题。然后，我创建两个类别的一小部分数据样本，并创建深度学习模型，如下所示:

dl_model = Sequential()

n_cols = X_train.shape[1]

dl_model.add(Dense(1024, activation='relu', input_shape=(n_cols,)))
dl_model.add(Dense(512, activation='relu'))
dl_model.add(Dense(256, activation='relu'))
dl_model.add(Dense(256, activation='relu'))
dl_model.add(Dense(128, activation='relu'))
dl_model.add(Dense(64, activation='relu'))
dl_model.add(Dense(2, activation='softmax'))

adam= optimizers.Adam(lr=0.001)

dl_model.compile(optimizer=adam, loss='sparse_categorical_crossentropy', metrics=['accuracy'])

early_stopping_monitor = EarlyStopping(patience=3)

dl_model.fit(X_train, y_train, epochs=10, validation_split=0.2, batch_size=1000,callbacks=[early_stopping_monitor], shuffle=True)

model_json = dl_model.to_json()
with open("model.json", "w") as json_file:
    json_file.write(model_json)

dl_model.save_weights("model.h5")

对于不同的超参数调整，我得到的结果如下:

模型 1 - train_loss:7.7971 - train_acc:0.5160 - val_loss:9.6992 - val_acc:0.3982

模型 2 - train_loss:2.8257 - train_acc:0.8201 - val_loss:2.9312 - val_acc:0.8160

模型 3 - train_loss:3.1887 - train_acc:0.8002 - val_loss:3.5195 - val_acc:0.7808

我保存每个模型，然后将其加载到不同的文件中，在该文件中我将模型应用于整个数据集并计算指标，如下所示:

sc = MinMaxScaler()
X = sc.fit_transform(X)

json_file = open('model.json', 'r')
loaded_model_json = json_file.read()
json_file.close()
loaded_model = model_from_json(loaded_model_json)
loaded_model.load_weights("model.h5")

loaded_model.compile(loss='sparse_categorical_crossentropy', optimizer='adam', metrics=['accuracy'])
score = loaded_model.evaluate(X, y, verbose=0)
print("Deep learning accuracy %s: %.2f%%" % (loaded_model.metrics_names[1], score[1]*100))

以上 3 个模型均具有相同的准确度。即使是相同的混淆矩阵。可能是什么原因？这 3 个模型是否应该给出不同的结果，因为它们具有不同的训练精度/指标？

更新:

加载任何模型时，我得到的准确度为 97.82% ，混淆矩阵如下:

[[143369      0]

 [  2958      0]]

最佳答案

这里的问题是，您训练过的所有神经网络都无法正确学习第二类，即代表性较差的一类。

您在测试集上的准确性是相同的，因为 model_1、model_2 或 model_3 都无法区分类别 1 和类别 2，因此它们三个都知道识别类别 1，但无法识别类别 1识别类别 2。换句话说，当您在测试集上进行测试时，无论您在训练期间看到的差异如何，结果都是相同的。

可以从您在那里显示的混淆矩阵轻松推断出这一观察结果。

假设您不知道上述观察结果。让我们做一些简单的数学计算:

143369 + 2958 = 146327。
(143369/146327) * 100 = 97.97%(这比您报告的准确度稍大一些，但在相同的范围内 - 微小的差异源于 keras< 中的 evaluate_score/)

您还可以从此推断出您有问题(不仅在视觉上看到您没有第 2 类的 TP(真阳性))。

现在让我们继续解决这个问题!

既然我们已经提到了这一观察结果，您必须执行以下操作来解决此问题(或结合其中一些问题):

首先，从较低的学习率开始(0.0001 是一个更好的起始选择)。

其次，请引用以下过程以获得良好的模型:

删除EarlyStopping(patience=3)。
根据与准确性不同的指标(例如 F1-Score)保存最佳模型
训练时降低learning_rate(ReduceLROnPlateau)。您可以使用以下回调，它比 EarlyStopping 更适合您的情况:https://keras.io/callbacks/#reducelronplateau
使用数据集丰富。解决不平衡数据集的最佳方法是使用过采样。您可以通过在少数类中添加更多示例来平衡类的支持，而不是对代表性良好的类进行欠采样，从而减少数据集的方差。

关于python - 不同模型的训练精度不同，但测试精度相同，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/60107950/

25

4

0

文章推荐： java - 是否可以在 Palm Z22 中运行 Java ME 应用程序？

文章推荐： javascript - 读取文件javascript时的正则表达式

文章推荐： javascript - 如何在 jQuery 的自动完成列表中添加固定项？

文章推荐： java - 为 Oracle JDBC 瘦客户端设置语言

java:找不到主类:测试/测试。程序将会退出
我获得了一些源代码示例，我想测试一些功能。不幸的是，我在执行程序时遇到问题: 11:41:31 [linqus@ottsrvafq1 example]$ javac -g test/test.jav
r - 为什么两个ggplot对象通过all.equal()测试，但未通过same()测试？
我想测试ggplot生成的两个图是否相同。一种选择是在绘图对象上使用all.equal，但我宁愿进行更艰巨的测试以确保它们相同，这似乎是identical()为我提供的东西。但是，当我测试使用相同d
java - 以编程方式失败的 Maven 测试 JUnit5 测试
我确实使用 JUnit5 执行我的 Maven 测试，其中所有测试类都有 @ExtendWith({ProcessExtension.class}) 注释。如果是这种情况，此扩展必须根据特殊逻辑使测试
Node.js 编程工作流程 - 测试、代码、测试
在开始使用 Node.js 开发有用的东西之前，您的流程是什么？您是否在 VowJS、Expresso 上创建测试？你使用 Selenium 测试吗？什么时候？我有兴趣获得一个很好的工作流程来开发我
java - Mockito 测试 - 测试 write() 方法导致 NullPointerException
这个问题已经有答案了: What is a NullPointerException, and how do I fix it? (12 个回答) 已关闭 3 年前。基于示例here ，我尝试为我的
laravel - 测试 Vue.js 组件 - Laravel 测试
我正在考虑测试一些 Vue.js 组件，作为 Laravel 应用程序的一部分。所以，我有一个在 Blade 模板中使用并生成 GET 的组件。在 mounted 期间请求生命周期钩子(Hook)。假
c++ - 测试 t=测试(); C++98 中会发生什么？
考虑以下程序: #include struct Test { int a; }; int main() { Test t=Test(); std::cout<
c# - 为什么我应该同时进行单元测试和 Web 测试(而不仅仅是 Web 测试)？
我目前的立场是:如果我使用 web 测试(在我的例子中可能是通过 VS.NET'08 测试工具和 WatiN)以及代码覆盖率和广泛的数据来彻底测试我的 ASP.NET 应用程序，我应该不需要编写单独的
c# - 在测试 1、测试 10、测试 2 中对包含数字的字符串进行排序的好方法
我正在使用 C#、.NET 4.7 我有 3 个字符串，即。 [test.1, test.10, test.2] 我需要对它们进行排序以获得: test.1 test.2 test.10 我可能会得到
Android espresso 测试 - 测试 recyclerview 项目内的 View 是否可见
我有一个 ID 为“rv_list”的 RecyclerView。单击任何 RecyclerView 项目时，每个项目内都有一个可见的 id 为“star”的 View 。我想用 expresso
node.js - 使用 Jest 测试 firebase 函数时的 Flakey 测试
我正在使用 Jest 和模拟器测试 Firebase 函数，尽管这些测试可能来自竞争条件。所谓 flakey，我的意思是有时它们会通过，有时不会，即使在同一台机器上也是如此。测试和函数是用 Type
javascript - AngularJS 测试 - 使用 $http 和 then() 测试 AngularUI 的提前输入
我在测试我与 typeahead.js ( https://github.com/angular-ui/bootstrap/blob/master/src/typeahead/typeahead.js
ios - 测试 iOS 应用程序时，Teamcity Step 测试(命令行)失败
我正在尝试使用 Teamcity 自动运行测试，但似乎当代理编译项目时，它没有正确完成，因为当我运行运行测试之类的命令时，我收到以下错误: fatal error: 'Pushwoosh/PushNo
api - 测试 rest 或 graphql API 时如何运行 cucumber 测试
这是我第一次玩 cucumber ，还创建了一个测试和 API 的套件。我的问题是在测试 API 时是否需要运行它？例如我脑子里有这个，启动 express 服务器作为后台任务然后当它启动时(我
android - 将所有 android 测试(单元/集成/UI 测试)放入单个测试项目中是最佳做法吗？
我有我的主要应用程序项目，然后是我的测试的第二个项目。将所有类型的测试存储在该测试项目中是一种好的做法，还是应该将一些测试驻留在主应用程序项目中？我应该在我的主项目中保留 POJO JUnit(测试
ruby-on-rails - 用户 has_many 测试，测试 has_many 成绩。如何计算成绩？
我正在努力弄清楚如何实现这个计数。模型是用户、测试、等级用户 has_many 测试，测试 has_many 成绩。每个等级都有一个计算分数(strong_pass、pass、fail、stron
android - 使用 MockWebServer 测试 OkHttp 并使用 Buffer body 测试 MockResponse
我正在尝试测试一些涉及 OkHttp3 的下载代码，但不幸失败了。目标:测试下载图像文件并验证其是否有效。平台:安卓。此代码可在生产环境中运行，但测试代码没有任何意义。产品代码 class Fil
xamarin.ios - UI 测试，无法运行 iOS ui 测试 - 无法确定 X 的模拟器版本
当我想为 iOS 运行 UI 测试时，我收到以下消息: SetUp : System.Exception : Unable to determine simulator version for X 堆
ios - 在 iOS 中使用 Firebase Remote Config 测试/验证 A/B 测试
我正在使用 Firebase Remote Config 在 iOS 上设置 A/B 测试。一切都已设置完毕，我正在 iOS 应用程序中读取服务器端默认值。但是在多个模拟器上尝试，它们都读取了默认
javascript - 如何用 Jest 测试 asnyc 代码(或用 jsdom 测试 "image.onload")
[已编辑]:我已经用 promise 方式更改了我的代码。我正在写 React with this starter 由 facebook 创建，我是测试方面的新手。现在我有一个关于图像的组件，它有

首页

博学

6Ren·AI

商城

python - 不同模型的训练精度不同，但测试精度相同