python - 使用深度学习处理文本分类中的嘈杂训练标签

转载作者：行者123 更新时间：2023-11-28 17:24:18

41

4

我有一个由句子和相应的多标签组成的数据集(例如，一个句子可以属于多个标签)。在语言模型 (Word2Vec) 上结合使用卷积神经网络和循环神经网络，我能够获得很好的准确性。然而，它/太/擅长对输出建模，因为很多标签可以说是错误的，因此输出也是错误的。这意味着评估(即使有正则化和辍学)给人一种错误的印象，因为我没有基本事实。清理标签的成本高得令人望而却步。所以我只能以某种方式探索标签的“去噪”。我看过类似 "Learning from Massive Noisy Labeled Data for Image Classification" 的东西，但是他们假设要在输出上学习某种噪声协方差矩阵，我不确定如何在 Keras 中做到这一点。

有没有人以前处理过多标签文本分类设置中的噪声标签问题(最好使用 Keras 或类似工具)并且对如何学习带有噪声标签的稳健模型有好的想法？

最佳答案

cleanlab Python 包，pip install cleanlab，我是其作者，旨在解决此任务:https://github.com/cleanlab/cleanlab/ .这是一个专业的软件包，用于查找数据集中的标签错误和使用嘈杂的标签进行学习。它适用于开箱即用的任何 scikit-learn 模型，并且可以与 PyTorch、FastText、Tensorflow 等一起使用。

(2022 年 9 月更新)我已经为这个任务添加了资源(带有嘈杂标签的文本分类(标签有时会翻转到其他类):

博客:https://cleanlab.ai/blog/label-errors-text-datasets/|
可运行的 Colab 笔记本:https://docs.cleanlab.ai/stable/tutorials/text.html

示例 -- 查找数据集中的标签错误。

from cleanlab.classification import CleanLearning
from cleanlab.filter import find_label_issues
from cleanlab.count import estimate_cv_predicted_probabilities

# OPTION 1 - 1 line of code for sklearn compatible models
issues = CleanLearning(sklearnModel, seed=SEED).find_label_issues(data, labels)

# OPTION 2 - 2 lines of code to use ANY model
#   just pass in out-of-sample predicted probabilities
pred_probs = estimate_cv_predicted_probabilities(data, labels)
ordered_label_issues = find_label_issues(
    labels=labels,
    pred_probs=pred_probs,
    return_indices_ranked_by='self_confidence',
)

有关如何使用任何模型计算样本外预测概率的详细信息 here .

示例——使用噪声标签学习

在噪声标签上训练 ML 模型，就像在完美标签上训练一样。

# Code taken from https://github.com/cleanlab/cleanlab
from sklearn.linear_model import LogisticRegression

# Learning with noisy labels in 3 lines of code.
cl = CleanLearning(clf=LogisticRegression())  # any sklearn-compatible classifier
cl.fit(X=train_data, labels=labels)
# Estimate the predictions you would have gotten training with error-free labels.
predictions = cl.predict(test_data)

鉴于您可能还从事图像分类和音频分类工作，这里是 Image Classification with PyTorch 的工作示例和 Audio Classification with SpeechBrain .

可在此处获得其他文档:docs.cleanlab.ai

关于python - 使用深度学习处理文本分类中的嘈杂训练标签，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/40009134/

41

4

0

文章推荐： css - 当元素大于其 flexbox 容器时不显示滚动条

文章推荐： javascript - Apexchart 工具提示

文章推荐： html - 将按钮放入 Canvas 中

文章推荐： python - 如何捕获 503 错误并重试请求

c# - 学习 C# 有助于或阻碍 VB.NET 学习
关闭。这个问题是opinion-based .它目前不接受答案。想要改进这个问题？更新问题，以便 editing this post 可以用事实和引用来回答它. 关闭 9 年前。 Improve
学习.NET8MiniApis入门
介绍篇什么是MiniApis？ MiniApis的特点和优势 MiniApis的应用场景环境搭建系统要求安装MiniApis 配置开发环境基础概念 MiniApis架构概述
Javascript(学习)
我正在从“JavaScript 圣经”一书中学习 javascript，但我遇到了一些困难。我试图理解这段代码: function checkIt(evt) { evt = (evt) ? e
String.intern() 学习
package com.fastone.www.javademo.stringintern; /** * * String.intern()是一个Native方法， * 它的作用是：如果字
macos - 学习 AppleScript
您会推荐哪些资源来学习 AppleScript。我使用具有 Objective-C 背景的传统 C/C++。我也在寻找有关如何更好地开发和从脚本编辑器获取更快文档的技巧。示例提示是“查找要编写脚本的
java - 学习 OpenCMS
关闭。这个问题不满足Stack Overflow guidelines .它目前不接受答案。想改善这个问题吗？更新问题，使其成为 on-topic对于堆栈溢出。 4年前关闭。 Improve thi
extjs - 学习 ExtJS4
关闭。这个问题不满足Stack Overflow guidelines .它目前不接受答案。想改善这个问题吗？更新问题，使其成为 on-topic对于堆栈溢出。 7年前关闭。 Improve thi
f# - 学习 F#
关闭。这个问题不符合 Stack Overflow guidelines 。它目前不接受答案。想改善这个问题吗？更新问题，以便堆栈溢出为 on-topic。 6年前关闭。 Improve this
flutter - 学习 flutter
我是塞内加尔的阿里。我今年60岁(也许这是我真正的问题-笑脸!!!)。我正在学习Flutter和Dart。今天，我想使用给定数据模型的列表(它的名称是Mortalite，请参见下面的代码)。我尝试
powershell - 学习……真的什么都行
关闭。这个问题是off-topic .它目前不接受答案。想改进这个问题？ Update the question所以它是on-topic对于堆栈溢出。 9年前关闭。 Improve this que
cappuccino - 学习 Cappuccino
学习 Cappuccino 的最佳来源是什么？我从事“传统”网络开发，但我对这个新框架非常感兴趣。请注意，我对 Objective-C 毫无了解。最佳答案如上所述，该网站是一个好地方，但还有一些其
java - 学习 HashMap
我正在学习如何使用 hashMap，有人可以检查我编写的这段代码并告诉我它是否正确吗？这个想法是有一个在公司工作的员工列表，我想从 hashMap 添加和删除员工。 public class Staf
jQuery CoffeeScript - 学习
我正在尝试将 jQuery 与 CoffeScript 一起使用。我按照博客中的说明操作，指示使用 $ -> 或 jQuery -> 而不是 .ready() 。我玩了一下代码，但我似乎无法理解我出错
javascript - PHP传递参数给新的字符串(学习)
还在学习，还有很多问题，所以这里有一些。我正在进行 javascript -> PHP 转换，并希望确保这些做法是正确的。是$dailyparams->$calories = $calories;一条
MySQL 使用临时表(学习)
我目前正在学习 SQL，以便从我们的 Magento 数据库制作一个简单的 RFM 报告，我目前可以通过导出两个查询并将它们粘贴到 Excel 模板中来完成此操作，我想摆脱 Excel 模板。我认为
Javascript > PHP (学习)
我知道我很可能会因为这个问题而受到抨击，但没有人问，我求助于你。这是否是一个正确的 javascript > php 转换 - 在我开始不良做法之前，我想知道这是否是解决此问题的正确方法。 JavaS
ruby - 学习/平铺的资源
除了 Ruby-Doc 之外，哪些来源最适合获取一些示例和教程，尤其是关于 Ruby 中的 Tk/Tile？我发现自己更正常了 http://www.tutorialspoint.com/ruby/r
Python 学习。为什么我只在第一次收到警告？
我只在第一次收到警告。这正常吗？ >>> cv=LassoCV(cv=10).fit(x,y) C:\Python27\lib\site-packages\scikit_learn-0.14.1-py
java - 学习/复习Java
按照目前的情况，这个问题不适合我们的问答形式。我们希望答案得到事实、引用或专业知识的支持，但这个问题可能会引发辩论、争论、投票或扩展讨论。如果您觉得这个问题可以改进并可能重新打开，visit the
c# - 学习.NET
As it currently stands, this question is not a good fit for our Q&A format. We expect answers to be

首页

博学

6Ren·AI

商城

python - 使用深度学习处理文本分类中的嘈杂训练标签

示例 -- 查找数据集中的标签错误。

示例——使用噪声标签学习

在噪声标签上训练 ML 模型，就像在完美标签上训练一样。