python - 当我有高度不平衡的数据时，我应该平衡测试集吗？-6ren

python - 当我有高度不平衡的数据时，我应该平衡测试集吗？

转载作者：行者123 更新时间：2023-11-30 08:57:07

26

4

我正在使用 Sklearn GridSearchCv 来查找随机森林在应用于 4 个类别(建筑物、植被、水和道路)的遥感数据时的最佳参数，问题是我有很多比其他类别更多的“植被”类别(我所说的“很多”是指从数千到数百万的差异)。我应该平衡我的测试数据集以获得指标吗？

在分成训练和测试之前，我已经平衡了整个数据集，这意味着两个数据集以相同的方式具有相同的类分布。恐怕这并不代表算法在真实数据上的性能，但它让我了解了每个类的性能。如果我使用不平衡的数据，“植被”类别可能最终会与其他平均值混淆。

这是我所做的平衡示例，您可以看到我直接在 X 和 y 上进行平衡。这是完整的数据和标签。

if balance:
    smt = RandomUnderSampler(sampling_strategy='auto')
    X, y = smt.fit_sample(X, y)
    print("Features array shape after balance: " + str(X.shape))

我想最好地了解模型在真实数据上的表现，但我还没有找到确凿的答案!

最佳答案

处理不平衡数据的经验法则是“永远不要平衡测试数据”。处理不平衡数据的流程:

进行预处理
应用训练测试拆分(分层)。
平衡训练数据(通常 SMOTE 效果更好)
火车模型
对不平衡测试数据进行测试(显然使用 f-score 、 Precision, Recall 等指标)

以便您获得实际性能。

这里出现的问题是为什么不在训练测试分割之前平衡数据？

当您在现实世界中部署时，您不能期望现实世界的数据是平衡的......

更好的方法是在步骤 2 中使用 K 折叠，并为每个折叠执行 3,4,5 步骤

引用this文章了解更多信息。

关于python - 当我有高度不平衡的数据时，我应该平衡测试集吗？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/55921286/

26

4

0

文章推荐： java - Galaxy S4 Android 自定义相机问题

文章推荐： python - 数据科学，鸢尾花数据集，目标属性，csv文件

文章推荐： python - 与 CNN 交叉验证

algorithm - 二叉树属性 - 平衡
我正在尝试了解二叉树的属性。但我不确定一件事: 定义。二叉树的声明: 如果对于每个节点，它认为左子树中的内部节点数和右子树中的内部节点数最多相差 1，则二叉树是平衡的。如果任意两个叶子的差异都存在，
mongodb - mongoDB 平衡
我有一个带有分片键和索引的集合。但是当我运行平衡时，不会为这个集合移动 block ，因为其他集合 block 正在按预期移动到其他机器。此集合中仅移动了一个 block 。最佳答案目前(这将在不
r - 平衡(为每个人创建相同数量的行)数据
给定一个data.table如下，id1是一个subject-level ID，id2是一个within-subject repeated-measure ID，X 是数据变量，其中有很多。我想平衡数
c++ - 平衡 C++ 集
由于 C++ 集合是在二叉树中实现的，如果我们以递增或递减顺序插入项目，那么集合将更像是一个列表而不是树。有没有什么方法可以在插入项目后平衡树？最佳答案 C++ 集(即 std::set)通常实现为
javascript - 移动网站上的变色(平衡)背景图片
我是一名初学者程序员，设计了一个智能手机网站，我有一个主体背景图像，我想慢慢改变颜色平衡，交替颜色，就像有人将 Photoshop 颜色平衡控制条调整一定百分比一样。任一方向。当您查看页面时，这种情况
Java - 平衡 ThreadPoolExecutor 公平地为并行请求提供线程
我开发了一段多线程代码。该代码在 Web 应用程序中调用，因此可能由多个线程(请求)并行调用。为了控制此代码将要创建的线程数量(通过多个并行请求调用)，我使用静态共享 ThreadPoolExecut
c - 平衡 Linux 内核中的内存使用
我正在为 Linux 内核开发一些网络驱动程序。我有几个 if-else 条件，我正在重新分配或释放“skb”结构——这是我有点困惑的地方。关于我在那些 if-else 中做什么 - 我遇到了 2 种
algorithm - 平衡 BST 的最佳和最差搜索性能是什么？
平衡 BST 的最佳和最差搜索性能是什么？每种情况发生时如何用一句话解释？最佳答案最佳情况:当搜索到的元素位于树的根部时。你得到 O(1)。最坏情况:当搜索元素在最长分支的叶子处时，树是单边的。
algorithm - 平衡 AVL 树
我在平衡 AVL 树问题上遇到了麻烦，因为我的解决方案似乎与教科书后面的解决方案冲突。我查看了 AVL 树的在线可视化，他们认为我的是正确的。我的课本错了吗？这是树: 然后我必须将 65 插入到这个
algorithm - 平衡 Controller 输入和输出的技术
我有一个系统，我在其中使用 RS232 来控制一个灯，该灯接受以浮点形式给出的表示电压(在 2.5 - 7.5 范围内)的输入。然后控件会给出 0 到 6000 范围内的输出，这是传感器拾取的亮度。
hadoop - 如何拆分输入集以获得更好的 Hadoop 平衡？
我有一个分层目录，每个目录中有很多文件，每个文本文件中有很多 URL 字符串。我想下载 Hadoop 中所有文件中的所有 URL，以实现更好的平衡。例如，如果我有 1+5 个节点的 Hadoop 集
ios - 平衡 box2d 对象
请查看附件图片，这是一种跷跷板。但从图像来看，黑体具有相同的密度。并且水平矩形使用“Revolute”关节与三角形相连。但仍然没有任何建议。在目前的情况下，它需要平衡。最佳答案由于浮点精度等限制导
c++ - 平衡 KD 树
因此，在平衡 KD 树时，您应该找到中位数，然后将所有较小的元素放在左子树上，将较大的元素放在右子树上。但是，如果您有多个元素与中位数具有相同的值，会发生什么情况？他们进入左子树，右子树还是丢弃它们？
python - 平衡 numpy 数组与过采样
请帮我找到一种干净的方法来从现有数组中创建一个新数组。如果任何类的示例数小于该类中的最大示例数，则应该进行过采样。样本应该从原始数组中提取(随机或顺序都没有区别) 比方说，初始数组是这样的: [ 2
performance - 平衡 Redis 查询和进程内内存？
我是一名软件开发人员，但想成为服务器可扩展性领域的新架构师。在多个服务使用同一数据集的情况下，旨在扩展冗余和负载平衡。问题是:在一个理想主义的系统中，服务是否应该尝试优化它们的内部处理以减少对远程
apache-kafka - 平衡 Kafka 消费者
假设我有 10 个分区用于 Kafka 中的给定主题。我的选择是在消费者之间自动平衡这 10 个分区的负载？我已经阅读了这篇文章 https://stackoverflow.com/a/28580
b-tree - 平衡 B 树如何平衡
假设我有一个 B 树，其节点为 3-4 配置(3 个元素和 4 个指针)。假设我按照规则合法地建立我的树，我是否有可能达到一层中有两个节点并且一个节点有 4 个退出指针而另一个节点只有两个退出指针的情
emacs - 用emacs，如何去配对(平衡)括号
当光标在一个括号上时，如何跳转到配对括号。很高兴在工作emacs -nw . 就像 % 在 Vim 中。 ;;从@Lindy、@Francesco 得到提示后，我发现了更多: C-M-f
data-structures - 平衡 AVL 树
我在平衡 AVL 树时遇到问题。我一直在寻找如何平衡它们的步骤，但我找不到任何有用的东西。我知道有4种: 单左旋单右旋双左右旋转双左右旋转但我就是无法得到如何选择其中之一和在哪个节点上应用
css - 平衡 block 元素，例如打印中的文本行
我想获得类似于打印中平衡文本行但用于 block 元素的结果。假设在一个 300/100 像素的容器中有一组 50/50 像素的盒子。在容器中 float 盒子将使它们填满一“行”，然后像这样包裹到下

首页

博学

6Ren·AI

商城

python - 当我有高度不平衡的数据时，我应该平衡测试集吗？