- c - 在位数组中找到第一个零
- linux - Unix 显示有关匹配两种模式之一的文件的信息
- 正则表达式替换多个文件
- linux - 隐藏来自 xtrace 的命令
我正在尝试使用 SVM 进行多标签分类。我有近 8k 个特征,也有长度接近 400 的 y 向量。我已经有二值化的 Y 向量,所以我没有使用 MultiLabelBinarizer()
但是当我将它与我的 Y 数据的原始形式一起使用时, 它仍然给出同样的东西。
我正在运行这段代码:
X = np.genfromtxt('data_X', delimiter=";")
Y = np.genfromtxt('data_y', delimiter=";")
training_X = X[:2600,:]
training_y = Y[:2600,:]
test_sample = X[2600:2601,:]
test_result = Y[2600:2601,:]
classif = OneVsRestClassifier(SVC(kernel='rbf'))
classif.fit(training_X, training_y)
print(classif.predict(test_sample))
print(test_result)
在预测部分的所有拟合过程之后,它说 Label not x is present in all training examples
(x 是我的 y 向量长度范围内的几个不同数字,即 400) .之后,它给出预测的 y 向量,它始终是长度为 400(y 向量长度)的零向量。我是 scikit-learn 和机器学习的新手。我无法弄清楚这里的问题。有什么问题,我应该怎么做才能解决它?谢谢。
最佳答案
这里有两个问题:
1) 标签缺失警告
2) 你得到的预测都是 0
警告表示训练数据中缺少您的某些类。这是一个常见问题。如果您有 400 个类,那么其中一些类一定很少出现,并且在数据的任何拆分中,拆分的一侧可能会丢失一些类。也可能有根本不会出现在您的数据中的类。您可以尝试 Y.sum(axis=0).all()
,如果它为 False,那么即使在 Y 中也不会出现某些类。这听起来很可怕,但实际上,您并没有无论如何,将能够正确预测出现 0 次、1 次或任何非常小次数的类别,因此为这些类别预测 0 可能是你能做的最好的事情。
至于全 0 预测,我要指出的是,对于 400 个类,您所有类的出现时间可能远少于一半。您可以检查 Y.mean(axis=0).max()
以获得最高的标签频率。有 400 个类,它可能只有百分之几。如果是这样,必须对每个类进行 0-1 预测的二元分类器可能会为所有实例的所有类选择 0。这并不是真正的错误,只是因为所有类别的频率都很低。
如果您知道每个实例都有一个正标签(至少一个),您可以获取决策值 (clf.decision_function
) 并为每个实例选择最高的类别。不过,您必须编写一些代码才能做到这一点。
我曾经在与此类似的 Kaggle 比赛中获得前 10 名。这是一个包含约 200 个类的多标签问题,没有一个以 10% 的频率出现,我们需要 0-1 的预测。在那种情况下,我得到了决策值并取了最高值,加上任何高于阈值的值。我选择了在保留集上效果最好的阈值。该条目的代码在 Github 上:Kaggle Greek Media code .你可以看看它。
如果您已经读到这里,感谢您的阅读。希望对您有所帮助。
关于python - Scikit-Learn:所有训练示例中都存在标签 not x,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/34561554/
这个问题在这里已经有了答案: 关闭 11 年前。 Possible Duplicate: Sample data for IPv6? 除了 wireshark 在其网站上提供的内容之外,是否有可以下
我正在寻找可以集成到现有应用程序中并使用多拖放功能的示例或任何现成的解决方案。我在互联网上找到的大多数解决方案在将多个项目从 ListBox 等控件拖放到另一个 ListBox 时效果不佳。谁能指出我
我是 GATE Embedded 的新手,我尝试了简单的示例并得到了 NoClassDefFoundError。首先我会解释我尝试了什么 在 D:\project\gate-7.0 中下载并提取 Ga
是否有像 Eclipse 中的 SWT 示例那样的多合一 JFace 控件示例?搜索(在 stackoverflow.com 上使用谷歌搜索和搜索)对我没有帮助。 如果它是一个独立的应用程序或 ecl
我找不到任何可以清楚地解释如何通过 .net API(特别是 c#)使用谷歌计算引擎的内容。有没有人可以指点我什么? 附言我知道 API 引用 ( https://developers.google.
最近在做公司的一个项目时,客户需要我们定时获取他们矩阵系统的数据。在与客户进行对接时,提到他们的接口使用的目前不常用的BASIC 认证。天呢,它好不安全,容易被不法人监听,咋还在使用呀。但是没办法呀,
最近在做公司的一个项目时,客户需要我们定时获取他们矩阵系统的数据。在与客户进行对接时,提到他们的接口使用的目前不常用的BASIC 认证。天呢,它好不安全,容易被不法人监听,咋还在使用呀。但是没办法呀,
我正在尝试为我的应用程序设计配置文件格式并选择了 YAML。但是,这(显然)意味着我需要能够定义、解析和验证正确的 YAML 语法! 在配置文件中,必须有一个名为 widgets 的集合/序列。 .这
你能给我一个使用 pysmb 库连接到一些 samba 服务器的例子吗?我读过有类 smb.SMBConnection.SMBConnection(用户名、密码、my_name、remote_name
linux服务器默认通过22端口用ssh协议登录,这种不安全。今天想做限制,即允许部分来源ip连接服务器。 案例目标:通过iptables规则限制对linux服务器的登录。 处理方法:编
我一直在寻找任何 PostProjectAnalysisTask 工作代码示例,但没有看。 This页面指出 HipChat plugin使用这个钩子(Hook),但在我看来它仍然使用遗留的 Po
我发现了 GWT 的 CustomScrollPanel 以及如何自定义滚动条,但我找不到任何示例或如何设置它。是否有任何示例显示正在使用的自定义滚动条? 最佳答案 这是自定义 native 滚动条的
我正在尝试开发一个 Backbone Marionette 应用程序,我需要知道如何以最佳方式执行 CRUD(创建、读取、更新和销毁)操作。我找不到任何解释这一点的资源(仅适用于 Backbone)。
关闭。这个问题需要details or clarity .它目前不接受答案。 想改进这个问题?通过 editing this post 添加详细信息并澄清问题. 去年关闭。 Improve this
我需要一个提交多个单独请求的 django 表单,如果没有大量定制,我找不到如何做到这一点的示例。即,假设有一个汽车维修店使用的表格。该表格将列出商店能够进行的所有可能的维修,并且用户将选择他们想要进
我有一个 Multi-Tenancy 应用程序。然而,这个相同的应用程序有 liquibase。我需要在我的所有数据源中运行 liquibase,但是我不能使用这个 Bean。 我的应用程序.yml
我了解有关单元测试的一般思想,并已在系统中发生复杂交互的场景中使用它,但我仍然对所有这些原则结合在一起有疑问。 我们被警告不要测试框架或数据库。好的 UI 设计不适合非人工测试。 MVC 框架不包括一
我正在使用 docjure并且它的 select-columns 函数需要一个列映射。我想获取所有列而无需手动指定。 如何将以下内容生成为惰性无限向量序列 [:A :B :C :D :E ... :A
$condition使用说明和 $param在 findByAttributes在 Yii 在大多数情况下,这就是我使用 findByAttributes 的方式 Person::model()->f
我在 Ubuntu 11.10 上安装了 qtcreator sudo apt-get install qtcreator 安装的版本有:QT Creator 2.2.1、QT 4.7.3 当我启动
我是一名优秀的程序员,十分优秀!