python - Scikit Learn - 交叉验证后对数据集进行评分-6ren

python - Scikit Learn - 交叉验证后对数据集进行评分

转载作者：行者123 更新时间：2023-11-30 09:09:59

25

4

我正在学习使用 scikit-learn 进行交叉验证 ( http://scikit-learn.org/stable/modules/cross_validation.html )

我的代码:

from sklearn.cross_validation import train_test_split
from sklearn.cross_validation import cross_val_score
from sklearn import datasets
from sklearn import svm

iris = datasets.load_iris()

# prepare sets
x_train, x_test, y_train, y_test = train_test_split(iris.data, iris.target, test_size=0.2, random_state=0)

# create model
clf1 = svm.SVC(kernel='linear', C=1)

# train model
scores = cross_val_score(clf1, x_train, y_train, cv=5)

# accuracy on train data
print("Accuracy: %0.2f (+/- %0.2f)" % (scores.mean(), scores.std() * 2))

# accuracy on yet-unseen data
print clf1.score(x_test, y_test)

我知道，通过交叉验证，我们可以使用整个数据集来训练和验证，如 scikit 文档中的示例所示。如果我想在交叉验证后对数据进行评分怎么办？我假设我的模型是在通过交叉验证学习后进行训练的。使用时score()我明白

raise NotFittedError(msg % {'name': type(estimator).__name__})
sklearn.utils.validation.NotFittedError: This SVC instance is not fitted yet. Call 'fit' with appropriate arguments before using this method.

在文档中有方法段落 3.1.1.1，其中 cross_val_predict提到了，我可以使用它，但为什么我需要 cv 参数(即折叠数)，而我只想检查训练模型的准确性？

如果有任何提示，我将不胜感激。

最佳答案

这是一个完成工作的代码，并逐步解释了它的工作原理。

首先，让我们导入必要的模块:

In [204]: from sklearn.model_selection import cross_val_score, StratifiedKFold

In [205]: from sklearn import datasets

In [206]: from sklearn import svm

您应该确保已安装scikit-learn 0.18，否则以下代码可能无法运行。请注意，我使用的是 sklearn.model_selection 而不是 sklearn.cross_validation，因为后者在 0.18 版本中已弃用。

然后我们加载 iris 数据集并分别使用特征和标签创建数组 X 和 y

In [207]: iris = datasets.load_iris()

In [208]: X, y = iris.data, iris.target

在下一步中，我们创建 C-Support Vector Classification 类的实例:

In [209]: clf = svm.SVC(kernel='linear', C=1)

现在我们创建一个分层的K-Folds验证器，它将数据集分成5个不相交的子集，即A、B、C、D和E。这五个折叠是分层的，这意味着A中每个类的样本比例、B、C、D、E 与整个数据集中相同。

In [210]: skf = StratifiedKFold(n_splits=5, random_state=0)

最后，我们通过 5 次分类试验来估计泛化精度:

In [211]: scores = cross_val_score(clf, X, y, cv=skf)

In [212]: scores
Out[212]: array([ 0.9667,  1.    ,  0.9667,  0.9667,  1.    ])

In [213]: scores.mean()
Out[213]: 0.98000000000000009

5折交叉验证可总结如下:

Classification No.   Training Samples   Test Samples   Accuracy
1                    A + B + C + D      E              0.9667
2                    A + B + C + E      D              1.
3                    A + B + D + E      C              0.9667
4                    A + C + D + E      B              0.9667
5                    B + C + D + E      A              1.

从上表中可以清楚地看出，每个样本都使用四次进行训练，仅测试一次。

回复您的其他评论:

交叉验证的主要优点是所有样本都用于训练和测试，即交叉验证为您提供最大的建模和测试能力，这在数据集较小时尤为重要。
避免过度拟合的一种方法是使用不同的样本进行训练和测试。
选择模型参数的常见方法包括验证不同参数集的模型并选择可最大限度提高分类准确度的值。

关于python - Scikit Learn - 交叉验证后对数据集进行评分，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/42075986/

25

4

0

文章推荐： machine-learning - 一对一还是一对多？

文章推荐： machine-learning - 我该如何解决这个分层网络？

文章推荐： python - Keras 与 Theano 后端

文章推荐： java - 如何从 JTextArea 中逐行删除行

gcc - 如何使用单个 GCC(交叉)编译器(交叉)编译为 ARM 硬浮点和软浮点 (softfp)？
我想使用单个(交叉)编译器来编译不同 ARM 调用约定的代码:因为我总是想使用浮点和 NEON 指令，所以我只想选择硬浮点调用约定或软浮点(softfp)调用约定。我的编译器默认为硬浮点，但它支持我
Java共享(交叉)依赖管理
假设我正在构建一个依赖于两个库的 java 应用程序:A 和 B。A 和 B 都依赖于库 C。管理 A 和 B 使用相同版本的最佳方法是什么所以他们不冲突？我正在使用 Gradle。最佳答案从 G
交叉(错误符号)图像下的android按钮文本
我想在按钮的文本上添加图像。如果我将图像添加为按钮的背景，它就会添加到文本下方。预期结果作为图像添加。请帮忙更新:我需要以编程方式执行此操作。最佳答案在 XML 中， * 在代码中
css - 如何制作汉堡菜单的动画 - 交叉
我已经开始使用 CSS3 制作动画了。我尝试创建一个动画汉堡菜单，但结果有点难看。顶部和底部的条向右平移一点。所以旋转动画不是很流畅和正确。这是结果 => 这是我的代码: /* HTML */
python - 如何使用opencv或python检测2条相交(交叉)的曲线？
给定一个具有2条相交曲线的图像，如下图所示，我如何使用opencv或python检测和区分2条曲线？ (所以我需要2条单独的曲线) 最佳答案您可以扫描每一列，并从连接的零件中识别出簇。伪算法: l
gcc - 交叉 mingw 编译因未知伪操作而失败
我正在尝试在 redhat 集群(x86_64 主机)上设置 cross-mingw。我没有 root 访问权限，并且可用的 mingw 二进制文件不起作用(坏 glibc 版本等)。我正在阅读本教程
java - JavaFX 中的图像碰撞/交叉
我正在尝试在javaFX中开发一个游戏，当两个图像相交时，分数将被更新，并且障碍物将不可见。但不幸的是，在游戏中分数不断更新。我想我无法在游戏中正确地使图像不可见。以下是相关类的完整代码: pac
css - 固定位置展开并从右侧主 div 交叉
pikastar dot com 是网站，当向下滚动它然后在导航菜单展开固定位置时它 > 将穿过主 div。我该如何修复它。 #topNav.sticky { box-shadow: 0 10
c++ - 交叉 g++ 编译器链接器错误
我正在使用 Eclipse为 ARM 处理器交叉编译 g++ 项目。我在 Windows 环境中使用 yagarto 工具链。我对 C 项目没有问题，但是对于 C++，我一直收到错误: libc.a(
ruby - 如何从两个哈希数组中获取联合/交叉/差异并忽略一些键
我想从两个哈希数组中获取并集/交集/差集，例如: array1 = [{:name =>'Guy1', :age => 45},{:name =>'Guy2', :age => 45}] array2
Grails - 交叉 Controller 代码，在每个请求上执行
有没有办法在调用任何 Controller 操作之前执行一些代码？我需要根据 get 参数的值设置 session 变量，而不考虑调用哪个 Controller 。当然，一旦这个处理完成，请求需要
python - 交叉 3D 网格 python
我刚开始使用 3D 网格，面向用于有限元分析。我想在立方体状矩阵中模拟 Material 的夹杂物(任何形状，但主要对球体和椭圆体感兴趣)。这些夹杂物不应彼此重合。所以我想为python使用某种包，
sharedpreferences - Xamarin Forms Sharedpreferences 交叉
我想知道以跨平台方式操作应用程序设置的最佳解决方案是什么。在 iOS 中，我们可以在设置屏幕中更改应用程序外部的设置，但在 windows phone 和 android 中我们没有。所以，我的想
javascript - knockout 交叉 View 模型
var barcodeNum = ko.observable(""); VelocityMeetings.scan = function (params) { var errorMessage = k
r - 将(交叉)表转换为 ListView
这个问题在这里已经有了答案: Transforming data.frame in R (2 个答案) 关闭10 年前。过去我问过一个关于如何create cross tables from a
javascript - Angularjs - 交叉 Controller 工厂更新
我有两个共享同一个工厂的 Controller 。其中一个 Controller 正在更新工厂变量。其他人应该注意该变化并稍后显示。我是这样尝试的: http://plnkr.co/edit/q1N
mysql - SQL - 交叉 'Crossed' 表
标题不好，但这是我发现的将我的问题与简单的表格交叉区分开来的方式，因为我之前的研究总是让我接触到这类主题。我有几个表 - 为了简化起见，我们只用 3 个表来命名它们:A、B、C。我想将它们全部放在一
mysql - SELECT JOIN 与条件 (OR) 交叉
我需要做这样的事情(在 MySQL 中)，我使用 UNION 的尝试直到现在才奏效。理论上: SELECT * FROM tableA A JOIN tableB B ON A.tableAId =
c++ - SDL 交叉 header 渲染
注意:使用SDL 2.0，Cross header class问题我在类之间进行交叉引用，主要是我的类初始化渲染器和我的纹理类引用渲染初始化。现在，我已经能够运行该程序，直到我开始放入纹理类，代码也
javascript - 检查数组中匹配字母的算法(之前，之后，交叉)
我有一个这样的字母数组 var letters = ["Y", "X", "A", "Y", "O", "H", "A", "O", "O"]; 我创建了一个循环来

首页

博学

6Ren·AI

商城

python - Scikit Learn - 交叉验证后对数据集进行评分