python - 嵌套交叉验证 : How does cross_validate handle GridSearchCV as its input estimator?-6ren

python - 嵌套交叉验证 : How does cross_validate handle GridSearchCV as its input estimator?

转载作者：太空宇宙更新时间：2023-11-03 15:35:35

28

4

以下代码将 cross_validate 与 GridSearchCV 相结合，对 iris 数据集上的 SVC 执行嵌套交叉验证。

(以下文档页面的修改示例: https://scikit-learn.org/stable/auto_examples/model_selection/plot_nested_cross_validation_iris.html#sphx-glr-auto-examples-model-selection-plot-nested-cross-validation-iris-py .)

from sklearn.datasets import load_iris
from sklearn.svm import SVC
from sklearn.model_selection import GridSearchCV, cross_validate, KFold
import numpy as np
np.set_printoptions(precision=2)

# Load the dataset
iris = load_iris()
X_iris = iris.data
y_iris = iris.target

# Set up possible values of parameters to optimize over
p_grid = {"C": [1, 10],
          "gamma": [.01, .1]}

# We will use a Support Vector Classifier with "rbf" kernel
svm = SVC(kernel="rbf")

# Choose techniques for the inner and outer loop of nested cross-validation
inner_cv = KFold(n_splits=5, shuffle=True, random_state=1)
outer_cv = KFold(n_splits=4, shuffle=True, random_state=1)

# Perform nested cross-validation
clf = GridSearchCV(estimator=svm, param_grid=p_grid, cv=inner_cv, iid=False)
clf.fit(X_iris, y_iris)
best_estimator = clf.best_estimator_

cv_dic = cross_validate(clf, X_iris, y_iris, cv=outer_cv, scoring=['accuracy'], return_estimator=False, return_train_score=True)
mean_val_score = cv_dic['test_accuracy'].mean()

print('nested_train_scores: ', cv_dic['train_accuracy'])
print('nested_val_scores:   ', cv_dic['test_accuracy'])
print('mean score:            {0:.2f}'.format(mean_val_score))

cross_validate 将每个折叠中的数据集拆分为训练和测试集。在每个折叠中，然后根据与折叠关联的训练集训练输入估计器。这里输入的估计器是clf，一个参数化的GridSearchCV估计器，即再次交叉验证自己的估计器。

我对整个事情有三个问题:

如果 clf 被用作 cross_validate 的估计器，它是否(在 GridSearchCV 交叉验证过程中)拆分上面提到的将训练集分成子训练集和验证集以确定最佳超参数组合？
在通过 GridSearchCV 测试的所有模型中，cross_validate 是否仅验证存储在 best_estimator_ 属性中的模型？
cross_validate 是否训练模型(如果是，为什么？)或者存储在 best_estimator_ 中的模型是否直接通过测试集验证？

为了更清楚地说明问题的含义，这里举例说明我目前如何想象双交叉验证。

最佳答案

If clf is used as the estimator for cross_validate, does it split the above mentioned training set into a subtraining set and a validation set in order to determine the best hyper parameter combination?

是的，如您所见here at Line 230训练集再次分成子训练集和验证集(特别是在 line 240 )。

更新是的，当您将 GridSearchCV 分类器传递到 cross-validate 时，它会再次将训练集拆分为测试和训练放。这是 a link更详细地描述这一点。您的图表和假设是正确的。

Out of all models tested via GridSearchCV, does cross_validate train & validate only the model stored in the variable best_estimator?

是的，从答案中可以看出here和 here ，GridSearchCV 在您的情况下返回 best_estimator(因为在您的情况下 refit 参数默认为 True。)~~但是，必须再次训练这个最佳估计器~~

Does cross_validate train a model at all (if so, why?) or is the model stored in best_estimator_ validated directly via the test set?

根据您的第三个也是最后一个问题，是的，如果 return_estimator 设置为 True，它会训练一个估计器并返回它。参见 this line .这是有道理的，因为如果不首先训练估算器，还应该如何返回分数？

更新再次训练模型的原因是因为交叉验证的默认用例不假设您给出具有最佳参数的最佳分类器。具体来说，在这种情况下，您从 GridSearchCV 发送一个分类器，但如果您发送任何未经训练的分类器，它应该是经过训练的。我在这里要说的是，是的，在您的情况下，它不应该再次训练它，因为您已经在使用 GridSearchCV 并使用最佳估算器进行交叉验证。但是，cross-validate 无法知道这一点，因此，它假设您发送的是未优化或未经训练的估计器，因此它必须再次训练并返回分数同样。

关于python - 嵌套交叉验证 : How does cross_validate handle GridSearchCV as its input estimator?，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/55030190/

28

4

0

文章推荐：包含结构数组的 C# 结构联合

python - GridSearchCV.best_score 与 cross_val_score(GridSearchCV.best_estimator_) 不同
考虑以下网格搜索: grid = GridSearchCV(clf, parameters, n_jobs =-1, iid=True, cv =5) grid_fit = grid.fit(X_tr
python - GridSearchCV 如何使用内核？
我正在做一个 GridSearchCV，我已经监控了核心的百分比，并且我看到当我运行一个简单的神经网络时，4 个核心具有相同的百分比，但是当网格搜索 cv (n_jobs = 1) 开始时在情节的线条
python - GridSearchCV 的结果作为表格
我在带有 RBF 内核的 SVM 上进行了网格搜索 + 交叉验证，以使用类 GridShearchCV 找到参数 C 和 gamma 的最佳值。现在我想以表格格式获得结果，例如 C/gamma 1e-
python - GridSearchCV 结果热图
我正在尝试为 sklearn 的 GridSearchCV 结果生成热图。我喜欢的东西sklearn-evaluation是因为生成热图真的很容易。但是，我遇到了一个问题。当我将参数设为 None 时
python - GridSearchCV 随机森林回归器调整最佳参数
我想提高这个的参数GridSearchCV 对于随机森林回归器 . def Grid_Search_CV_RFR(X_train, y_train): from sklearn.model_
python - GridSearchCV 对平均绝对误差进行评分
我正在尝试设置 GridSearchCV 的实例来确定哪一组超参数将产生最低的平均绝对误差。 This scikit documentation表示分数指标可以在创建 GridSearchCV 时传递
python - 使用带有间隔的 GridSearchCV
当使用网格搜索在 python 中使用此函数 GridSearchCV() 进行分类器时，假设我们有一个参数区间来调整形式 1 到 100，我们如何能够指定它(1:100 不起作用)？ p> 最佳答案
python - 用于多项式回归的 GridsearchCV
我是机器学习的新手，并且一直坚持这个。当我尝试在线性模型中实现多项式回归时，例如使用多个次数的多项式范围(1,10)并获得不同的 MSE。我实际上使用 GridsearchCV 方法来查找多项式的最
python - GridSearchCV 初始化
我想在一系列 alpha(拉普拉斯平滑参数)上使用 GridSearchCV 来检查哪个为伯努利朴素贝叶斯模型提供了最佳准确度。 def binarize_pixels(data, threshold
python - GridSearchCV 将为此运行多少种组合？
使用 sklearn 在随机森林分类器上运行网格搜索。这个运行的时间比我想象的要长，我正在尝试估计这个过程还剩多少时间。我认为它的总拟合次数是 3*3*3*3*5 = 405。 clf = Rando
python - GridSearchCV 不工作？
我正在尝试使用网格搜索找出要在 PCA 中使用的 n_components 的最佳值: from sklearn.decomposition import PCA from sklearn.grid_
python - GridsearchCV 异常
我正在尝试 GridsearchCV 但我希望在 param grid 中有一些异常(exception)。这是我的网格搜索代码: from sklearn.model_selection impor
python - GridSearchCV 如何计算训练分数？
我很难找出 GridSearchCV 中的参数 return_train_score。来自docs : return_train_score : boolean, optional If
python - GridSearchCV，数据框每个部分中每个类的表示
我必须进行多类分类 (3)。我使用 GridSearchCV 为我的分类器搜索最佳参数。但我有一个不平衡的 x_train(和 x_test):0 有 3079 个实例，1 有 12 个实例，3 有
python - GridSearchCV - 跨测试访问预测值？
有没有办法访问在 GridSearchCV 过程中计算的预测值？我希望能够根据实际值(来自测试/验证集)绘制预测的 y 值。网格搜索完成后，我可以使用将其与其他一些数据相匹配 ypred =
python - GridsearchCV 上的预处理
我正在使用GridsearchCV来调整超参数，现在我想在训练和验证步骤中进行最小-最大Normalization(StandardScaler())。但我认为我不能做到这一点。问题是: 如果我对整
python - GridSearchCV 对每个标签分别进行多标签分类
我正在使用 scikit learn 进行多标签分类。我使用 RandomForestClassifier 作为基本估计器。我想使用 GridSearchCV 优化每个标签的参数。目前我正在按以下方式
python - GridSearchCV 没有关于高冗长的报告
好的，我只想说，我对 SciKit-Learn 和数据科学完全陌生。但这是问题所在，也是我目前对该问题的研究。代码在底部。总结我正尝试使用 BernoulliRBM 进行类型识别(例如数字)，并尝
python - GridSearchCV - 每次迭代保存结果
我正在使用 GridSearchCV ，并且在每次迭代之后，我想将 clf.cv_results_ 属性保存到一个文件中(以防进程在中间崩溃)。我尝试寻找解决方案，但就是想不通。我们将不胜感激。
python - GridSearchCV 神经元数量
我正在尝试自学如何在基本的多层神经网络中对神经元的数量进行网格搜索。我正在使用 Python 的 GridSearchCV 和 KerasClasifier 以及 Keras。下面的代码适用于其他数据

首页

博学

6Ren·AI

商城

python - 嵌套交叉验证 : How does cross_validate handle GridSearchCV as its input estimator?