python - 使用折叠相关参数对 GridSearchCV 进行自定义评分

转载作者：太空宇宙更新时间：2023-11-03 15:47:39

27

4

问题

我正在研究一个学习排名问题，其中的标准是对预测进行点评估，但对模型性能进行小组评估。

更具体地说，估计器输出一个连续变量(很像回归量)

> y = est.predict(X); y
array([71.42857143,  0.        , 71.42857143, ...,  0.        ,
       28.57142857,  0.        ])

但是打分函数需要查询聚合，即分组预测，类似groups参数传给GridSearchCV尊重fold分区。

> ltr_score(y_true, y_pred, groups=g)
0.023

障碍

到目前为止一切顺利。当向 GridSearchCV 提供自定义评分功能时，事情变得糟糕了，我无法根据 CV 折叠从评分功能中动态更改 groups 参数:

from sklearn.model_selection import GridSearchCV
from sklearn.metrics import make_scorer

ltr_scorer = make_scorer(ltr_score, groups=g)  # Here's the problem, g is fixed
param_grid = {...}

gcv = GridSearchCV(estimator=est, groups=g, param_grid=param_grid, scoring=ltr_scorer)

解决这个问题最简单的方法是什么？

一种(失败的)方法

在 similar question 中, 一条评论询问/建议:

Why cant you just store {the grouping column} locally and utilize it if necessary by indexing with the train test indices provided by the splitter?

OP 回答“似乎可行”。我也认为这是可行的，但无法实现。显然，GridSearchCV 将首先使用所有交叉验证拆分索引，然后才执行拆分、拟合、预测和评分。这意味着我不能(表面上)尝试在评分时猜测创建当前拆分子选择的原始索引。

为了完整起见，我的代码:

class QuerySplitScorer:
    def __init__(self, X, y, groups):
        self._X = np.array(X)
        self._y = np.array(y)
        self._groups = np.array(groups)
        self._splits = None
        self._current_split = None

    def __iter__(self):
        self._splits = iter(GroupShuffleSplit().split(self._X, self._y, self._groups))
        return self

    def __next__(self):
        self._current_split = next(self._splits)
        return self._current_split

    def get_scorer(self):
        def scorer(y_true, y_pred):
            _, test_idx = self._current_split
            return _score(
                y_true=y_true,
                y_pred=y_pred,
                groups=self._groups[test_idx]
            )

用法:

qss = QuerySplitScorer(X, y_true, g)
gcv = GridSearchCV(estimator=est, cv=qss, scoring=qss.get_scorer(), param_grid=param_grid, verbose=1)
gcv.fit(X, y_true)

这是行不通的，self._current_split 固定在最后生成的拆分处。

最佳答案

据我了解，评分值是成对的(值、组)，但估算器不应与组一起使用。让我们将它们切在 wrapper 中，但将它们留给记分员。

简单的估算器包装器(可能需要一些改进才能完全符合要求)

from sklearn.base import BaseEstimator, ClassifierMixin, TransformerMixin, clone
from sklearn.linear_model import LogisticRegression
from sklearn.utils.estimator_checks import check_estimator
#from sklearn.utils.validation import check_X_y, check_array, check_is_fitted
from sklearn.model_selection import GridSearchCV
from sklearn.metrics import make_scorer

class CutEstimator(BaseEstimator):

    def __init__(self, base_estimator):
        self.base_estimator = base_estimator

    def fit(self, X, y):
        self._base_estimator = clone(self.base_estimator)
        self._base_estimator.fit(X,y[:,0].ravel())
        return self

    def predict(self, X):
        return  self._base_estimator.predict(X)

#check_estimator(CutEstimator(LogisticRegression()))

然后我们就可以使用了

def my_score(y, y_pred):

    return np.sum(y[:,1])


pagam_grid = {'base_estimator__C':[0.2,0.5]}

X=np.random.randn(30,3)
y=np.random.randint(3,size=(X.shape[0],1))
g=np.ones_like(y)

gs = GridSearchCV(CutEstimator(LogisticRegression()),pagam_grid,cv=3,
             scoring=make_scorer(my_score), return_train_score=True
            ).fit(X,np.hstack((y,g)))

print (gs.cv_results_['mean_test_score']) #10 as 30/3
print (gs.cv_results_['mean_train_score']) # 20 as 30 -30/3

输出:

 [ 10.  10.]
 [ 20.  20.]

更新 1:黑客方式但估算器没有变化:

pagam_grid = {'C':[0.2,0.5]}
X=np.random.randn(30,3)
y=np.random.randint(3,size=(X.shape[0]))
g=np.random.randint(3,size=(X.shape[0]))
cv = GroupShuffleSplit (3,random_state=100)
groups_info = {}
for a,b in cv.split(X, y, g):
    groups_info[hash(y[b].tobytes())] =g[b]
    groups_info[hash(y[a].tobytes())] =g[a]

def my_score(y, y_pred):
    global groups_info
    g = groups_info[hash(y.tobytes())]
    return np.sum(g)

gs = GridSearchCV(LogisticRegression(),pagam_grid,cv=cv, 
             scoring=make_scorer(my_score), return_train_score=True,
            ).fit(X,y,groups = g)
print (gs.cv_results_['mean_test_score']) 
print (gs.cv_results_['mean_train_score'])

关于python - 使用折叠相关参数对 GridSearchCV 进行自定义评分，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/49017257/

27

4

0

文章推荐： PayPal 支付高级用户身份验证失败

文章推荐： c# - 如何使 c#.net 应用程序可移植

mysql 'as' 相关
第一段代码工作正常，并给出了我需要的结果。我现在想做的是让它在 'as num' 上返回 3 个数字值对于“as num”上的 3 个不同值，对于同一列上的 3 个不同位置 SELEC
algorithm - 具有三个变量的数学函数(相关)
我想分析一些数据以编写定价算法。以下日期可用: 我需要三个变量/维度的函数/相关因子，它显示三个维度(pers_capacity、卧室数量、浴室数量)增长时中位数(价格)的变化。例如Y(#pers_c
后台崩溃 - Sprite-Kit 相关
正如标题所说 - 我的 Sprite Kit 游戏时不时地在后台崩溃，总是出现此错误 - Exception Type: EXC_BAD_ACCESS (SIGSEGV) Exception Sub
php - 相关(别名)模型上的Phalcon验证消息
假设我尝试保存以下数据，并且Songs模型的name属性上设置了Phalcon \ Mvc \ Model \ Validator \ PresenceOf验证器 // Get an existing
c# - 相关 if 条件由 && 运算符控制
我有一个 if 控件，如下所示； if (Directory.Exists(System.IO.Path.Combine(systemPath, "Reports", companyName))
javascript - Jscript ReadLine() 相关
有人可以告诉我我们使用 ReadLine() 从文件 (.txt) 中读取特定行吗？现在我想读取文件的全部内容(不仅仅是第一行)。为此我需要使用什么方法。我用谷歌搜索了很多，但找不到解决方案。我的代
fpga - 语言如何与 FPGA 相关？
我相信在大学时我用从 C 派生的语言为 FPGA 编写了一个程序。我了解 VHDL 和 verilog 等语言。但是，我不明白的是程序员在使用哪个方面有多少选择？它依赖于FPGA吗？我将使用 Xili
c# - 相关 if 条件由 && 运算符控制
我有一个 if 控件，如下所示； if (Directory.Exists(System.IO.Path.Combine(systemPath, "Reports", companyName))
javascript - 为图像对象设置源 - Dashcode 相关
如何在运行时更改 Dashcode (Javascript) 中图像对象的源？我试过: var image = document.getElementById("image").object;ima
c++ - 相关 C++ 类中多态性的最佳实践？
我有几个相互关联的类，它们将被多种不同的算法使用例子: struct B; struct A { B* parent; }; struct B { std::vector child
mysql - 与 mySQL 相关
我正在开发一个网站，用户在客户收到的表中输入金额，如果任何客户没有提供分期付款(金额)，则用户不会在表中输入任何金额，并且用户希望获取违约者的信息客户以10天为基础。所以我的问题是应该定义什么表和属性
mysql - 从之前的重力形式条目中选择一个值(SQL 相关)
我试图从上一个条目中选择一个值，并每次将该数字加一。我让它工作到选择当前条目值(默认 1000)并递增 1 并重新插入该值(因此每次最终都是 1001)。我需要它来选择该字段的最后一个条目，这样它将变
mysql - 如何从表中选择一行并从另一个(相关)表中选择多行
我不擅长“制作”查询。假设这是我的数据库: artist pics ------------------- -
PHP:长轮询和 Comet 相关
最近，我要为我的网站做一个即时通知系统。我听说 COMET 在这种情况下必不可少。我已经搜索 PHP 和 Comet 一段时间了，但是，我发现的指南和文章似乎只是循环中的 ajax 请求。例如，有一
ios - 为什么这行不通？ ( SpriteKit 相关)
我正在开发一款 iOS 游戏，我希望 clown 在场景外生成，然后向下移动。我的想法是全部创建它们，并将它们以 360 像素的距离放置在不可见的场景中。像这样: SKSpriteNode *clo
Mysql Group by 子句与聚合结果上的 where 相关
我有以下子订单表。 mysql> select * from suborder; +-------------+------------------+ | order_state | bookin
java - 什么时候编码与 Java 相关？
这可能是一个有点初学者的问题，但考虑到在 Java 中调试编码是相当相关的:什么时候编码与 String 对象相关？假设我有一个要保存到文件中的字符串对象。 String 对象本身是否使用某种我应该
c++ - 如何管理对象之间的一对多关系？ ( move 相关)
首先我想说我是 CPP 的新手(我从 cpp11 开始):)考虑以下实体:学生(名字+姓氏)和组(描述+更多学生)。我在 C++ 中创建了以下 2 个类: class Student { privat
javascript - 无法调用函数/AJAX 相关
我正在尝试在单击该复选框时同步更新我的数据库。我决定使用 aJax，但它似乎无法识别 ajax。代码:将成为 Switch_Active(this.id) 函数的元素 ... Deactivat
jQuery - 单击并添加类触发另一个(相关)单击？
我正在创建一个菜单。菜单如下。 $('.category').mouseover(function() { $(this).removeClass('category').addClass('cate

首页

博学

6Ren·AI

商城

python - 使用折叠相关参数对 GridSearchCV 进行自定义评分

问题

障碍

一种(失败的)方法