r - 如何在 mlr3 中根据指标列和批量训练预测对任务进行子集化？

转载作者：行者123 更新时间：2023-12-02 16:37:01

28

4

背景

我正在使用 R 中的 mlr3 包进行建模和预测。我正在处理一个由测试集和训练集组成的大数据集。测试集和训练集由指示器列指示(在代码中:test_or_train)。

目标

使用数据集中 train_or_test 列指示的训练行对所有学习器进行批量训练。
使用相应的受训学习器批量预测 test_or_train 列中“test”指定的行。

代码

带有测试训练指示器列的占位符数据集。 (在实际数据中train-test split并不是人为的)
两个任务(在实际代码中任务是不同的，而且还有更多。)

library(readr)
library(mlr3)
library(mlr3learners)
library(mlr3pipelines)
library(reprex)
library(caret)

# Data
urlfile = 'https://raw.githubusercontent.com/shudras/office_data/master/office_data.csv'
data = read_csv(url(urlfile))[-1]

## Create artificial partition to test and train sets
art_part = createDataPartition(data$imdb_rating, list=FALSE)
train = data[art_part,]
test = data[-art_part,]

## Add test-train indicators
train$test_or_train = 'train'
test$test_or_train = 'test'

## Data set that I want to work / am working with
data = rbind(test, train)

# Create two tasks (Here the tasks are the same but in my data set they differ.)
task1 = 
  TaskRegr$new(
    id = 'office1', 
    backend = data, 
    target = 'imdb_rating'
  )
task2 = 
  TaskRegr$new(
    id = 'office2', 
    backend = data, 
    target = 'imdb_rating'
  )


# Model specification 
graph = 
  po('scale') %>>% 
  lrn('regr.cv_glmnet', 
      id = 'rp', 
      alpha = 1, 
      family = 'gaussian'
  ) 

# Learner creation
learner = GraphLearner$new(graph)

# Goal 
## 1. Batch train all learners with the train rows indicated by the train_or_test column in the data set
## 2. Batch predict the rows designated by the 'test' in the test_or_train column with the respective trained learner

^{由 reprex package 创建于 2020-06-22 (v0.3.0)}

注意事项

我尝试将 benchmark_grid 与 row_ids 一起使用来仅使用火车行来训练学习者，但这没有用，而且也不可能使用列指示符，因为它比使用行索引容易得多。使用列测试训练指示符，可以使用一个规则(用于拆分)，而使用行索引仅在任务包含相同行时才有效。

benchmark_grid(
    tasks = list(task1, task2), 
    learners = learner, 
    row_ids = train_rows # Not an argument and not favorable to work with indices
)

最佳答案

您可以在自定义设计中使用基准测试。

下面应该完成这项工作(请注意，我为每个 Task 分别实例化了一个自定义 Resampling。

library(data.table)
design = data.table(
  task = list(task1, task2),
  learner = list(learner)
)

library(mlr3misc)
design$resampling = map(design$task, function(x) {
  # get train/test split
  split = x$data()[["test_or_train"]]
  # remove train-test split column from the task
  x$select(setdiff(x$feature_names, "test_or_train"))
  # instantiate a custom resampling with the given split
  rsmp("custom")$instantiate(x,
    train_sets = list(which(split == "train")),
    test_sets = list(which(split == "test"))
  )
})

benchmark(design)

您能否更清楚地说明您所说的 batch-processing 是什么意思，或者这是否回答了您的问题？

关于r - 如何在 mlr3 中根据指标列和批量训练预测对任务进行子集化？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/62509138/

28

4

0

文章推荐： parsing - LPeg 语法怪异

Azure SQL 指标
我在 Azure 中找不到几个 SQL 指标。任何人都可以帮助如何设置以下主题的指标。 1)产能利用率不足 2)池外的数据库数量 3)扩大规模 4)连接超时提前致谢。最佳答案实际上，这些并不是
普罗米修斯 json 指标
我要监控的应用程序提供了一个用于健康检查的 api 端点，它以 json 格式响应指标。例如: $ curl https://example.com/api/stats {"status":"suc
metrics - 测量软件配置代码的工作量/指标
我正在考虑用于分析软件开发工作的软件指标。当我考虑在面向对象的软件中使用类似功能点的指标时，我遇到了一个有趣的挑战/问题。考虑一个业务规则引擎。它是一种应用程序，由运行业务规则所需的组件组成，然后将
普罗米修斯 json 指标
我要监控的应用程序提供了一个用于健康检查的 api 端点，它以 json 格式响应指标。例如: $ curl https://example.com/api/stats {"status":"suc
Javascript Clusterfck 指标
因此，我正在将旧的数据可视化转换为新平台，但我对他们的社区排序功能有点困惑。在原始代码中，作者似乎使用了带有余弦相似度计算器的凝聚聚类。我认为在 Javascript 中解决这个问题的最佳方法是使用
algorithm - 如何操纵围绕中心值震荡的价格序列(指标)？
我不是专业程序员，但我正在尝试改变一些技术指标在名为 TradeStation 的金融图表包中的显示方式(与特定图表供应商无关)。这就是问题所在:大多数指标都是围绕零点绘制的，有时它们会靠近零点摆动
mysql - 指标/报告生成问题
我们存储了大量来 self 们服务的指标(大约 8000 万个事件)。我们必须根据数据生成报告。我的问题比较笼统，哪些工具可以满足您的指标/报告需求？有什么推荐的吗？我们使用 Apache 编写日
lighthouse - 受使用内容可见性属性影响的累积布局偏移 (CLS) 指标？
我们网站上的页面的 CLS 一直接近于零。这是有道理的，因为它们是服务器呈现的 HTML 页面，具有简单的静态布局。最近我们添加了 content-visibility: auto 的使用，如下所示
r - 在R中将因子矩阵转换为二进制(指标)矩阵的最有效方法
我能想到几种方法来转这种类型的矩阵(数据框): dat = data.frame( x1 = rep(c('a', 'b'), 100), x2 = rep(c('x', 'y
metrics - Dropwizard 指标 - 如何在报告间隔后重置计数器
我正在使用 codahale 指标(现在是 dropwizard 指标)来监控我系统中发生的一些“事件”。我正在使用 counters跟踪“事件”发生次数的指标。我检查了记者为我的计数器指标打印的值
continuous-integration - 持续集成投资返回率/指标
关闭。这个问题需要更多focused .它目前不接受答案。想改善这个问题吗？更新问题，使其仅关注一个问题 editing this post . 11 个月前关闭。 Improve this que
Kubernetes:如何获取节点的磁盘/cpu 指标
在不使用 Heapster 的情况下，有没有办法收集有关 Kubernetes 集群中节点的 CPU 或磁盘指标？ Heapster 最初是如何收集这些指标的？最佳答案 Kubernetes 监控在
xgboost 正确使用 auc 指标
对于二元分类问题，我有一个略微不平衡的数据集，正负比为 0.6。我最近从这个答案中了解到了 auc 指标:https://stats.stackexchange.com/a/132832/12822
python - 如何重置 Keras 指标？
为了做一些参数调整，我喜欢用 Keras 循环一些训练函数。但是，我意识到在使用 tensorflow.keras.metrics.AUC() 时作为度量，对于每个训练循环，都会将一个整数添加到 au
c# - 如何通过短信通知添加自定义 Azure 指标？
我使用 Azure，现在我想在特定情况下添加短信通知。当我使用基于日志的指标时，它效果很好，但我想针对特定异常创建通知。下一个流程:抛出异常 => Azure 知道识别它 => Azure 发送有
azure - 访问 Azure 指标
我正在尝试访问给定cloudService的指标我有以下代码: var metricsClient = new MetricsClient(new CertificateCloudCredentia
R 指标 RMSE 不适用于分类模型
我正在尝试使用 R 和 xgboost 来研究我的模型。训练模型总体上效果很好，但对于插入符来说，度量存在一些问题。我尝试为类列设置一个因子，但仍然没有结果。我的数据 ID var1var2TA
swift - 作为全局属性的 Activity 指标
我对编程还很陌生，有时它会用非常基本的概念来困扰我。我在我的 tableviewcontroller 中定义了一个 Activity 指示器作为 Outlet。 @IBOutlet weak var
tensorflow - 如何使用功能来评估不用于训练模型的自定义 TensorFlow 指标
我正在训练一个进行序列预测的模型。例如，给定某人之前写过的 10 个单词，我正在训练 LSTM 来预测他们将写的下一个单词。我有一个有时可以工作的模型，因此我想创建一个指标来跟踪模型通过词性标签预测下
java - 为什么我没有获得 hystrix 指标？
我正在尝试使用 hystrix 来监控某个网络调用。但我尝试监控的所有指标始终为空。我做错了什么？我通过实现一个(某种程度上)RESTful 接口(interface)来模拟网络调用，该接口(int

首页

博学

6Ren·AI

商城

r - 如何在 mlr3 中根据指标列和批量训练预测对任务进行子集化？

背景

目标

代码

注意事项