r - tidymodels:具有交叉验证的游侠-6ren

r - tidymodels:具有交叉验证的游侠

转载作者：行者123 更新时间：2023-12-03 14:23:21

数据集可以在这里找到:
https://www.kaggle.com/mlg-ulb/creditcardfraud

我正在尝试使用 tidymodels 在此数据集上运行具有 5 折交叉验证的游侠。

我有 2 个代码块。第一个代码块是包含完整数据的原始代码。第二个代码块几乎与第一个代码块相同，只是我有一部分数据的子集，因此代码运行得更快。第二个代码块只是为了确保我的代码在我在原始数据集上运行之前可以正常工作。

这是包含完整数据的第一个代码块:

#load packages
library(tidyverse)
library(tidymodels)
library(tune)
library(workflows)

#load data
df <- read.csv("~creditcard.csv")

#check for NAs and convert Class to factor
anyNA(df)
df$Class <- as.factor(df$Class)

#set seed and split data into training and testing
set.seed(123)
df_split <- initial_split(df)
df_train <- training(df_split)
df_test <- testing(df_split)

#in the training and testing datasets, how many are fraudulent transactions?
df_train %>% count(Class)
df_test %>% count(Class)

#ranger model with 5-fold cross validation
rf_spec <- 
  rand_forest() %>% 
  set_engine("ranger", importance = "impurity") %>% 
  set_mode("classification")

all_wf <- 
  workflow() %>% 
  add_formula(Class ~ .) %>% 
  add_model(rf_spec)

cv_folds <- vfold_cv(df_train, v = 5)
cv_folds

rf_results <-
  all_wf %>% 
  fit_resamples(resamples = cv_folds)

rf_results %>% 
  collect_metrics()

这是第二个有 1000 行的代码块:

#load packages
library(tidyverse)
library(tidymodels)
library(tune)
library(workflows)

#load data
df <- read.csv("~creditcard.csv")

###################################################################################
#Testing area#
df <- df %>% arrange(-Class) %>% head(1000)

###################################################################################

#check for NAs and convert Class to factor
anyNA(df)
df$Class <- as.factor(df$Class)

#set seed and split data into training and testing
set.seed(123)
df_split <- initial_split(df)
df_train <- training(df_split)
df_test <- testing(df_split)

#in the training and testing datasets, how many are fraudulent transactions?
df_train %>% count(Class)
df_test %>% count(Class)

#ranger model with 5-fold cross validation
rf_spec <- 
  rand_forest() %>% 
  set_engine("ranger", importance = "impurity") %>% 
  set_mode("classification")

all_wf <- 
  workflow() %>% 
  add_formula(Class ~ .) %>% 
  add_model(rf_spec)

cv_folds <- vfold_cv(df_train, v = 5)
cv_folds

rf_results <-
  all_wf %>% 
  fit_resamples(resamples = cv_folds)

rf_results %>% 
  collect_metrics()

1.) 使用第一个代码块，我可以在控制台中分配和打印 cv 折叠。全局环境数据显示 cv_folds 有 5 个 obs。 2个变量。当我查看(cv_folds)时，我有标记为拆分和 id 的列，但没有行也没有数据。当我使用 str(cv_folds) 时，我得到了 R 正在“思考”的空白加载行，但没有我可以插入的红色 STOP 图标。我唯一能做的就是强制退出 RStudio。也许我只需要等待更长的时间？我不确定。当我用较小的第二个代码块做同样的事情时， str() 工作正常。

2)我对这个项目的总体目标是将数据集分成训练集和测试集。然后用 5 折交叉验证对训练数据进行分区，并在其上训练一个游侠模型。接下来，我想检查我的模型在训练数据上的指标。然后我想在测试集上测试我的模型并查看指标。最终，我想将 ranger 换成 xgboost 之类的东西。请就我可以添加/修改代码的哪些部分来改进给我建议。我仍然缺少在测试集上测试我的模型的部分。

I think the Predictions portion of this article might be what I'm aiming for.
https://rviews.rstudio.com/2019/06/19/a-gentle-intro-to-tidymodels/

3) 当我使用 rf_results %>% collect_metrics() 时，它只显示准确率和 roc_auc。如何获得灵敏度、特异性、精确度和召回率？

4)我如何绘制重要性？我会用这样的东西吗？

rf_fit <- get_tree_fit(all_wf)
vip::vip(rf_fit, geom = "point")

5) 如何大幅减少模型训练的时间？上次我在这个数据集上使用插入符号运行 ranger 进行 5 折交叉验证，花费了 8 多个小时(6 核，4.0 ghz，16gb RAM，SSD，gtx 1060)。我对任何事情都持开放态度(即重构代码、AWS 计算、并行化等)

编辑:这是我尝试设置的另一种方式

#ranger model with 5-fold cross validation
rf_recipe <- recipe(Class ~ ., data = df_train)

rf_engine <- 
  rand_forest(mtry = tune(), trees = tune(), min_n = tune()) %>% 
  set_engine("ranger", importance = "impurity") %>% 
  set_mode("classification")

rf_grid <- grid_random(
  mtry() %>% range_set(c(1, 20)),
  trees() %>% range_set(c(500, 1000)), 
  min_n() %>% range_set(c(2, 10)),
  size = 30)

all_wf <- 
  workflow() %>% 
  add_recipe(rf_recipe) %>% 
  add_model(rf_engine)

cv_folds <- vfold_cv(df_train, v = 5)
cv_folds

#####
rf_fit <- tune_grid(
  all_wf,
  resamples = cv_folds,
  grid = rf_grid,
  metrics = metric_set(roc_auc),
  control = control_grid(save_pred = TRUE)
)

collect_metrics(rf_fit)

rf_fit_best <- select_best(rf_fit)
(wf_rf_best <- finalize_workflow(all_wf, rf_fit_best))

最佳答案

我从您的最后一段代码开始，并进行了一些编辑以具有功能性工作流程。我在代码中回答了您的问题。我冒昧地给你一些建议并重新格式化你的代码。

## Packages, seed and data
library(tidyverse)
library(tidymodels)

set.seed(123)

df <- read_csv("creditcard.csv")

df <- 
  df %>% 
  arrange(-Class) %>% 
  head(1000) %>% 
  mutate(Class = as_factor(Class))


## Modelisation

# Initial split
df_split <- initial_split(df)
df_train <- training(df_split)
df_test <- testing(df_split)

你可以看到 df_split返回 <750/250/1000> (见下文)。

2) 要调整 xgboost 模型，您几乎不需要更改任何内容。

# Models

model_rf <- 
  rand_forest(mtry = tune(), trees = tune(), min_n = tune()) %>% 
  set_engine("ranger", importance = "impurity") %>% 
  set_mode("classification")

model_xgboost <- 
  boost_tree(mtry = tune(), trees = tune(), min_n = tune()) %>% 
  set_engine("xgboost", importance = "impurity") %>% 
  set_mode("classification")

在这里你选择你的超参数网格。我建议您使用非随机网格以最佳方式访问超参数空间。

# Grid of hyperparameters

grid_rf <- 
  grid_max_entropy(        
    mtry(range = c(1, 20)), 
    trees(range = c(500, 1000)),
    min_n(range = c(2, 10)),
    size = 30)

如您所见，这些是您的工作流程，几乎无需更改。

# Workflow

wkfl_rf <- 
  workflow() %>% 
  add_formula(Class ~ .) %>% 
  add_model(model_rf)

wkfl_wgboost <- 
  workflow() %>% 
  add_formula(Class ~ .) %>% 
  add_model(model_xgboost)

1) <600/150/750>意味着您的训练集中有 600 个观测值，验证集中有 150 个观测值，原始数据集中共有 750 个观测值。请注意，此处为 600 + 150 = 750，但并非总是如此(例如，使用带有重采样的 boostrap 方法)。

# Cross validation method

cv_folds <- vfold_cv(df_train, v = 5)
cv_folds

3) 在这里，您可以使用yardstik 包选择要在调整期间收集的指标。

# Choose metrics

my_metrics <- metric_set(roc_auc, accuracy, sens, spec, precision, recall)

然后你可以根据网格计算不同的模型。对于控制参数，不要保存预测和打印进度(恕我直言)。

# Tuning

rf_fit <- tune_grid(
  wkfl_rf,
  resamples = cv_folds,
  grid = grid_rf,
  metrics = my_metrics,
  control = control_grid(verbose = TRUE) # don't save prediction (imho)
)

这些是处理 rf_fit 的一些有用功能。目的。

# Inspect tuning 

rf_fit
collect_metrics(rf_fit)
autoplot(rf_fit, metric = "accuracy")
show_best(rf_fit, metric = "accuracy", maximize = TRUE)
select_best(rf_fit, metric = "accuracy", maximize = TRUE)

最后，您可以根据最佳参数拟合您的模型。

# Fit best model 

tuned_model <-
  wkfl_rf %>% 
  finalize_workflow(select_best(rf_fit, metric = "accuracy", maximize = TRUE)) %>% 
  fit(data = df_train)

predict(tuned_model, df_train)
predict(tuned_model, df_test)

4) 不幸的是，处理 randomForest 的方法 parnsnip 中的对象通常不可用输出

5) 你可以看看 vignette关于并行化。

关于r - tidymodels:具有交叉验证的游侠，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/60368047/

文章推荐： azure-devops - 还原在 Azure 发布管道中有什么作用？

文章推荐： python - Flask: orjson 代替 json 模块进行解码

gcc - 如何使用单个 GCC(交叉)编译器(交叉)编译为 ARM 硬浮点和软浮点 (softfp)？
我想使用单个(交叉)编译器来编译不同 ARM 调用约定的代码:因为我总是想使用浮点和 NEON 指令，所以我只想选择硬浮点调用约定或软浮点(softfp)调用约定。我的编译器默认为硬浮点，但它支持我
Java共享(交叉)依赖管理
假设我正在构建一个依赖于两个库的 java 应用程序:A 和 B。A 和 B 都依赖于库 C。管理 A 和 B 使用相同版本的最佳方法是什么所以他们不冲突？我正在使用 Gradle。最佳答案从 G
交叉(错误符号)图像下的android按钮文本
我想在按钮的文本上添加图像。如果我将图像添加为按钮的背景，它就会添加到文本下方。预期结果作为图像添加。请帮忙更新:我需要以编程方式执行此操作。最佳答案在 XML 中， * 在代码中
css - 如何制作汉堡菜单的动画 - 交叉
我已经开始使用 CSS3 制作动画了。我尝试创建一个动画汉堡菜单，但结果有点难看。顶部和底部的条向右平移一点。所以旋转动画不是很流畅和正确。这是结果 => 这是我的代码: /* HTML */
python - 如何使用opencv或python检测2条相交(交叉)的曲线？
给定一个具有2条相交曲线的图像，如下图所示，我如何使用opencv或python检测和区分2条曲线？ (所以我需要2条单独的曲线) 最佳答案您可以扫描每一列，并从连接的零件中识别出簇。伪算法: l
gcc - 交叉 mingw 编译因未知伪操作而失败
我正在尝试在 redhat 集群(x86_64 主机)上设置 cross-mingw。我没有 root 访问权限，并且可用的 mingw 二进制文件不起作用(坏 glibc 版本等)。我正在阅读本教程
java - JavaFX 中的图像碰撞/交叉
我正在尝试在javaFX中开发一个游戏，当两个图像相交时，分数将被更新，并且障碍物将不可见。但不幸的是，在游戏中分数不断更新。我想我无法在游戏中正确地使图像不可见。以下是相关类的完整代码: pac
css - 固定位置展开并从右侧主 div 交叉
pikastar dot com 是网站，当向下滚动它然后在导航菜单展开固定位置时它 > 将穿过主 div。我该如何修复它。 #topNav.sticky { box-shadow: 0 10
c++ - 交叉 g++ 编译器链接器错误
我正在使用 Eclipse为 ARM 处理器交叉编译 g++ 项目。我在 Windows 环境中使用 yagarto 工具链。我对 C 项目没有问题，但是对于 C++，我一直收到错误: libc.a(
ruby - 如何从两个哈希数组中获取联合/交叉/差异并忽略一些键
我想从两个哈希数组中获取并集/交集/差集，例如: array1 = [{:name =>'Guy1', :age => 45},{:name =>'Guy2', :age => 45}] array2
Grails - 交叉 Controller 代码，在每个请求上执行
有没有办法在调用任何 Controller 操作之前执行一些代码？我需要根据 get 参数的值设置 session 变量，而不考虑调用哪个 Controller 。当然，一旦这个处理完成，请求需要
python - 交叉 3D 网格 python
我刚开始使用 3D 网格，面向用于有限元分析。我想在立方体状矩阵中模拟 Material 的夹杂物(任何形状，但主要对球体和椭圆体感兴趣)。这些夹杂物不应彼此重合。所以我想为python使用某种包，
sharedpreferences - Xamarin Forms Sharedpreferences 交叉
我想知道以跨平台方式操作应用程序设置的最佳解决方案是什么。在 iOS 中，我们可以在设置屏幕中更改应用程序外部的设置，但在 windows phone 和 android 中我们没有。所以，我的想
javascript - knockout 交叉 View 模型
var barcodeNum = ko.observable(""); VelocityMeetings.scan = function (params) { var errorMessage = k
r - 将(交叉)表转换为 ListView
这个问题在这里已经有了答案: Transforming data.frame in R (2 个答案) 关闭10 年前。过去我问过一个关于如何create cross tables from a
javascript - Angularjs - 交叉 Controller 工厂更新
我有两个共享同一个工厂的 Controller 。其中一个 Controller 正在更新工厂变量。其他人应该注意该变化并稍后显示。我是这样尝试的: http://plnkr.co/edit/q1N
mysql - SQL - 交叉 'Crossed' 表
标题不好，但这是我发现的将我的问题与简单的表格交叉区分开来的方式，因为我之前的研究总是让我接触到这类主题。我有几个表 - 为了简化起见，我们只用 3 个表来命名它们:A、B、C。我想将它们全部放在一
mysql - SELECT JOIN 与条件 (OR) 交叉
我需要做这样的事情(在 MySQL 中)，我使用 UNION 的尝试直到现在才奏效。理论上: SELECT * FROM tableA A JOIN tableB B ON A.tableAId =
c++ - SDL 交叉 header 渲染
注意:使用SDL 2.0，Cross header class问题我在类之间进行交叉引用，主要是我的类初始化渲染器和我的纹理类引用渲染初始化。现在，我已经能够运行该程序，直到我开始放入纹理类，代码也
javascript - 检查数组中匹配字母的算法(之前，之后，交叉)
我有一个这样的字母数组 var letters = ["Y", "X", "A", "Y", "O", "H", "A", "O", "O"]; 我创建了一个循环来

行者123

个人简介

我是一名优秀的程序员,十分优秀！

作者热门文章

滴滴打车优惠券免费领取

全站热门文章

首页

博学

6Ren·AI

商城

r - tidymodels:具有交叉验证的游侠