r - 在 pivot_longer 的 names_pattern 参数中为通过前缀的存在或不存在区分的多个变量编码正则表达式-6ren

r - 在 pivot_longer 的 names_pattern 参数中为通过前缀的存在或不存在区分的多个变量编码正则表达式

转载作者：行者123 更新时间：2023-12-04 03:22:28

25

4

我有一个数据集，我需要 pivot_longer() 在其列中包含两种变量:数量和比例。数量在物种名称下输入，比例在 P 下输入，然后是物种名称。每行代表一个小时采样周期的数据。

这是我正在处理的数据的简化版本。(编辑:我在代码中添加了另一列 RH_percent，以帮助改进正则表达式。)

#code to recreate input data
sampledata <- read_csv("date,time,RH_percent,Cx_tarsalis,Ps_columb,PCx_tarsalis,PPs_columb
2020-07-20,19:00:00,0.25,3,4,0.03,0.04
2020-07-20,20:00:00,0.5,6,8,0.06,0.08
2020-07-20,21:00:00,0.75,9,12,0.09,0.12")

这就是我希望输出的样子:

#code to recreate desired output data
sampleoutput <- read_csv("date,time,RH_percent,species,quantity,P
         2020-07-20,19:00:00,0.25,Cx_tarsalis,3,0.03
         2020-07-20,19:00:00,0.25,Ps_columb,4,0.04
         2020-07-20,20:00:00,0.5,Cx_tarsalis,6,0.06
         2020-07-20,20:00:00,0.5,Ps_columb,8,0.08
         2020-07-20,21:00:00,0.75,Cx_tarsalis,9,0.09
         2020-07-20,21:00:00,0.75,Ps_columb,12,0.12")

我知道代码看起来像这样，我知道我需要在 names_pattern 参数中指定一个正则表达式:

sampledata %>% pivot_longer(cols = -c(date,time),
                            names_to = c(".value","species"),
                            names_pattern = "")

我一直在网上研究例子，包括 Pivoting vignette和 Roger Peng's regexp videos on youtube但没有找到正确的 names_pattern 来获得我需要的输出。

解决了类似的问题:pivot_longer multiple variables of different kinds ，但是变量在列中的表示方式以及正则表达式中的模式与我需要的有很大不同。谢谢!

最佳答案

这是一种使用renameing

的方法

通过添加后缀 -quantity 重命名第 3 列和第 4 列
通过添加后缀 -P 重命名第 5 列和第 6 列
使用names_sep作为-并指定names_to的顺序species, .value 在 pivot_longer

library(dplyr)
library(stringr)
library(tidyr)
sampledata %>%
    rename_with(~ str_c(., '-quantity'), 3:4) %>%
    rename_with(~ str_c(str_remove(., '^P'), '-P'), 5:6) %>%    
   pivot_longer(cols = -c(date,time),
                            names_to = c("species", ".value"),
                            names_sep = "-")

-输出

# A tibble: 6 x 5
  date       time   species     quantity     P
  <date>     <time> <chr>          <dbl> <dbl>
1 2020-07-20 19:00  Cx_tarsalis        3  0.03
2 2020-07-20 19:00  Ps_columb          4  0.04
3 2020-07-20 20:00  Cx_tarsalis        6  0.06
4 2020-07-20 20:00  Ps_columb          8  0.08
5 2020-07-20 21:00  Cx_tarsalis        9  0.09
6 2020-07-20 21:00  Ps_columb         12  0.12

或者另一种方法只是添加一个前缀，其中列名在 _ 之前只有两个字符，即那些是数量列“Q”。然后，在 names_pattern 中，捕获第一个字符 ((.)) 作为第一个捕获组，然后是其余字符 ((.*)) 作为第二个，它将表示 names_to

中指定的“.value”和“species”

sampledata %>%
     rename_with(~ str_c('Q', .), matches('^.._')) %>% 
     pivot_longer(cols = -c(date, time), 
        names_to = c(".value", "species"), names_pattern = "^(.)(.*)") %>% 
     rename(quantity = Q)
# A tibble: 6 x 5
  date       time   species     quantity     P
  <date>     <time> <chr>          <dbl> <dbl>
1 2020-07-20 19:00  Cx_tarsalis        3  0.03
2 2020-07-20 19:00  Ps_columb          4  0.04
3 2020-07-20 20:00  Cx_tarsalis        6  0.06
4 2020-07-20 20:00  Ps_columb          8  0.08
5 2020-07-20 21:00  Cx_tarsalis        9  0.09
6 2020-07-20 21:00  Ps_columb         12  0.12

更新

对于 OP 的新数据集，在 matches 中使用 ignore.case = FALSE 因为默认情况下它是 TRUE

sampledata %>%
     rename_with(~ str_c('Q', .), matches('^[A-Z][a-z]_[a-z]', 
       ignore.case = FALSE)) %>% 
     pivot_longer(cols = -c(date, time, RH_percent), 
        names_to = c(".value", "species"), names_pattern = "^(.)(.*)") %>% 
     rename(quantity = Q)

-输出

# A tibble: 6 x 6
  date       time   RH_percent species     quantity     P
  <date>     <time>      <dbl> <chr>          <dbl> <dbl>
1 2020-07-20 19:00        0.25 Cx_tarsalis        3  0.03
2 2020-07-20 19:00        0.25 Ps_columb          4  0.04
3 2020-07-20 20:00        0.5  Cx_tarsalis        6  0.06
4 2020-07-20 20:00        0.5  Ps_columb          8  0.08
5 2020-07-20 21:00        0.75 Cx_tarsalis        9  0.09
6 2020-07-20 21:00        0.75 Ps_columb         12  0.12

关于r - 在 pivot_longer 的 names_pattern 参数中为通过前缀的存在或不存在区分的多个变量编码正则表达式，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/68230596/

25

4

0

mysql - 连接的子查询(存在/存在)
SELECT *, `o_cheque_request.member_id`, `o_cheque_request.wallet_id` FROM `o_cheque_request`, `o_mem
SQL查找是否"存在"，别再count了！
根据某一条件从数据库表中查询『有』与『没有』，只有两种状态，那为什么在写SQL的时候，还要**SELECT count(*)**呢？无论是刚入道的程序员新星，还是精湛沙场多年的程序员老白，都是一如
c# - 存在、读写只需一步
我试图找出一个文件是否存在，如果存在，验证css样式是否已经存在，如果不存在，将它们写在文件末尾... 我已经完成了这一切，但分 3 个步骤: 该文件是否存在？ FileInfo fi= new Fi
android - 如何检测iOS用户或Android用户是否“存在”？
我们正在开发即时消息传递应用程序，并且需要在用户的化身上用绿点显示用户 friend 的“状态”。 “状态”远远超出了“my_app_is_opened_and_on_focus”，这意味着(我猜可能
SQL 查询不存在，存在
模式 Movie(title, year, director, budget, earnings) Actor(stagename, realname, birthyear) ActedIn(stag
MySQL 触发器语法错误 IF 存在
我有一个正在尝试创建的 MySQL 触发器，但无法获得正确的语法。触发器应该遍历一组关键字并将其与插入数据库的新帖子的标题进行匹配。如果找到匹配项，它应该将新帖子分配给该存储桶并更新存储桶的关键字集
MYSQL 选择子查询 IF 存在
我有 3 个表......用户、更新和碰撞。我想向发出 api 请求的用户返回最新订单的 feed 更新，并提供显示 feed 中每个状态所需的所有数据。我还需要包括更新是否已被发出 api 请求的
ios - UIViewController 存在
我正在尝试呈现一个带有 UIView 的 UIViewController。以下是我在 viewDidLoad 方法中尝试的代码。 //create the view controller UIVi
mysql - 如何在一个查询中进行多个计数/存在？
我正在努力弄清楚如何在不对 mysql 进行两次调用的情况下从一个表中检查两件事。我有一个 Members 表。我想测试MemberID 列中是否存在某个值，以及PhoneNumber 列中是否存在
vba - 循环没有 Do 错误但 Do 存在
以下代码给出了一个没有 Do Compile 错误的循环: Loop Sheets("Snap").Rows(1).AutoFilter Field:=5, Criteria1:=List
dns - 域名通过 "dig"存在
是否可以通过检查“dig”的输出来检查域名的存在？在绑定(bind)源中，我发现了这些常量: 0 DNS_R_NOEROR 1 DNS_R_FORMERR 2 DNS_R_SERVFAIL 3 DN
php - Controller 存在，但找不到页面
Controller 有问题我在 Windows 上使用服务器，一切正常，但在互联网上我试图访问页面 social_apartament/beauty_life/并且找不到该页面，代码错误 404这
d - 存在 `static if`时如何生成文档
/** This is struct S. */ struct S(T) { static if(isFloatingPoint!T) { /// This version works
clojure - 类型删除如何帮助 Clojure 存在？
JVM 类型删除如何帮助 Clojure？没有它，Clojure 还能存在吗？如果 JVM 有具体化的类型会发生什么？也就是说，Clojure 将如何改变？最佳答案 Clojure 根本不会有太大变
c - 为什么 system() 存在？
许多论文等提到对“system()”的调用是不安全且不可移植的。我不反对他们的论点。不过，我注意到许多 Unix 实用程序都有一个等效的 C 库。如果没有，源可用于各种这些工具。虽然许多论文和此类
javascript - js如何让一个变量值根据用户登录 Node 存在
在我的 Node js 应用程序中，我有一个用户登录 api。上面我在服务器端代码中创建了一个名为 customerid 的变量。现在，当用户身份验证成功时。我将他的 userid 值存储在我的 cu
azure - 存在 DNS 详细信息时重用资源管理器模板
我有一个工作资源管理器组，由 Ubuntu 14.04 虚拟机、网络接口(interface)、公共(public) IP 地址和存储帐户组成。我已经从这组资源中创建了一个模板。当我尝试部署这组资源
javascript - 存在 javascript 循环引用问题
我有一个函数createminor4(arr，锦标赛)它基本上将arr分成4组，每组8人，然后将它们一次交换到tourney 1组。从那里它插入四个{}，其中有 4 个带有空数组的键。我已经在 Ch
r - 存在 2 个图例时如何更改图例点的大小
我有一个图表，其中有两个图例。我需要更改其中一个图例的点的大小。我需要更改图例中“市场类型”的项目符号大小。我使用示例 here但不适用于我的图表。我的代码如下: k <- ggplot(subs
javascript - 存在 jQuery 字符串比较问题
我有 fiddle here展示我正在尝试做的事情。我有一个动态生成的表，因此列可以按用户选择的任何顺序显示。因此，我尝试获取两个特定 header 的索引，以便可以将 CSS 类添加到这两列以供稍

首页

博学

6Ren·AI

商城

r - 在 pivot_longer 的 names_pattern 参数中为通过前缀的存在或不存在区分的多个变量编码正则表达式

更新