逐行操作、选择助手和 dplyr 中的 mutate 函数-6ren

逐行操作、选择助手和 dplyr 中的 mutate 函数

转载作者：行者123 更新时间：2023-12-02 19:58:14

25

4

我将使用以下数据集来说明我的问题:

my_df <- data.frame(
    a = 1:10,
    b = 10:1
)
colnames(my_df) <- c("a", "b")

第 1 部分

我使用 mutate() 函数在数据集中创建两个新变量，我想计算同一 mutate()< 内两个新列的行均值 调用。但是，我真的希望能够使用 select() 帮助器，例如 starts_with()、ends_with() 或 包含()。

我的第一次尝试:

 my_df %>%
    mutate(
        a_2 = a^2,
        b_2 = b^2,
        mean = rowMeans(select(ends_with("2")))
    )
Error in mutate_impl(.data, dots) : 
  Evaluation error: No tidyselect variables were registered.

我明白为什么会出现错误 - select() 函数没有给出任何 .data 参数。所以我更改了代码...

...我第二次尝试在 select() 函数中添加“.”:

my_df %>%
    mutate(
        a_2 = a^2,
        b_2 = b^2,
        mean = rowMeans(select(., ends_with("2")))
    )
    a  b a_2 b_2 mean
1   1 10   1 100  NaN
2   2  9   4  81  NaN
3   3  8   9  64  NaN
4   4  7  16  49  NaN
5   5  6  25  36  NaN
6   6  5  36  25  NaN
7   7  4  49  16  NaN
8   8  3  64   9  NaN
9   9  2  81   4  NaN
10 10  1 100   1  NaN

第二次尝试后的新问题是 mean 列不包含预期的 a_2 和 b_2 平均值，而是包含仅限 NaN。研究了一下代码后，我明白了第二个问题。 select() 函数中添加的“.”引用的是原始 my_df 数据框，该数据框没有 a_2 和 b_2 列。因此，产生 NaN 是有道理的，因为我要求 R 计算不存在值的均值。

然后我尝试使用 dplyr 函数，例如 current_vars() 来看看它是否会产生影响:

 my_df %>%
    mutate(
        a_2 = a^2,
        b_2 = b^2,
        mean = rowMeans(select(current_vars(), ends_with("2")))
    )
Error in mutate_impl(.data, dots) : 
  Evaluation error: Variable context not set.

但是，这显然不是这个函数的使用方式。解决方案是简单地添加第二个 mutate() 函数:

 my_df %>%
    mutate(
        a_2 = a^2,
        b_2 = b^2
    ) %>%
    mutate(mean = rowMeans(select(., ends_with("2"))))
    a  b a_2 b_2 mean
1   1 10   1 100 50.5
2   2  9   4  81 42.5
3   3  8   9  64 36.5
4   4  7  16  49 32.5
5   5  6  25  36 30.5
6   6  5  36  25 30.5
7   7  4  49  16 32.5
8   8  3  64   9 36.5
9   9  2  81   4 42.5
10 10  1 100   1 50.5

问题 1:有没有办法在同一个 mutate() 调用中执行此任务？无论如何，使用第二个 mutate() 函数并不是真正的问题；但是，我很想知道是否存在一种方法来引用当前存在的变量。 mutate() 函数允许在同一 mutate() 调用中创建变量后立即使用它们；但是，当函数如上面的示例所示嵌套时，这就会出现问题。

第 2 部分

我还意识到使用 rowMeans() 在我的解决方案中有效；然而，它并不是真正的 dplyr 做事方式，特别是因为我需要在其中使用 select() 。因此，我决定改用 rowwise() 和 mean() 函数。但再一次，我想使用 select() 帮助器之一来实现此目的，而不必列出 c() 函数中的所有变量。我尝试过:

 my_df %>%
    mutate(
        a_2 = a^2,
        b_2 = b^2
    ) %>%
    rowwise() %>%
    mutate(
        mean = mean(ends_with("2"))
    )
Error in mutate_impl(.data, dots) : 
  Evaluation error: No tidyselect variables were registered.

我怀疑代码中的错误是由于 ends_with() 不在 select() 内部，但我显示此错误是为了询问是否存在是一种列出我想要的变量而无需单独指定它们的方法。

感谢您的宝贵时间。

最佳答案

有点晚了，但这里是问题1的解决方案，供引用。

如果你必须在没有管道的情况下完成它，你会写:

tmp1 = mutate(my_df, a_2 = a^2, b_2 = b^2)
tmp2 = select(tmp1, ends_with("2"))
tmp3 = rowMeans(tmp2)
tmp4 = mutate(tmp1, m=tmp3)

或者，减少中间步骤:

tmp1 = mutate(my_df, a_2 = a^2, b_2 = b^2)
tmp4 = mutate(tmp1, m=rowMeans(select(tmp1, ends_with("2"))) )

请注意，计算 tmp4 需要使用 tmp1 两次。因此，在管道版本中，您还需要第二次显式引用 . (像往常一样，第一个引用是隐式的，作为 mutate 的第一个参数):

my_df %>%
  mutate(a_2 = a^2, b_2 = b^2) %>%
  mutate(mean = rowMeans(select(., ends_with("2"))) )

对于问题 #2:避免调用 rowMeans 比较棘手，而且可能并不理想(？)

关于逐行操作、选择助手和 dplyr 中的 mutate 函数，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/48353331/

25

4

0

文章推荐： Firebase REST API 与 JS 客户端库

文章推荐： makefile - 使用 MinGW/MSYS 编译 OpenSSL 时出错

文章推荐： scala - 如何使用 Reads 对 JsValue 进行模式匹配

文章推荐： Firebase 集合组查询 Id/Key

逐 block 读取文件时Python不返回所有数据
我正在使用 python 加密一些文件，但我在逐 block 读取文件时遇到问题。有时不会返回最后一个 block 的所有数据。当文件长度为 307200 字节时，我没有问题。当它的长度为 279
html - 逐 block 下载文件客户端
我正在使用 WebRTC 将文件发送到连接的对等方，并且我正在以块的形式发送文件。但是，我无法弄清楚如何让对等方在文件逐块流入时保存/下载文件。我在网上找到的所有例子都推荐做这样的事情: // se
c++ - 逐 block 移动
我用 Tiled 做了一张 map 。它的每一 block 图 block 都尺寸为 32x32 像素，我的主要角色 Sprite 也是。在我的类(class) Player.cpp 中，我有一些计
jquery - 逐 block 滚动站点
我见过一些单页网站，您可以逐 block 滚动，因此您没有无限滚动。你逐 block 移动。是否有提供此功能的任何脚本或其他东西？最佳答案我自己从未使用过它，所以我无法在代码方面为您提供帮助，
c - 逐 block 反转文件内容
这是一个逐 block 反转文件内容的程序。 #include #include #define BS 12 void reverse(char * buffer, int size) { c
c - 逐 block 传输优化循环
在下面的代码中，有没有办法避免 if 语句？ s = 13; /*Total size*/ b = 5; /*Block size*/ x = 0; b1 = b; while(x s)
c++ - 逐 block 模糊图像
我正在尝试分割输入图像并逐个对其进行模糊处理，但毕竟对相邻图 block 调用 cv::blur 我得到了边界像素，这与我有一次将 cv::blur 集体应用于整个图像。 Mat upper(im,
java - 逐 block 读取文件
我想逐个读取文件。该文件被分成几部分，存储在不同类型的媒体上。我目前所做的是调用文件的每个单独部分，然后将其合并回原始文件。问题是我需要等到所有 block 都到达后才能播放/打开文件。是否可以在
json - 逐 block 解析 JSON
我有一个包含客户和日期列表的 JSON 文件。文件看起来像这样: { "Customers": [ { "Customer": "Customer Name Here", "Company"
http - golang从套接字解析分块的HTTP响应-逐 block 读取
我的邮件目标是从连接到HTTP服务器的TCP套接字读取数据，然后解析 HTTP响应块(传输编码:分块)-服务器在同一连接上每30秒发送一个块我附上了我的代码。看起来io.Copy读取第一个块，然后等
python - Numpy 逐 block 减少操作
我认为自己是一位经验丰富的 numpy 用户，但我无法找到以下问题的解决方案。假设有以下数组: # sorted array of times t = numpy.cumsum(numpy.rando
git - 逐 block 应用提交 block
当我将文件添加到暂存区时，我可以 $ git add my_file -p 然后选择我要暂存的 block 。有没有办法 merge/挑选一个提交并逐 block 应用它的差异？谢谢最佳答案我
c# - 逐 block 迭代 mongodb 结果
我有一个 mongodb 查询，它获取大约 50,000 个大文档。这对我的 RAM 来说太多了，因此计算机速度变慢了。现在我想逐 block 迭代 mongodb 结果。我想获取前 1000
java - RSA 逐 block 加密对大于 1kb 的文件产生空白输出
我不会为 AES 或其他加密打开此线程，因为这是我要用来加密 AES 和其他加密的 key 的内容。我从 StackOverflow 和其他一些网站收集了一些代码，并对其进行了编辑以适合我的程序，但是
linux - 逐 block 处理日志，每个 block 包含多行
我在做一些后台工作时尝试收集所有系统统计数据。例如，我使用以下命令来收集 IO 统计信息: iostat -xty 5 此脚本用于每 5 秒收集一次 I/O 统计信息。所以我的日志会包含很多数据 bl
php - 使用 php curl 逐 block 下载大文件
我需要 php 脚本，用于从 url 到服务器的可恢复文件下载。它应该能够开始下载，然后在捕捉时(30 秒 - 5 分钟)恢复，依此类推，直到完成整个文件。 perl 中有类似的东西 http://c
逐 block 读取/打印文件的 Linux shell 命令
是否有标准的 Linux 命令可用于逐 block 读取文件？例如，我有一个大小为 6kB 的文件。我想读取/打印第一个 1kB，然后是第二个 1kB ...似乎 cat/head/tail 在这种情
scala - 如何使用 Spark Structured Streaming 逐 block 处理文件？
我正在处理大量文件，我想逐 block 处理这些文件，假设在每批处理中，我想分别处理每 50 个文件。如何使用 Spark Structured Streaming 来实现？我看到 Jacek L
scala - 如何使用 Spark Structured Streaming 逐 block 处理文件？
我正在处理大量文件，我想逐 block 处理这些文件，假设在每批处理中，我想分别处理每 50 个文件。如何使用 Spark Structured Streaming 来实现？我看到 Jacek L
c++ - 如何使用 openJPEG C++ 逐 block 读取 JP2
我想知道:逐 block 读取 jp2 并将数据存储在缓冲区对象中的预期方法是什么？现在我正在做类似的事情。 /* note I already created stream and configu

首页

博学

6Ren·AI

商城

逐行操作、选择助手和 dplyr 中的 mutate 函数