gpt4 book ai didi

r - 比 strsplit() 在 R 中将字符串分成两部分的内存效率更高的方法

转载 作者:行者123 更新时间:2023-12-02 07:17:59 24 4
gpt4 key购买 nike

我有一个 1.8m 的字符串,我需要将它拆分为 50 个字符串,该字符串出现一次非常接近 1.8m 字符串的开头(大约 10k 个字符)

使用strsplit() 错误

long_string %>% strsplit(., fifty_character_string)

# Error: C stack usage 9065064 is too close to the limit

我已尝试使用 this 解决特定错误方法,和this问题,但到目前为止还没有运气。

所以现在我正在研究是否有一种内存效率更高的方法来将一个很长的字符串分成两部分。我不太可能需要多次执行此操作,因此我愿意接受可以完成工作的 hacky 方法

最佳答案

以下是执行此操作的不同方法的快速比较:

library(stringi)
library(dplyr)

# get some sample data
set.seed(1)
long_string <- stri_paste(stri_rand_lipsum(10000), collapse = " ")
x <- sample(9000:11000, 1)
split_string <- substr(long_string, x, x + 49)

result <- long_string %>% strsplit(., split_string)
length(unlist(result))
#> [1] 2

substr_fun <- function(str, pattern) {
idx <- regexpr(pattern, str, fixed = TRUE)
res1 <- list(c(substr(str, 1, idx-1), substr(str, idx + attr(idx, "match.length"), nchar(str))))
return(res1)
}

bench::mark(
strsplit_dplyr = long_string %>% strsplit(., split_string),
strsplit_dplyr_fixed = long_string %>% strsplit(., split_string, fixed = TRUE),
strsplit = strsplit(long_string, split_string),
strsplit_fixed = strsplit(long_string, split_string, fixed = TRUE),
stri_split_fixed = stringi::stri_split_fixed(long_string, split_string),
str_split = stringr::str_split(long_string, stringr::fixed(split_string)),
substr_fun = substr_fun(long_string, split_string)
)
#> # A tibble: 7 x 6
#> expression min median `itr/sec` mem_alloc `gc/sec`
#> <bch:expr> <bch:tm> <bch:tm> <dbl> <bch:byt> <dbl>
#> 1 strsplit_dplyr 131ms 134.8ms 7.44 280B 0
#> 2 strsplit_dplyr_fixed 36.6ms 37.6ms 26.5 280B 0
#> 3 strsplit 133ms 133.8ms 7.40 0B 0
#> 4 strsplit_fixed 35.4ms 37.2ms 26.7 0B 0
#> 5 stri_split_fixed 40.7ms 42.5ms 23.6 6.95KB 0
#> 6 str_split 41.6ms 43.1ms 23.4 35.95KB 0
#> 7 substr_fun 13.6ms 14.8ms 67.1 0B 0

就内存使用而言,strsplit 带有选项 fixed = TRUE 且没有管道开销是最好的解决方案。 stringistringr 中的实现似乎快了一点,但它们在内存方面的开销甚至比管道的影响更大。

更新

我添加了来自 @H 1 的方法答案以及他获得 50 个字符的子字符串以用于拆分的方法。唯一的变化是我将它包装在一个函数中并再次添加 fixed = TRUE 因为我认为在这种情况下它更有意义。

如果您不想在字符串中进行多次拆分,那么新函数无疑是赢家!

关于r - 比 strsplit() 在 R 中将字符串分成两部分的内存效率更高的方法,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/55919893/

24 4 0
Copyright 2021 - 2024 cfsdn All Rights Reserved 蜀ICP备2022000587号
广告合作:1813099741@qq.com 6ren.com