r - 避免在 R 中的 foreach 循环中增加内存-6ren

r - 避免在 R 中的 foreach 循环中增加内存

转载作者：行者123 更新时间：2023-12-03 17:37:43

25

4

我尝试创建结合两个不同空间数据集的汇总统计数据:一个大栅格文件和一个多边形文件。这个想法是获取每个多边形内栅格值的汇总统计信息。

由于栅格太大而无法立即处理，我尝试创建子任务并并行处理它们，即处理 SpatialPolgyonsDataframe 中的每个多边形。立刻。

代码运行良好，但是经过大约 100 次交互后，我遇到了内存问题。这是我的代码以及我打算做什么:

# session setup
library("raster")
library("rgdal")

# multicore processing. 
library("foreach")
library("doSNOW")
# assign three clusters to be used for current R session
cluster = makeCluster(3, type = "SOCK",outfile="")
registerDoSNOW(cluster)
getDoParWorkers()# check if it worked

# load base data
r.terra.2008<-raster("~/terra.tif")
spodf.malha.2007<-readOGR("~/,"composed")

# bring both data-sets to a common CRS
proj4string(r.terra.2008)
proj4string(spodf.malha.2007)
spodf.malha.2007<-spTransform(spodf.malha.2007,CRSobj = CRS(projargs = proj4string(r.terra.2008)))
proj4string(r.terra.2008)==proj4string(spodf.malha.2007) # should be TRUE

# create a function to extract areas
function.landcover.sum<-function(r.landuse,spodf.pol){
  return(table(extract(r.landuse,spodf.pol)))}

# apply it one one subset to see if it is working
function.landcover.sum(r.terra.2008,spodf.malha.2007[1,])

## parallel loop
# define package(s) to be use in the parallel loop
l.packages<-c("raster","sp")

# try a parallel loop for the first 6 polygons
l.results<-foreach(i=1:6,
                   .packages = l.packages) %dopar% {
                     print(paste("Processing Polygon ",i, ".",sep=""))
                     return(function.landcover.sum(r.terra.2008,spodf.malha.2007[i,]))
                     }

这里的输出是一个看起来像这样的列表。

l.results

[[1]]

9     10 
193159   2567 

[[2]]

7    9   10   12   14   16 
17  256 1084  494   67   15 

[[3]]

3      5      6      7      9     10     11     12 
2199   1327   8840   8579 194437   1061   1073   1834 
14     16 
222   1395 

[[4]]

3      6      7      9     10     12     16 
287    102    728 329057   1004   1057     31 

[[5]]

3      5      6      7      9     12     16 
21      6     20    495 184261   4765     28 

[[6]]

6    7    9   10   12   14 
161  161  386  943  205 1515

所以结果相当小，不应该是内存分配问题的根源。因此，在具有 >32.000 行的整个多边形数据集上的以下循环创建了大约 100 次迭代后超过 8GB 的内存分配。

# apply the parallel loop on the whole dataset
l.results<-foreach(i=1:nrow(spodf.malha.2007),
                   .packages = l.packages) %dopar% {
                     print(paste("Processing Polygon ",i, ".",sep=""))
                     return(function.landcover.sum(r.terra.2008,spodf.malha.2007[i,]))
                     # gc(reset=TRUE) # does not resolve the problem
                     # closeAllConnections()  # does not resolve the problem
                   }

我究竟做错了什么？

编辑:
我尝试(如评论中建议的那样)在内部循环中的每次迭代后删除对象，但它没有解决问题。我还尝试通过首先将对象传递给环境来解决多个数据导入的最终问题:

clusterExport(cl = cluster,
              varlist = c("r.terra.2008","function.landcover.sum","spodf.malha.2007"))

没有大的变化。我的 R 版本在 linux 平台上是 3.4，所以据说第一条评论中的链接补丁也应该已经包含在这个版本中。我也试过 parallel第一条评论中建议的包，但没有出现差异。

最佳答案

你可以试试exact_extract在 exactextractr包裹。是从栅格中提取值的最快且内存更安全的函数。 main 函数是用 C++ 实现的，通常不需要并行化。由于您没有提供任何示例数据，我发布了一个包含真实数据的示例:

library(raster)
library(sf)
library(exactextractr)


# Pull municipal boundaries for Brazil
brazil <- st_as_sf(getData('GADM', country='BRA', level=2))

# Pull gridded precipitation data
prec <- getData('worldclim', var='prec', res=10)
#transform precipitation data in a dummy land use map
lu <- prec[[1]]
values(lu) <- sample(1:10,ncell(lu),replace = T)
plot(lu)

#extract land uses class for each pixel inside each polygon
ex <- exact_extract(lu, brazil)
#apply table to the resulting list. Here I use just the first 5 elements to avoid long output

lapply(ex[1:5],function(x){
  table(x[,1])#note that I use x[,1] because by default exact_extract provide in the second column the coverage fraction of each pixel by each polygon
})

这里的示例输出:

[[1]]

 1  2  4  6  7  9 10 
 1  1  1  2  3  1  1 

[[2]]

 2  3  4  5  6  7  8 10 
 2  4  3  2  1  2  2  2 

[[3]]

 1  2  4  6  7  8  9 10 
 4  5  1  1  4  2  5  5 

[[4]]

 1  2  3  4  5  6  7  8  9 10 
 2  2  4  2  2  4  1  4  1  2 

[[5]]

 3  4  5  6  8 10 
 2  3  1  1  2  3

关于r - 避免在 R 中的 foreach 循环中增加内存，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/44507456/

25

4

0

文章推荐： chrome-custom-tabs - android.support.customtabs.extra.KEEP_ALIVE

select - 增加 FD_SETSIZE
我需要从 1024 增加 FD_SETSIZE 值至 4096 .我知道最好使用 poll()/epoll()但我想了解什么是优点/缺点。主要问题是:我要重新编译glibc吗？ ?我读了几个线程，其中
无法理解C中减少/增加 'for'的逻辑
已关闭。这个问题是 not reproducible or was caused by typos 。目前不接受答案。这个问题是由拼写错误或无法再重现的问题引起的。虽然类似的问题可能是 on-top
javascript - 增加/减少屏幕上的值的按钮
我在 HTML 文件中有这样的内容: var value = 0; add(x){ x++; do
javascript - 增加/减少滚动变量
有没有办法在用户向上滚动时增加变量，并在用户使用 JavaScript 向下滚动时减少变量？变量没有最大值或最小值，如果能够调整灵敏度就好了。我不知道从哪里开始，感谢您的帮助! 编辑:没有滚动条，因为
ios 增加/减少tableview的大小
我是 ios 新手，遇到以下问题。我想根据表格 View 中元素的数量增加和减少表格 View 的高度大小。如果在输入时客户端在输出时给出 3 个或超过 3 个元素，我希望看到一个比默认行大 2 行
ios - 增加 NSIndexPath
所以我一直在四处搜索，似乎大多数人认为以下列方式递增 indexPath 是正确的方法: NSIndexPath *newIndexPath = [NSIndexPath indexPathForRo
ios - 增加 connSupervisionTimeout
我有一个关于 connSupervisionTimeout 的问题。我正在使用 CoreBluetooth 编写应用程序。我检查了连接参数和 connSupervisionTimeout = 720
javascript - 增加/减少滚动上的元素填充
我正在尝试根据页面的滚动位置更改元素的填充；当用户向下滚动页面时，填充会增加，而当他们向上滚动时，填充会减少。我的主要问题是滚动不是很流畅，有时如果我滚动到页面顶部太快，每次元素的填充大小都不一样。
增加 C 中自动数组的大小后出现编译器错误
我正在尝试计算 18456 个基因的相关性度量，但编译器 (Dev C) 在将宏 GENE 或 INDEX 增加到 4000 到 5000 之间的值后退出或大。例如，它适用于: # define GE
html - 增加:absolute位置的宽高
我有一个带有 position: absolute 和 CSS3 过渡的圆形元素(a 元素)。在 hover 事件中，我想增加圆的高度和宽度，但我想在所有边上添加像素，而不仅仅是在左侧或右侧。示例如
javascript - 增加/减少页面上所有元素字体大小的有效方法
为了改善用户体验，我计划在我网站的所有页面(A-、A、A+)上增加/减少/重置字体大小我面临的问题是页面上不同元素使用的字体大小不统一。有些是 14px，有些是 18px，有些是 12px，有些是
Yii框架数据库查询、增加、删除操作示例
本文实例讲述了Yii框架数据库查询、增加、删除操作。分享给大家供大家参考，具体如下： Yii 数据库查询模型代码： ?
使用SQL批量替换语句修改、增加、删除字段内容
sql替换语句，用该命令可以整批替换某字段的内容，也可以批量在原字段内容上加上或去掉字符。命令总解：update 表的名称 set 此表要替换的字段名=REPLACE(此表要替换的字段名, '原
sql不常用函数总结以及事务，增加，删除触发器
sql不常用函数总结以及事务，增加，删除触发器 distinct 删除重复行 declare @x 申明一个变量 convert(varchar(20),t
scala - 增加 Spark 的可用内存
要增加我使用的最大可用内存: export SPARK_MEM=1 g 或者我可以使用 val conf = new SparkConf() .setMaster("loca
flutter - 增加 AppBar 前导属性的宽度
我正在尝试将文本(自定义文本按钮)放入 AppBar 的前导属性中。但是，当文本太长时，文本会变成多行 Scaffold( appBar: AppBar( centerTi
netbeans - 增加 NetBeans 中输出和菜单的字体大小
我正在使用最新版本的 NetBeans，我需要增加输出和菜单的字体大小(不是代码部分)。我试过: netbeans_default_options=".... --fontsize 16" 但是当我将
height - 增加 gnuplot 输出的宽度和高度
我必须将 180000 个点绘制到一个 EPS 文件中。使用标准 gnuplot 输出尺寸点彼此太接近，这使得它们无法区分。有没有办法增加图像的宽度和高度？最佳答案是的。 set termina
html - 增加 Bootstrap 导航栏输入字段宽度
我有一个带有输入字段的 twitter bootstrap 3 导航栏。我想增加输入字段的宽度。我已尝试设置 col 大小，但它不起作用。 html比较长，请引用bootply http://www.
r - 增加 ggplot 标题中的下划线大小
我正在尝试增加 ggplot 标题中下划线的大小/宽度/厚度。我曾尝试使用大小、宽度和长度，但没有成功。这是我所做的一个例子。 test <- tibble(x = 1:5, y = 1, z =

首页

博学

6Ren·AI

商城

r - 避免在 R 中的 foreach 循环中增加内存