r - 直接从R中的网址读取压缩的csv-6ren

r - 直接从R中的网址读取压缩的csv

转载作者：行者123 更新时间：2023-12-03 14:08:11

26

4

我正在寻找下载压缩的csv并将其作为R对象加载，而不先将其保存到磁盘。我可以对压缩文件执行此操作，但似乎无法使其与gzfile或gzcon一起使用。

例:

grabRemote <- function(url) {
    temp <- tempfile()
    download.file(url, temp)
    aap.file <- read.csv(gzfile(temp), as.is = TRUE)
    unlink(temp)
    return(aap.file)
}
grabRemote("http://dumps.wikimedia.org/other/articlefeedback/aa_combined-20110321.csv.gz")

那会下载一个包含 Wikipedia article feedback data的(小)gz压缩文件(虽然不重要，但这只是表明它不是巨大的或有害的)。

我拥有的代码可以正常工作，但是我觉得通过创建和销毁临时文件会丢失一些非常明显的东西。

最佳答案

我几乎可以肯定我曾经回答过这个问题。结果是R的 Connections API(file()，url()，pipe()，...)可以即时进行解压缩，我认为您无法对远程http对象进行解压缩。

因此，您已经描述了非常简单的两步操作:将download.file()与tempfile()结果一起用作第二个参数，以获取压缩文件，然后从中读取文件。作为tempfile()对象，它将在R session 结束时自动清除，因此我建议的一个较小的修复方法是跳过unlink()(但是我喜欢显式清除，因此您最好也保留它)。

编辑:知道了:

con <- gzcon(url(paste("http://dumps.wikimedia.org/other/articlefeedback/",
                       "aa_combined-20110321.csv.gz", sep="")))
txt <- readLines(con)
dat <- read.csv(textConnection(txt))

dim(dat)
# [1] 1490   19

summary(dat[,1:3])
# aa_page_id       page_namespace                 page_title  
# Min.   :     324   Min.   :0      United_States        :  79  
# 1st Qu.:   88568   1st Qu.:0      2011_NBA_Playoffs    :  52  
# Median : 2445733   Median :0      IPad_2               :  43  
# Mean   : 8279600   Mean   :0      IPod_Touch           :  38  
# 3rd Qu.:16179920   3rd Qu.:0      True_Grit_(2010_film):  38  
# Max.   :31230028   Max.   :0      IPhone_4             :  26  
# (Other)              :1214

关键是 gzcon帮助提示它可以对现有流进行解压缩。然后，我们需要稍微绕开 readLines，然后通过 textConnection进行读取，因为 read.csv想要在数据中来回移动(我想验证列宽)。

关于r - 直接从R中的网址读取压缩的csv，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/9548630/

26

4

0

文章推荐： svn - 如何在 svn 存储库中设置权限？

文章推荐： asp.net-mvc - MVC ASP.NET 或 Razor

javascript - 在 Node Express 应用程序中设置通用路由。 (网址/索引、网址/索引2、网址/索引3...)
我正在通过 NodeSchool.io 练习学习 React 和 Express 框架。我想将所有练习文件存储在具有多个页面的单个应用程序中，例如索引索引2 索引3 索引4 .... local
java - 这种变量在 Android 中意味着什么？ (网址...网址，整数...进度)
从这里:http://developer.android.com/reference/android/os/AsyncTask.html doInBackground(URL... urls) onP
email - 如何解决垃圾邮件中的/@网址？
我最近收到了一封电子邮件，其中包含以下内容(请勿点击!): UNS 这是原始电子邮件的链接:https://gist.github.com/anonymous/16963a230cab0a3a1bc
Android TextView 网址
在 android 中，可以单击带有 URL 的 TextView 以在网络中打开 URL，方法是: android:autoLink="web" 我想做的是捕获这次点击，如果这个 TextView
javascript - channel 网址
我在我的网站上以 mysite.anotherdomain.org 的形式实现 Facebook 登录。我在 JavaScript SDK 的文档中做了所有解释，但由于我遇到了一些问题，我想知道错误是
javascript - 从窗口位置获取值。网址
我在 window.location.href 中有响应网址，我需要其中的 error、error_description 和 state 的值 http://localhost:4200/#erro
javascript - 当用户到达底部时如何加载新页面/网址
我正在创建无限加载，意味着当用户到达页面底部/特定 div 时会加载新页面。目前我有这个代码可以在点击时加载新页面。 $("#about").click(function(){ // load
web - 如何告诉像谷歌这样的搜索引擎显示它的标签/网址？
当我们在谷歌引擎中搜索时，它也会显示热门网站标签或链接。就像我们搜索“bing”或“net beans”时一样。问:它如何显示这些链接。我们是否必须告诉它显示这些链接。问:它是否与 sitemap
php 网址 explode
我想从我的网址中获取我的产品。例如: http://www.website.com/product-category/iphone 我想获取 iphone，这对我的代码来说没问题，但我有一个下拉菜单来
Pythonanywhere，如何使用静态文件？网址？
我对 Pythonanywhere 完全陌生，我不知道为什么静态文件没有加载...这是我存储 css 和图像的路径，即 static/images/wikiLang.png 等 /static/adm
regex - 正则表达式 Youtube 网址
我正在使用这个正则表达式来验证 youtube 网址。 ^http:\/\/(?:www\.)?youtube.com\/watch\?(?=.*v=\w+)(?:\S+)?$ 它很好用。但我有这个
url - 我如何使用这个 github 网址？
我刚刚在 gist.github 上传了一个我正在处理的小编码项目，因为它似乎是一次上传几个类的好方法。我想将某人与我的“要点”联系起来，并在角落里写着: Public Clone URL: git
jquery - 正则表达式验证 Twitter 网址
我正在使用 jQuery 验证引擎来解析我的表单数据: https://github.com/posabsolute/jQuery-Validation-Engine 验证 Twitter URL 的
Django utf-8 网址
我有一个 Django 应用程序，它可以在 localhost 上正常工作。即使对于 utf-8 URL 路径也是如此。但是当我在生产中使用它时，它给了我一个错误: 2019-09-01 14:32:
image - Laravel Assets 网址
我已经安装了Laravel并开始尝试编写一个应用程序。我在/ app所在的目录中为 Assets 创建了一些目录。但是，当我尝试访问本地主机中的图像时，例如:http://localhost/asse
video - 批量检查 YouTube 网址
我们正在寻找一种方法来检查一长串 YouTube 网址，以查找目前私有(private)、已删除或不再可用的视频。我们可以检查状态，但即使视频不再公开可用，URL 也会返回 200。例如这两个: ht
YouTube 直播 RTMP 网址
我在 YouTube 上有现场事件，我想在我的网站上播放它。我想将我的事件设为私有(private)，获取它的 RTMP 广播 URL 并将其粘贴到我的网站上，在 JWPlayer 中。那可能吗？
nginx - 如何防止谷歌索引我的 https 网址？
当我在谷歌上搜索我的域时，它会显示我网站上的几个 https 网址，因为谷歌喜欢 https，但出于特殊原因我不想索引 https/ssl 版本。如何避免这种情况，全世界都只通过 htaccess
php - 如何在PHP中获取网页的当前完整网址(网址+片段)？
我想获取在 Salesforce.com 授权期间作为回调收到的当前 URL。 url 中的数据位于片段部分。最佳答案您可以使用 $_SERVER['HTTP_HOST'] 和 $_SERVER[
angularjs - 如何刷新 iframe 网址？
我正在使用 ionic 创建一个应用程序，其中我使用 iframe 显示 URL。这是 HTML 代码: 这是 Angular js: $scope.iframeHeight = windo

首页

博学

6Ren·AI

商城

r - 直接从R中的网址读取压缩的csv