r - 抓取维基百科表格-6ren

r - 抓取维基百科表格

转载作者：行者123 更新时间：2023-12-04 09:38:17

25

4

我使用 r 抓取了一个维基百科表格

library(rvest)

url <- "https://en.wikipedia.org/wiki/New_York_City"
nyc <- url %>%
  read_html() %>%
  html_node(xpath = '//*[@id="mw-content-text"]/div/table[1]') %>%
  html_table(fill = TRUE)

并希望将值保存到新的数据框中。

输出

Area           population
468.484 sq mi  8,336,817

做这个的最好方式是什么？

最佳答案

从 OP 的示例输出来看，他们希望在与他们在问题中提供的不同的 xpath 中给出表格。请参阅以下工作流程，注意:名称已手动设置，以节省从行格式化字符串的麻烦:

# Initialise package in session: rvest => .GlobalEnv()
library(rvest)

# Store the url scalar: url => character vector 
url <- "https://en.wikipedia.org/wiki/New_York_City"

# Scrape the table and store it memory: nyc => data.frame
nyc <- 
  url %>%
  read_html() %>%
  html_node(xpath = '/html/body/div[3]/div[3]/div[4]/div/table[3]') %>%
  html_table(fill = TRUE) %>% 
  data.frame()

# Set the names appropriately: names(nyc) character vector
names(nyc) <- c("borough", "county", "pop_est_2019", 
                "gdp_bill_usd", "gdp_per_cap", 
                "land_area_sq_mi", "land_area_sq_km", 
                "density_pop_sq_mi", "density_pop_sq_km")

# Coerce the vectors to the appropriate type: cleaned => data.frame
cleaned <- data.frame(lapply(nyc[4:nrow(nyc)-1,], function(x){ 
    if(length(grep("\\d+\\,\\d+$|^\\d+\\.\\d+$", x)) > 0){
      as.numeric(trimws(gsub("\\,", "", as.character(x)), "both"))
    }else{ 
      as.factor(x)
      }
    }
  )
)

关于r - 抓取维基百科表格，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/62443786/

25

4

0

文章推荐： regex - 如何匹配除小写字母以外的任何内容？

文章推荐： javascript - 获取任何地区或城市内的所有邮政编码

文章推荐： c# - 计算操作系统中的线程总数(Windows/Linux)

文章推荐： python - 在 Numpy 中生成唯一的随机值

Sharepoint 维基
好吧，我看过一些帖子提到其他一些关于不使用 SP wiki 的帖子，因为它们很糟糕。既然我们正在考虑在 SP 中创建 wiki，我需要知道为什么我们不应该让 6 名自动化开发人员来记录各种自动化流程
git - 差异 GitLab 维基
在 GitLab Wiki 部分，可以查看保存更改的历史记录。但是，当您单击提交链接时，它将显示该保存中存在的整个文件。有谁知道一种方法来区分提交以仅获取两个提交之间的差异？这类似于它在 merge
javascript - 维基 API 请求不起作用
我使用了 Wiki API 文档中的一些示例代码，但是当我输入搜索项时，没有任何反应。控制台中没有错误，什么也没有。如果我将 URL 输入到浏览器中，URL 本身就会起作用，所以我认为代码中的某些内容
wiki - BitBucket 维基 : Create a hierarchy structure?
我想在我的 wiki 中创建一个层次结构，如下所示: General FooPages Foo1 Foo2 Foo3 ODP Bar Baz 我想创建这些页
python - Python 维基 map API (PyMapia)
我正在尝试使用为 Python 制作的 Wikimapia 的 pymapia API，但无法理解如何正确使用它。 import pymapia as PyMapia a = PyMapia.PyMa
ios - OS X 维基/博客服务器 API
我正在开发适用于 iOS 的客户端应用程序，用于在 Mac OS X 服务器(Snow Leopard 和 Lion)上编辑内置的 Wiki/Blog。看来我们可以使用 MetaWeblog 、At
url-rewriting - 哪种 URL 重写方案更可取？维基/博客风格？
我正在编写一些 URL 重写软件，我想从多个角度了解哪种 URL 方案更可取: 博客风格:my-chemistry-answer -- 为什么？ -- (不可取，技术性) Wiki 风格:My_Che
azure-devops - Azure DevOps 维基 : How can I link the subpages in the parent page?
我一直试图找到一种方法来在 Azure DevOps Wiki 中创建子页面的目录。我从其他 wiki 服务中找到了方法。在 Confluence 中，他们有一个用于“ child 显示”的宏我为

首页

博学

6Ren·AI

商城

r - 抓取维基百科表格