R 文本挖掘 : Counting the number of times a specific word appears in a corpus?-6ren

R 文本挖掘 : Counting the number of times a specific word appears in a corpus?

转载作者：行者123 更新时间：2023-12-04 10:36:06

25

4

我看到这个问题用其他语言回答，但没有用 R 回答。

【专用于R文本挖掘】我有一组从语料库中获取的常用短语。现在我想搜索这些短语在另一个语料库中出现的次数。

有没有办法在 TM 包中做到这一点？ (或其他相关包)

例如，假设我有一组短语，即从 CorpusA 获得的“标签”。另一个语料库 CorpusB，包含数千个子文本。我想知道标签中的每个短语在 CorpusB 中出现了多少次。

一如既往，我感谢您的所有帮助!

最佳答案

不完美，但这应该让你开始。

#User Defined Function
strip <- function(x, digit.remove = TRUE, apostrophe.remove = FALSE){
    strp <- function(x, digit.remove, apostrophe.remove){
        x2 <- Trim(tolower(gsub(".*?($|'|[^[:punct:]]).*?", "\\1", as.character(x))))
        x2 <- if(apostrophe.remove) gsub("'", "", x2) else x2
        ifelse(digit.remove==TRUE, gsub("[[:digit:]]", "", x2), x2)
    }
unlist(lapply(x, function(x) Trim(strp(x =x, digit.remove = digit.remove, 
    apostrophe.remove = apostrophe.remove)) ))
}
#==================================================================
#Create 2 'corpus' documents (you'd have to actually do all this in tm
corpus1 <- 'I have seen this question answered in other languages but not in R.
[Specifically for R text mining] I have a set of frequent phrases that is obtained from a Corpus. 
Now I would like to search for the number of times these phrases have appeared in another corpus.
Is there a way to do this in TM package? (Or another related package)
For example, say I have an array of phrases, "tags" obtained from CorpusA. And another Corpus, CorpusB, of 
couple thousand sub texts. I want to find out how many times each phrase in tags have appeared in CorpusB.
As always, I appreciate all your help!'

corpus2 <- "What have you tried? If you have seen it answered in another language, why don't you try translating that 
language into R? – Eric Strom 2 hours ago
I am not a coder, otherwise would do. I just do not know a way to do this. – appletree 1 hour ago
Could you provide some example? or show what you have in mind for input and output? or a pseudo code? 
As it is I find the question a bit too general. As it sounds I think you could use regular expressions 
with grep to find your 'tags'. – AndresT 15 mins ago"
#=======================================================
#Clean up the text
corpus1 <- gsub("\\s+", " ", gsub("\n|\t", " ", corpus1))
corpus2 <- gsub("\\s+", " ", gsub("\n|\t", " ", corpus2))

corpus1.wrds <- as.vector(unlist(strsplit(strip(corpus1), " ")))
corpus2.wrds <- as.vector(unlist(strsplit(strip(corpus2), " ")))

#create frequency tables for each corpus
corpus1.Freq <- data.frame(table(corpus1.wrds))
corpus1.Freq$corpus1.wrds  <- as.character(corpus1.Freq$corpus1.wrds)
corpus1.Freq <- corpus1.Freq[order(-corpus1.Freq$Freq), ]
rownames(corpus1.Freq) <- 1:nrow(corpus1.Freq)
key.terms <- corpus1.Freq[corpus1.Freq$Freq>2, 'corpus1.wrds'] #key words to match on corpus 2

corpus2.Freq <- data.frame(table(corpus2.wrds))
corpus2.Freq$corpus2.wrds  <- as.character(corpus2.Freq$corpus2.wrds)
corpus2.Freq <- corpus2.Freq[order(-corpus2.Freq$Freq), ]
rownames(corpus2.Freq) <- 1:nrow(corpus2.Freq)

#Match key words to the words in corpus 2
corpus2.Freq[corpus2.Freq$corpus2.wrds %in%key.terms, ]

关于R 文本挖掘 : Counting the number of times a specific word appears in a corpus?，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/8996513/

25

4

0

文章推荐： associations - Ecto 与多个计划的关联

文章推荐： r - 转换 HH :MM:SS AM/PM string to time

文章推荐： performance - Python 3 多处理 : optimal chunk size

文章推荐： azure - Application Insights - 记录异常

angular - 错误 : Type '[number] | [number, number, number, number]' is not assignable to type '[number]'
从 angular 5.1 更新到 6.1 后，我开始从我的代码中收到一些错误，如下所示: Error: ngc compilation failed: components/forms/utils.
typescript :number[] 和 [number,number] 有什么区别？
我正在学习 Typescript 并尝试了解类型和接口(interface)的最佳实践。我正在玩一个使用 GPS 坐标的示例，想知道一种方法是否比另一种更好。 let gps1 : number[];
javascript - 类型 'number[]' 缺少类型 '[number, number, number, number]' 的以下属性 : 0, 1、2、3
type padding = [number, number, number, number] interface IPaddingProps { defaultValue?: padding
c - : number = number + 10; and number += 10; 之间的区别
这两种格式在内存中保存结果的顺序上有什么区别吗？ number = number + 10; number += 10; 我记得一种格式会立即保存结果，因此下一行代码可以使用新值，而对于另一种格式，
python重新匹配组: number after\number
在 Python 匹配模式中，如何匹配像 1 这样的文字数字在按数字反向引用后 \1 ？我尝试了 \g用于此目的的替换模式中可用的语法，但它在我的匹配模式中不起作用。我有一个更大的问题，我想使用一
javascript - 将字符串 ">number<"转换为 ">number<"
我的源文件here包含 HTML 代码，我想将电话号码更改为可在我的应用程序中单击。我正在寻找一个正则表达式来转换字符串 >numbernumber(\d+)$1numbernumber<"，我们在S
Javascript/html : How to generate random number between number A and number B?
我们有一个包含 2 个字段和一个按钮的表单。我们想要点击按钮来输出位于 int A 和 int B 之间的随机整数(比如 3、5 或 33)？ (不需要使用 jQuery 或类似的东西) 最佳答案你
javascript - 类型 '(priority1: number, priority2: number) => number' 的参数不可分配给类型 '(a: unknown, b: unknown) => number' 的参数
我收到以下类型错误(TypeScript - 3.7.5)。 error TS2345: Argument of type '(priority1: number, priority2: number
google-apps-script - 找不到方法 getRange(number,number,number,(class))
只想创建简单的填充器以在其他功能中使用它: function fillLine(row, column, length, bgcolor) { var sheet = SpreadsheetApp
java - java中的输出(printf)中的终止符(number).(number)[a](number)[d0]是什么意思？
我有一个问题。当我保存程序输出的 *.txt 时，我得到以下信息:0.021111111111111112a118d0 以及更多的东西。问题是: 这个数字中的“d0”和“a”是什么意思？我不知道“
algorithm - 数字金字塔算法 : Numbers 1-15 in a pyramid where each number is the difference of the subjacent numbers
首先:抱歉标题太长了，但我发现很难用一句话来解释这个问题；)。是的，我也四处搜索(这里和谷歌)，但找不到合适的答案。所以，问题是这样的: 数字 1-15 将像这样放在金字塔中(由数组表示):
r - 提取模式 "number/number"
我想从字符串中提取血压。数据可能如下所示: text <- c("at 10.00 seated 132/69", "99/49", "176/109", "10.12 I 128/51, II 1
Bash 算术 $number != $((number))
当尝试执行一个简单的 bash 脚本以将前面带有 0 的数字递增 1 时，原始数字被错误地解释。 #!/bin/bash number=0026 echo $number echo $((number
typescript - [number, number] 类型的初始值
我有一个类型为 [number, number] 的字段，TypeScript 编译器(strict 设置为 true)出现问题，提示初始值值(value)。我尝试了以下方法: public shee
ruby - 正则表达式数组(["number"， "number"，...])
你能帮我表达数组吗:["232","2323","233"] 我试试这个:/^\[("\d{1,7}")|(,"\d{1,7}")\]$/ 但是这个表达式不能正常工作。我使用 ruby(rail
c++ - (number & -number) 在位编程中是什么意思？
这个问题在这里已经有了答案: meaning of (number) & (-number) (4 个回答) 关闭6年前. 例如: int get(int i) { int res = 0;
counter - 如何在 Berkeley DB 中对 Map> 建模
我正在考虑使用 Berkeley DB作为高度并发的移动应用程序后端的一部分。对于我的应用程序，使用 Queue对于他们的记录级别锁定将是理想的。但是，如标题中所述，我需要查询和更新概念建模的数据，如
javascript - 重复出现的数字 : How to get a non-rounded recurring number when dividing a number by another number?
我正在尝试解决涉及重复数字的特定 JavaScript 练习，为此我需要将重复数字处理到大量小数位。目前我正在使用: function divide(numerator, denominator){
typescript - 错误 : Type 'number | undefined' is not assignable to type 'number | { valueOf(): number; }' ?
我有这个数组类型: interface Details { Name: string; URL: string; Year: number; } interface AppState {
java - 在服务器 "number 1"或服务器 "number 2"上运行作业。从未在服务器上 "number 3"
我们正在使用 Spring 3.x.x 和 Quartz 2.x.x 实现 Web 应用程序。 Web 服务器是 Tomcat 7.x.x。我们有 3 台服务器。 Quartz 是集群式的，因此所有这

首页

博学

6Ren·AI

商城

R 文本挖掘 : Counting the number of times a specific word appears in a corpus?