python - 使用 gensim 将 LDA 应用于语料库进行训练-6ren

python - 使用 gensim 将 LDA 应用于语料库进行训练

转载作者：行者123 更新时间：2023-12-01 05:45:30

25

4

我的语料库包含大约 20,000 个文档，我必须使用 LDA 训练该数据集以进行主题建模。

import logging, gensim

logging.basicConfig(format='%(asctime)s : %(levelname)s : %(message)s', level=logging.INFO)
id2word = gensim.corpora.Dictionary('questions.dict')
mm = gensim.corpora.MmCorpus('questions.mm')
lda = gensim.models.ldamodel.LdaModel(corpus=mm, id2word=id2word, num_topics=100, update_every=0, chunksize=3000, passes=20)
lda.print_topics(20)

每当我运行这个程序时，我都会遇到这个错误:

2013-04-28 09:57:09,750 : INFO : adding document #0 to Dictionary(0 unique tokens)
2013-04-28 09:57:09,759 : INFO : built Dictionary(11 unique tokens) from 14 documents (total 14 corpus positions)
2013-04-28 09:57:09,785 : INFO : loaded corpus index from questions.mm.index
2013-04-28 09:57:09,790 : INFO : initializing corpus reader from questions.mm
2013-04-28 09:57:09,796 : INFO : accepted corpus with 19188 documents, 15791 features, 106222 non-zero entries
2013-04-28 09:57:09,802 : INFO : using serial LDA version on this node
2013-04-28 09:57:09,808 : INFO : running batch LDA training, 100 topics, 20 passes over the supplied corpus of 19188 documents, updating model once every 19188 documents
2013-04-28 09:57:10,267 : INFO : PROGRESS: iteration 0, at document #3000/19188

Traceback (most recent call last):
File "C:/Users/Animesh/Desktop/NLP/topicmodel/lda.py", line 10, in <module>
lda = gensim.models.ldamodel.LdaModel(corpus=mm, id2word=id2word, num_topics=100, update_every=0, chunksize=3000, passes=20)
File "C:\Python27\lib\site-packages\gensim-0.8.6-py2.7.egg\gensim\models\ldamodel.py", line 265, in __init__
self.update(corpus)
File "C:\Python27\lib\site-packages\gensim-0.8.6-py2.7.egg\gensim\models\ldamodel.py", line 445, in update
self.do_estep(chunk, other)
File "C:\Python27\lib\site-packages\gensim-0.8.6-py2.7.egg\gensim\models\ldamodel.py", line 365, in do_estep
gamma, sstats = self.inference(chunk, collect_sstats=True)
File "C:\Python27\lib\site-packages\gensim-0.8.6-py2.7.egg\gensim\models\ldamodel.py", line 318, in inference
expElogbetad = self.expElogbeta[:, ids]
IndexError: index (11) out of range (0<=index<10) in dimension 1

我什至尝试更改 LdaModel 函数中的值，但总是遇到相同的错误!

应该做什么？

最佳答案

您的词典(id2word)似乎与您的语料库对象(mm)没有正确匹配。

无论出于何种原因，id2word(单词标记到 wordid 的映射)仅包含 11 个标记 2013-04-28 09:57:09,759 : INFO : 从 14 个文档(总共 14 个语料库位置)构建字典(11 个唯一标记)

您的语料库包含 15791 个特征，因此当它查找 id > 10 的特征时，它会失败。中的 ID expElogbetad = self.expElogbeta[:, ids]是特定文档中所有单词 ID 的列表。

我会重新运行语料库和字典的创建:

$ python -m gensim.scripts.make_wiki(来自 gensim LDA 教程)。

我认为，创建的字典的日志记录数据应该表明远远超过 11 个标记。我自己也遇到过类似的问题。

关于python - 使用 gensim 将 LDA 应用于语料库进行训练，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/16259652/

25

4

0

文章推荐： jquery - 如何在现有数据表中添加新行作为 html

文章推荐： javascript - window.print() 不会在 iPAD 中弹出 PDF 打印对话框

文章推荐： jquery - 如何获取 jquery 上下文菜单插件的名称属性

lda - LDA 可以为一个单词分配多个主题吗？
我刚刚开始阅读有关潜在狄利克雷分配 LDA 的内容，并希望将其应用到我的项目中。请问 LDA 是否能够将一个主题分配给多个单词？例如，文章A谈论“河岸”，而文章B谈论“银行在金融中的作用”。因此，
lda - LDA 可以为一个词分配多个主题吗？
我刚刚开始阅读有关 Latent Dirichlet Allocation LDA 的内容，并想将其应用到我的项目中。我可以知道 LDA 是否能够将一个主题分配给多个单词吗？例如，A 条谈到“河岸
lda - 从 lda gensim 检索主题词数组和文档主题数组
情况: 我有一个 numpy 术语文档矩阵例如:[[0,1,0,0....],....[......0,0,0,0]]。我已将上述矩阵插入到 gensim 的 ldamodel 方法中。并且使用
lda - gensim lda 模型 - 用看不见的单词调用语料库的更新
我正在尝试使用 gensim's lda模型。如果我用给定的语料库创建 lda 模型，然后我想用一个新的语料库更新它，其中包含在第一个语料库中看不到的单词，我该怎么做？当我尝试调用 lda_model
r - 使用 MASS :lda() 在 LDA 中观察线性判别式的访问分数
library(MASS) example(lda) plot(z) 如何访问 z 中的所有点？我想知道 LD1 和 LD2 上每个点的值，具体取决于它们的 Sp (c,s,v)。最佳答案您正在寻
lda - 我如何测量用 R 中的 textmineR 包制作的 LDA 模型的困惑度分数？
我在 R 中制作了一个 LDA 主题模型，使用 textmineR 包，如下所示。 ## get textmineR dtm dtm2 2] dtm2 2] ###################
lda - 在 LDA 模型中设置超参数 alpha 和 theta 的规则
我想知道更多关于LDA模型中是否有设置超参数alpha和theta的规则。我运行图书馆提供的 LDA 模型 gensim : ldamodel = gensim.models.ldamodel.Lda
python - lda[doc_bow] 和 lda.inference(corpus) 之间的区别是什么？
我认为在 LDA 模型中，这些是使用现有模型推断新文档的两种方法。这两种方法有什么区别？最佳答案我做了一些测试，我的 ldamodel 有 8 个主题，这里是我的结果:2 个预测主题的文档: li
python - sklearn.lda.LDA() 和 sklearn.discriminant_analysis.LinearDiscriminantAnalysis() 之间的区别
在阅读有关使用 python 的 LinearDiscriminantAnalysis 的过程中，我有两种不同的方法来实现它，可在此处获得， http://scikit-learn.org/stabl
gensim - 使用 Gensim 或其他 python LDA 包来使用 Mallet 中经过训练的 LDA 模型
我有一个通过 Java 中的 Mallet 训练的 LDA 模型。 Mallet LDA 模型生成了三个文件，这使我能够从文件运行模型并推断新文本的主题分布。现在我想实现一个 Python 工具，它
apache-spark - Spark MLlib LDA : the possible reasons behind generating always very similar LDA topics?
我正在将 MLlib LDA example 应用于从 enter link description here 下载的各种语料库我正在过滤掉停用词，并排除非常频繁的术语和非常罕见的术语。问题是我总是有
lda - 潜在狄利克雷分配解决方案示例
我正在尝试了解潜在狄利克雷分配(LDA)。我有机器学习和概率论的基础知识，并基于这篇博文 http://goo.gl/ccPvE我能够开发 LDA 背后的直觉。但是，我仍然没有完全了解其中的各种计算。
lda - 大数据集主题建模工具 (30GB)
我正在寻找一些适用于大型数据集的主题建模工具。我当前的训练数据集是 30 GB。我试过 MALLET topic modeling ，但我总是得到 OutOfMemoryError。如果您有任何提
R - LDA 主题模型输出数据
我正在使用“topicmodels”包在 R 中构建一些主题模型。在预处理并创建文档术语矩阵后，我正在应用以下 LDA Gibbs 模型。这可能是一个简单的答案，但我是 R 的新手，所以就这样吧。有没
r - LDA 贡献双标图
我正在尝试为线性判别分析 (LDA) 创建双标图。我正在使用从这里获得的代码的修改版本 https://stats.stackexchange.com/questions/82497/can-the-
python - 按主题选择文本 (LDA)
是否可以查找某个主题(由 LDA 确定)内的文本？我有一个包含 5 个主题的列表，每个主题有 10 个单词，是使用 lda 找到的。我分析了数据框列中的文本。我想选择/过滤某个特定主题中的行/文本
sampling - LDA:为什么要采样以推断新文档？
给定一个标准 LDA 模型，其中包含 1000 个主题和数百万个文档，并使用 Mallet/折叠吉布斯采样器进行训练: 在推断新文档时:为什么不直接跳过采样并简单地使用模型的术语主题计数来确定新文档的
LDA 主题建模 - 训练和测试
我读过 LDA，并且了解当一个人输入一组文档时如何生成主题的数学原理。引用文献称，LDA 是一种算法，只要给定一个文档集合(无需任何监督)，就可以揭示该集合中的文档所表达的“主题”。因此，通过使用
scala - LDA 交叉验证评估器
我希望将交叉验证应用于 LDA 算法以确定主题的数量(K)。我的疑问是关于评估者，因为我希望使用对数似然。创建交叉验证时，我在 .setEvaluator(????) 上设置了什么？ // Defi
Gensim LDA 主题分配
我希望使用 LDA 将每个文档分配给一个主题。现在我意识到你得到的是来自 LDA 的主题分布。然而，正如您从下面的最后一行中看到的那样，我将其分配给了最可能的主题。我的问题是这样的。我必须第二次运行

首页

博学

6Ren·AI

商城

python - 使用 gensim 将 LDA 应用于语料库进行训练