python - Gensim LDA 中的文档主题分布-6ren

python - Gensim LDA 中的文档主题分布

转载作者：太空狗更新时间：2023-10-29 16:56:37

24

4

我使用玩具语料库推导了一个 LDA 主题模型，如下所示:

documents = ['Human machine interface for lab abc computer applications',
             'A survey of user opinion of computer system response time',
             'The EPS user interface management system',
             'System and human system engineering testing of EPS',
             'Relation of user perceived response time to error measurement',
             'The generation of random binary unordered trees',
             'The intersection graph of paths in trees',
             'Graph minors IV Widths of trees and well quasi ordering',
             'Graph minors A survey']

texts = [[word for word in document.lower().split()] for document in documents]
dictionary = corpora.Dictionary(texts)

id2word = {}
for word in dictionary.token2id:    
    id2word[dictionary.token2id[word]] = word

我发现，当我使用少量主题来推导模型时，Gensim 会生成测试文档所有潜在主题的主题分布的完整报告。例如:

test_lda = LdaModel(corpus,num_topics=5, id2word=id2word)
test_lda[dictionary.doc2bow('human system')]

Out[314]: [(0, 0.59751626959781134),
(1, 0.10001902477790173),
(2, 0.10001375856907335),
(3, 0.10005453508763221),
(4, 0.10239641196758137)]

但是当我使用大量主题时，报告不再完整:

test_lda = LdaModel(corpus,num_topics=100, id2word=id2word)

test_lda[dictionary.doc2bow('human system')]
Out[315]: [(73, 0.50499999999997613)]

在我看来，输出中省略了概率小于某个阈值(我观察到 0.01 更具体)的主题。

我想知道这种行为是否出于某些审美考虑？我怎样才能得到概率质量残差在所有其他主题上的分布？

感谢您的热心回答!

最佳答案

阅读source事实证明，概率小于阈值的主题会被忽略。该阈值的默认值为 0.01。

关于python - Gensim LDA 中的文档主题分布，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/17310933/

24

4

0

文章推荐： python - 类定义中的空行 Python PEP8 最佳实践

文章推荐： c - ncurses透明控制台背景

文章推荐： C - 开始一个大项目。文件/目录结构和名称。需要好的例子

gensim - 如何将单词和向量手动添加到 Word2vec gensim？
比方说， word2vec.model 是我训练好的 word2vec 模型。当出现词汇外单词( oov_word )时，我计算向量 vec 使用 compute_vec(oov_word) 方法。现
gensim - 更新 gensim Doc2Vec 模型的训练文档
我有一个现有的 gensim Doc2Vec 模型，我正在尝试对训练集以及模型进行迭代更新。我拿新文件，照常进行预处理: stoplist = nltk.corpus.stopwords.words
gensim - (gensim) LdaMallet vs LdaModel？
使用 gensim.models.LdaMallet 有什么区别和 gensim.models.LdaModel ?我注意到参数并不完全相同，想知道什么时候应该使用一个而不是另一个？最佳答案 TL;
gensim - 如何从 gensim Doc2Vec 获取词向量？
我训练了一个 gensim.models.doc2vec.Doc2Vec 模型 d2v_model = Doc2Vec(sentences, size=100, window=8, min_count
gensim - 更新 gensim word2vec 模型
我在 gensim 中有一个 word2vec 模型，训练了 98892 个文档。对于句子数组中不存在的任何给定句子(即我训练模型的集合)，我需要用该句子更新模型，以便下次查询时给出一些结果。我这样做
gensim - 在 Gensim word2vec 模型中跟踪损失和嵌入
我对 Gensim 很陌生，我正在尝试使用 word2vec 模型训练我的第一个模型。我看到所有参数都非常简单易懂，但是我不知道如何跟踪模型的损失以查看进度。此外，我希望能够在每个 epoch 之后获
gensim - gensim LabeledSentence 和 TaggedDocument 有什么区别
请帮助我理解如何 TaggedDocument 之间的区别和 LabeledSentence的 gensim作品。我的最终目标是使用 Doc2Vec 进行文本分类模型和任何分类器。我正在关注这个 bl
python-3.x - Gensim - 尝试在 gensim 中加载文本文件
尝试使用以下代码行在 gensim 中加载文件: model = gensim.models.KeyedVectors.load_word2vec_format(r"C:/Users/dan/txt_
python - gensim Word2vec 迁移学习(来自非 gensim 模型)
我有一组用神经网络训练的嵌入，与 gensim 的 word2vec 无关。我想使用这些嵌入作为 gensim.Word2vec 中的初始权重。现在我看到的是，我可以model.load(SOME
python - gensim 错误 : ImportError: No module named 'gensim'
我尝试使用 gensim 导入 import gensim 但出现以下错误 ImportError Traceback (most rece
gensim - 是否需要将 TF-IDF 应用于 gensim LDA 模型中的新文档？
我正在关注 https://radimrehurek.com/gensim/wiki.html#latent-dirichlet-allocation 上的“英语维基百科”gensim 教程它解释了
gensim - 使用多核 CPU 用 gensim 训练 Doc2vec 效率不高
我正在使用 24 核虚拟 CPU 和 100G 内存来训练 Doc2Vec 与 Gensim，但无论修改核数，CPU 的使用率始终在 200% 左右。 top htop 上面两张图显示了cpu使用率，
python - 了解使用 "gensim.corpora.Dictionary(TEXT)"后单词如何存储在 gensim 语料库中
在将文本文档列表转换为语料库字典，然后使用以下方法将其转换为词袋模型之后: dictionary = gensim.corpora.Dictionary(docs) # docs is a list
python - Gensim 3.8.0 到 Gensim 4.0.0
我已经使用 Gensim 3.8.0 训练了一个 Word2Vec 模型。后来我尝试在 GCP 上使用使用 Gensim 4.0.o 的预训练模型。我使用了以下代码: model = KeyedVec
python - Sklearn+Gensim : How to use Gensim's Word2Vec embedding for Sklearn text classification
我正在构建一个多标签文本分类程序，我正在尝试使用 OneVsRestClassifier+XGBClassifier 对文本进行分类。最初，我使用 Sklearn 的 Tf-Idf 矢量化来矢量化文本
python - 如何删除关于使用 Word2vec gensim\matutils.py :737 的 gensim 警告
我发现关于 word2vec.similarity() 的警告如下: >d:\python\lib\site-packages\gensim\matutils.py:737: FutureWarnin
python - 使用 Gensim 显示 "Slow version of gensim.models.doc2vec being used"
我正在尝试使用版本为 3.6 的 Python 的 Gensim 库运行程序。每当我运行该程序时，我都会遇到这些语句: C:\Python36\lib\site-packages\gensim-2.
gensim - 使用 Gensim 或其他 python LDA 包来使用 Mallet 中经过训练的 LDA 模型
我有一个通过 Java 中的 Mallet 训练的 LDA 模型。 Mallet LDA 模型生成了三个文件，这使我能够从文件运行模型并推断新文本的主题分布。现在我想实现一个 Python 工具，它
gensim - 有什么方法可以从doc2vec模型中获取词汇量吗？
我正在使用gensim doc2vec。我想知道是否有任何有效的方法来了解doc2vec的词汇量。一种粗略的方法是计算单词总数，但是如果数据量很大(1GB或更多)，那么这将不是一种有效的方法。最佳答
gensim - 如何以二进制和文本格式保存fasttext模型？
documentation有点不清楚如何将 fasttext 模型保存到磁盘 - 如何在参数中指定路径，我尝试这样做，但失败并出现错误文档中的示例 >>> from gensim.test.util

首页

博学

6Ren·AI

商城

python - Gensim LDA 中的文档主题分布