python - 将 Python 字符串传递给 Mallet 以进行主题建模-6ren

python - 将 Python 字符串传递给 Mallet 以进行主题建模

转载作者：太空宇宙更新时间：2023-11-03 11:04:57

24

4

我正在使用 BeautifulSoup 构建一个文本语料库以及从 HTML 中收集的一些元数据。如果我可以从 Python 中调用 Mallet，并让它从 Python 字符串而不是目录中的文本文件中建模主题，那将非常有帮助。这样我就可以将 Mallet 定位的 n 个关键字放入每个文件中。

当我运行时，我收到一条消息说 Mallet 已被识别:

from nltk.classify import mallet
from subprocess import call
mallet.config_mallet("malletdir/mallet-2.0.7/bin")

但我在接下来的步骤中运气不佳，我什至不确定 Mallet 是否接受保存文件以外的任何内容。

我无法找到任何我能真正理解的文档。有人看过这方面的可消化文档吗？ (NLTK 书没有进入 Mallet)。我也很乐意了解在 Python 中进行主题建模的任何其他方法，我可以在没有真正深入了解 Python 的情况下操作这些方法。

对不起，这是我的第一个牛仔竞技表演。

最佳答案

如果您仍在寻找解决方案:Gensim(一个 Python 主题建模/机器学习包)有一个 Mallet 包装器，它易于使用且有详细记录。 Here是一些 Gensim 教程和特定的 tutorial用于 Mallet wrapper 。您可能还想阅读一些安装说明(主要是关于设置 Java 内存的部分)here然后你就可以开始了。

关于python - 将 Python 字符串传递给 Mallet 以进行主题建模，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/22481094/

24

4

0

文章推荐： python - 在 Python 中搜索和替换字符串中的一些文本？

文章推荐： c# - 在没有参数化查询的情况下防止 SQL 注入(inject)？

文章推荐： c# - ArgumentOutOfRangeException 的奇怪本地化问题

文章推荐： python - 继承 : Base class method which returns an instance of itself

mallet - 如何在 mallet 中使用 --use-ngrams
我想使用 --use-ngrams true 选项运行 mallet，但似乎无法正常工作。 bin\mallet import-file --input ovary.txt --output ovar
python mallet LDA FileNotFoundError : [Errno 2] No such file or directory: 'C:\\Users\\abc\\AppData\\Local\\Temp\\d33563_state.mallet.gz'
这是我第一次使用槌 LDA。基本上，我下载了 mallet-2.0.8 zip 文件和 JDK。我安装了 JDK，将 mallet-2.0.8 提取到目标文件夹。我设置了 MALLET_HOME。这是
java - Mallet:字母不匹配异常
我尝试使用 Java 中的 Mallet 实现文档分类器。我已经有一个基本包含特征值的文件。所以我不想运行整个 raw text 处理管道。目前我的特征文件中的一行看起来像这样(2 个特征，ID 和
java - Mallet 未被识别为内部或外部命令
我使用的是 Windows 7。我安装了 Mallet，当我进入 Mallet 目录时它运行得很好。但是，我正在使用一些调用它的 python 软件( https://github.com/uwgra
java - Mallet:对每个预测的贡献
我正在使用 CRF 在 Mallet 上开发一个 NER 系统。您知道是否可以收集每个预测的特征贡献吗？我需要知道并理解 CRF 模型的精确行为。有什么建议吗？谢谢。干杯，乌克兰最佳答案是
java - MALLET:如何实现基于crf的编辑距离？
我正在寻找有人写/知道MALLET类的详细信息。我知道这是解决ML问题的好工具，现在我尝试实现此处Andrew McCallum, Kedar Bellare and Fernando Pereira
r - 如何通过重组 MALLET 输出文件来创建表格？
我正在使用 MALLET 进行主题分析，它在几千行和一百左右行的文本文件(“topics.txt”)中输出结果，其中每行由制表符分隔的变量组成，如下所示: Num1 text1 topic1 prop
nlp - 使用 Mallet 加载模型和分类输入
我已经有一个使用 SimpleTagger 训练过的 CRF 训练模型。 SimpleTagger.main(new String[] { "--tra
nlp - 关于潜在狄利克雷分配(MALLET)的问题
老实说，我对 LDA 并不熟悉，但我的一个项目需要使用 MALLET 的主题建模。我的问题是:给定特定时间戳内的一组文档作为主题模型的训练数据，使用模型(使用推理器)来跟踪主题趋势是否合适，对于文档
java - MALLET 主题建模 OutOfMemoryError
我使用 MALLET 进行主题建模。 http://mallet.cs.umass.edu/topics.php 首先，我尝试按照说明导入培训文档集。 bin/mallet import-dir --
java - 更改 MALLET 中主题分发文件中的列顺序
MALLET 在训练主题模型时使用 --output-doc-topics 参数生成一个制表符分隔的文件，其中包含每个文档的主题分布。它看起来像这样: doc# filename topi
java - Mallet 文档分类 - 减少词汇量
我用 Mallet 训练了 maxent 文档分类模型，结果是 130MB，这对于我希望运行它的实例来说太大了。我想知道是否有一种方法可以潜在地减少模型的词汇量，从而减少整体模型的大小。有管道可以做到
java - 获取 mallet 中所有文档的实例和主题序列
我正在使用 mallet 库进行主题建模。我的数据集位于 filePath 路径中，并且 csvIterator 似乎可以读取数据，因为 model.getData() 有大约 27000 行，等于我
Java Mallet LDA 关键字分布
我使用 Java-Mallet API 通过 LDA 进行主题建模。 API 产生以下结果:主题:关键字1(计数)、关键字2(计数) 例如主题 0:文件 (12423)、测试 (3123) ...主
java - 无法运行 Mallet 主题模型
我正在尝试运行 Mallet 的主题建模，但出现以下错误: Couldn't open cc.mallet.util.MalletLogger resources/logging.properties
classification - 在 mallet 中训练分类器
我有一个格式如下的 csv 文件产品名称，产品评论现在使用 mallet 我必须训练分类器，以便如果输入包含产品评论的测试数据集，它应该告诉我特定评论属于哪个产品 mallet java api
java - 如何使用 Mallet 进行序列标记任务？
我正在尝试将 mallet 包合并到我的 java 代码中以完成我的序列标记任务。但是，我不太确定我应该如何仅根据 mallet 网站上的数据导入指南进行操作。谁能帮我解决这个问题？我的第一个问题是
java - Mallet 特征选择类似于将特征值设置为 0
我正在查看 Mallet 源代码，似乎大多数分类器实现(例如朴素贝叶斯)并没有真正考虑到功能选择，即使 InstanceList 类具有setFeatureSelection 方法。现在我想对我的数
machine-learning - Mallet 训练模型负载
有人有幸加载过之前训练过的模型吗？翻阅其API ，CRFWriter类是拼图的1/2，但是你到底如何CRFRead(类不存在) 感谢您的帮助。最佳答案根据您使用的训练器，您应该能够将对象转换为 C
nlp - 为什么使用 MALLET 主题推断对单个文档和批量文档会得到不同的结果？
我正在尝试使用 Mallet 2.0.7 执行 LDA 主题建模。从训练类(class)的输出来看，我可以训练 LDA 模型并获得良好的结果。此外，我可以使用该过程中内置的推理器，并在重新处理我的训练

首页

博学

6Ren·AI

商城

python - 将 Python 字符串传递给 Mallet 以进行主题建模