- c - 在位数组中找到第一个零
- linux - Unix 显示有关匹配两种模式之一的文件的信息
- 正则表达式替换多个文件
- linux - 隐藏来自 xtrace 的命令
标题说明了一切;我有一个充满在线对话文本的 SQL 数据库。我已经用 Python 完成了这个项目的大部分工作,所以我想使用 Python 的 NLTK 库来完成这项工作(除非有strong理由不这样做)。
数据按Thread、Username 和Post 组织。每个线程或多或少都侧重于讨论我有兴趣分析的类别中的一个“产品”。最终,当这完成时,我想从每个用户那里得到他们在某个时候讨论过的任何产品的估计意见(喜欢/不喜欢某种交易)。
那么,我想知道的是:
1) 我怎样才能确定每个线程是关于什么产品的?我正在阅读有关关键字提取的内容...这是正确的方法吗?
2) 我如何根据他们的帖子确定特定用户的情绪?根据我有限的理解,我必须首先“训练”NLTK 以识别某些意见指标,然后我简单地确定这些词出现在文本中时的上下文?
您现在可能已经猜到了,我之前没有使用 NLP 的经验。从我目前的阅读来看,我认为我可以应付学习它。如果有人能为我指出正确的方向,即使现在只是一个基本和粗略的工作模型也会很棒。 Google 对我帮助不大。
P.S. 我有权分析此数据(以防万一)
最佳答案
训练任何分类器都需要一个训练集的标记数据和一个特征提取器来获取每个文本的特征集。拥有经过训练的分类器后,您可以将其应用于以前未见过的文本(未标记)并根据所使用的机器学习算法获得分类。 NLTK gives a good explanation and some samples to play around with .
如果您有兴趣使用自己的训练数据集构建积极/消极情绪的分类器,我会避免简单的关键字计数,如 they aren't accurate for a number of reasons (例如,否定积极的词:“不开心”)。另一种方法是远程监督,您仍然可以使用大型训练集而无需手动标记任何内容。基本上,这种方法使用表情符号 或其他特定文本元素作为噪声标签。您仍然必须选择哪些特征是相关的,但许多研究仅使用 unigrams 或 bigrams(分别是单个词或词对)就取得了很好的效果。
使用 Python 和 NLTK 可以相对轻松地完成所有这些工作。您还可以选择使用类似 NLTK-trainer 的工具,它是 NLTK 的包装器,需要的代码更少。
我认为this study由 Go 等人撰写。是最容易理解的之一。您还可以阅读关于 distant supervision 的其他研究, distant supervision sentiment analysis , 和 sentiment analysis .
NLTK 中有一些带有训练和分类方法的内置分类器(Naive Bayes、MaxEnt 等),但如果您对使用支持向量机 (SVM) 感兴趣,那么您应该看看别处。从技术上讲,NLTK 为您提供了一个 SVM class但它实际上只是 PySVMLight 的包装器,它本身是 SVMLight 的包装器,用 C 语言编写。虽然我在使用这种方法时遇到了很多问题,但我会推荐 LIBSVM .
为了确定主题,许多人使用简单的关键字,但也有一些更复杂的方法可用。
关于python - 大量在线对话文本的情感分析,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/15326694/
我刚刚继承了一个旧的 PostgreSQL 安装,需要进行一些诊断以找出该数据库运行缓慢的原因。在 MS SQL 上,您可以使用 Profiler 等工具来查看正在运行的查询,然后查看它们的执行计划。
将目标从Analytics(分析)导入到AdWords中,然后在Analytics(分析)中更改目标条件时,是否可以通过更改将目标“重新导入”到AdWords,还是可以自动选择? 最佳答案 更改目标值
我正在使用google analytics api来获取数据。我正在获取数据,但我想验证两个参数,它们在特定日期范围内始终为0。我正在获取['ga:transactions']和['ga:goalCo
我使用Google API从Google Analytics(分析)获取数据,但指标与Google Analytics(分析)的网络界面不同。 即:我在2015年3月1日获得数据-它返回综合浏览量79
我在我的Web应用程序中使用sammy.js进行剔除。我正在尝试向其中添加Google Analytics(分析)。我很快找到了following plugin来实现页面跟踪。 我按照步骤操作,页面如
当使用 Xcode 分析 (product>analyze) 时,有没有办法忽略给定文件中的任何错误? 例如编译指示之类的? 我们只想忽略第三方代码的任何警告,这样当我们的代码出现问题时,它对我们
目录 EFK 1. 日志系统 2. 部署ElasticSearch 2.1 创建handless服务 2.2 创建s
关闭。这个问题不满足Stack Overflow guidelines .它目前不接受答案。 想改善这个问题吗?更新问题,使其成为 on-topic对于堆栈溢出。 7年前关闭。 Improve thi
GCC/G++ 是否有可用于输出分析的选项? 能够比较以前的代码与新代码之间的差异(大小、类/结构的大小)将很有用。然后可以将它们与之前的输出进行比较以进行比较,这对于许多目的都是有用的。 如果没有此
我正在浏览 LYAH,并一直在研究处理列表时列表理解与映射/过滤器的使用。我已经分析了以下两个函数,并包含了教授的输出。如果我正确地阅读了教授的内容,我会说 FiltB 的运行速度比 FiltA 慢很
在 MySQL 中可以使用 SET profiling = 1; 设置分析 查询 SHOW PROFILES; 显示每个查询所用的时间。我想知道这个时间是只包括服务器的执行时间还是还包括将结果发送到前
我用 Python 编写了几个用于生成阶乘的模块,我想测试运行时间。我找到了一个分析示例 here我使用该模板来分析我的模块: import profile #fact def main():
前几天读了下mysqld_safe脚本,个人感觉还是收获蛮大的,其中细致的交代了MySQL数据库的启动流程,包括查找MySQL相关目录,解析配置文件以及最后如何调用mysqld程序来启动实例等,有着
1 内网基础 内网/局域网(Local Area Network,LAN),是指在某一区域内有多台计算机互联而成的计算机组,组网范围通常在数千米以内。在局域网中,可以实现文件管理、应用软件共享、打印机
1 内网基础 内网/局域网(Local Area Network,LAN),是指在某一区域内有多台计算机互联而成的计算机组,组网范围通常在数千米以内。在局域网中,可以实现文件管理、应用软件共享、打印机
我有四列形式的数据。前三列代表时间,value1,value 2。第四列是二进制,全为 0 或 1。当第四列中对应的二进制值为0时,有没有办法告诉excel删除时间、值1和值2?我知道这在 C++ 或
我正在运行一个进行长时间计算的 Haskell 程序。经过一些分析和跟踪后,我注意到以下内容: $ /usr/bin/time -v ./hl test.hl 9000045000050000 Com
我有一个缓慢的 asp.net 程序正在运行。我想分析生产服务器以查看发生了什么,但我不想显着降低生产服务器的速度。 一般而言,配置生产盒或仅本地开发盒是标准做法吗?另外,您建议使用哪些程序来实现这一
我目前正在尝试分析 Haskell 服务器。服务器永远运行,所以我只想要一个固定时间的分析报告。我尝试只运行该程序 3 分钟,然后礼貌地要求它终止,但不知何故,haskell 分析器不遵守术语信号,并
是否有工具可以分析 Maven 构建过程本身,以便我可以看到构建花费最多时间的地方? 我们在工作中遇到了关于 Maven 3.0.3 和 3.0b1 的问题。与 3.0.3 (9m00s) 相比,我们
我是一名优秀的程序员,十分优秀!