GoLang PoS Tagger 脚本花费的时间比终端没有输出的时间长-6ren

GoLang PoS Tagger 脚本花费的时间比终端没有输出的时间长

转载作者：IT王子更新时间：2023-10-29 02:26:04

24

4

此脚本在 play.golang.org 中编译时没有错误:http://play.golang.org/p/Hlr-IAc_1f

但是当我在我的机器上运行时，发生的时间比我预期的要长得多，但终端什么也没发生。

我正在尝试构建的是一个 PartOfSpeech 标注器。

我认为最长的部分是将 lexicon.txt 加载到 map 中，然后将每个单词与那里的每个单词进行比较，看看它是否已经在词典中被标记。词典只包含动词。但是不是每个单词都需要检查它是否是动词。

更大的问题是我不知道如何用副词、形容词等简单的启发式方法来确定一个词是否是动词。

最佳答案

(引用):

I don't know how to determine if a word is a verb with an easy heuristic like adverbs, adjectives, etc.

我不能谈论您的 Go 实现中的任何问题，但我会解决一般的 POS 标记的更大问题。听起来您正在尝试构建基于规则的 unigram 标记器。详细说明这些术语:

“unigram”表示您要分别考虑句子中的每个单词。请注意，unigram 标记器本质上是有限的，因为它不能消除可以采用多个 POS 标记的单词的歧义。例如，你应该将“fish”标记为名词还是动词？ last是动词还是副词?
“基于规则”顾名思义:一组规则来确定每个词的标签。基于规则的标记以不同的方式受到限制——它需要大量的开发工作来组装一个规则集，该规则集将处理通用语言中合理部分的歧义。如果您使用的语言我们没有良好的培训资源，那么这项工作可能是合适的，但对于大多数常见语言，我们现在有足够的标记文本来训练高精度标记模型。

最先进的 POS 标记在格式良好的新闻专线文本上的准确率超过 97%(在不太正式的类型上准确率自然较低)。基于规则的标注器的性能可能会差很多(您必须确定满足您的要求所需的准确度级别)。如果您想继续沿着基于规则的道路前进，我建议您阅读 this tutorial .该代码基于 Haskell，但它将帮助您了解基于规则的标记中的概念和问题。

也就是说，我强烈建议您查看其他标记方法。我提到了 unigram 标记的弱点。相关的方法是'bigram'，这意味着我们在标记单词n时考虑前一个词，'trigram'(通常是前2个词，或前一个词，当前词和后一个词)；更一般地说，“n-gram”指的是考虑 n 个单词的序列(通常是围绕我们当前标记的单词的滑动窗口)。该上下文可以帮助我们消除“鱼”、“最后”、“苍蝇”等的歧义。

例如，在

We fish

我们可能想将 fish 标记为动词，而在

ate fish

当然是名词。

The NLTK tutorial在这里可能是一个很好的引用。可靠的 n-gram 标注器应该可以让你达到 90% 以上的准确率；可能高于 95%(同样在新闻专线文本中)。

更复杂的方法(称为“结构化推理”)将整个标签序列视为一个整体。也就是说，他们不是尝试分别为每个单词预测最可能的标签，而是尝试为整个输入序列预测最可能的标签序列。结构化推理当然更难实现和训练，但与 n-gram 方法相比通常会提高准确性。如果您想阅读这方面的内容，我建议 Sutton and McCallum's excellent introduction .

关于GoLang PoS Tagger 脚本花费的时间比终端没有输出的时间长，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/23319311/

24

4

0

文章推荐： go - Go 中 slice 排序的意外基准测试结果

文章推荐： xml - 使用 xpath 的元素嵌套计数表达式

文章推荐： Golang 十六进制编码

Powershell 脚本 - 脚本 - 我如何禁用它
我有 powershell 脚本。通过调度程序，我运行 bat 文件，该文件运行 PS1 文件。 BAT文件 Powershell.exe -executionpolicy remotesigned
Jquery - getScript 版本<脚本>..
什么更快？或者 $.getScript('../js/SOME.js', function (){ ... // with $.ajaxSetup({ cache: true });
linux - Bash 脚本 Shell 脚本
需要bash脚本来显示文件 #!/bin/bash my_ls() { # save current directory then cd to "$1" pushd "$1" >/dev/nu
ksh - Unix 脚本 - 需要提高性能的建议(shell 脚本)
我有一个输入 csv 文件，实际上我需要在输入文件中选择第 2 列和第 3 列值，并且需要转换两个值的时区(从 PT 到 CT)，转换后我需要替换转换后的时区值到文件。注意: 所有输入日期值都在太平
Bash 脚本 - 编写 init.d 脚本
我正在使用/etc/init.d/httpd 作为 init.d 脚本的模板。我了解文件中发生的所有内容，但以下行除外: LANG=$HTTPD_LANG daemon --pidfile=${pid
python - 将具有多个子选项的命令行选项传递给 python 脚本 -- shell 脚本
我有以下选择: python runscript.py -O start -a "-a "\"-o \\\"-f/dev/sda1 -b256k -Q8\\\" -l test -p maim\""
linux - 用于重命名文件的 Shell 脚本 - Shell 脚本
我对 shell 脚本完全陌生，但我需要编写一个 shell 脚本来检查文件是否存在，然后移动到另一个位置这是我写的: 一旦设备崩溃，我就会在/storage/sdcard1/1 中收集日志 #!/
linux - Bash 脚本 - Bash 脚本 - 编辑文件中文本的行
我正在使用 bash 脚本从文本文件中读取数据。数据: 04:31 Alex M.O.R.P.H. & Natalie Gioia - My Heaven http://goo.gl/rMOa2q
php - 按下按钮运行 php 脚本，该脚本会回显 javascript 脚本
这是单击按钮时运行的 javascript 的结尾 xmlObj.open ('GET', /ajax.php, true); xmlObj.send (''); } 所以这会执行根目录中的php脚本
linux - 重新激活 python 脚本 - Linux bash 脚本
关闭。这个问题需要debugging details .它目前不接受答案。编辑问题以包含 desired behavior, a specific problem or error, and th
python - Nodejs 脚本 fs.createReadStream 到 Python 脚本
我需要将文件转换为可读流以通过 api 上传，有一个使用 fs.createReadStream 的 Node js 示例。任何人都可以告诉我上述声明的 python 等价物是什么？例子 const
python - 从 shell 脚本 cron 调用 python 脚本
我有一个 shell 脚本 cron，它从同一目录调用 python 脚本，但是当这个 cron 执行时，我没有从我的 python 脚本中获得预期的输出，当我手动执行它时，我的 python 脚本的
javascript - 安全的 ajax 脚本(javascript 请求的 PHP 脚本)
如何使 XMLHttpRequest (ajax) 调用的 php 脚本安全。我的意思是，不让 PHP 文件通过直接 url 运行，只能通过脚本从我的页面调用(我不想向未登录的用户显示数据库结果，并
脚本 block 错误中的经典 asp 脚本 block 中的 javascript
我正在尝试添加以下内容我正在使用经典的 asp。但我不断收到的错误是“一个脚本 block 不能放在另一个脚本 block 内。”我尝试了此处的 document.write 技术:Javasc
php - 如何从一个 PHP 脚本(如批处理文件)中运行多个 PHP 脚本？
如何从另一个 PHP 脚本(如批处理文件)中运行多个 PHP 脚本？如果我了解 include 在做什么，我认为 include 不会起作用；因为我正在运行的每个文件都会重新声明一些相同的函数等。我想
html - 如何从 HTML5 脚本/文件/页面调用 Lua 脚本
我想创建具有动态内容的网页。我有一个 HTML 页面，我想从中调用一个 lua 脚本如何调用 lua 脚本？ ? ？从中检索数据？我可以做类似的事情吗: int xx = 0; xx
jquery - 表格行不会自动滚动。脚本 1 滚动，脚本 2 不滚动。为什么？
我删除了我的第一个问题，并重新编写了更多细节和附加 jSfiddle domos。我有一个脚本，它运行查询并返回数据，然后填充表。表中的行自动循环滚动。所有这些工作正常，并通过使用以下代码完成。然而
javascript - amp-script 未找到脚本哈希。 amp-脚本[脚本 ="hello-world"]
我尝试使用 amp 脚本，但收到此错误: “[amp-script] 脚本哈希未找到。amp-script[script="hello-world"].js 必须在元[name="amp-script
java - 从 Java 执行 Shell 脚本，具有读取操作的 Shell 脚本
我有一个读取输入的 Shell 脚本 #!/bin/bash echo "Type the year that you want to check (4 digits), followed by [E
arrays - Redis Lua 脚本 - 如何将数组作为参数传递给 nodejs 中的 Lua 脚本？
我正在从 nodejs 调用 Lua 脚本。我想传递一个数组作为参数。我在 Lua 中解析该数组时遇到问题。下面是一个例子: var script = 'local actorlist = ARGV

首页

博学

6Ren·AI

商城

GoLang PoS Tagger 脚本花费的时间比终端没有输出的时间长