python - 边界上的拆分词-6ren

python - 边界上的拆分词

转载作者：太空宇宙更新时间：2023-11-03 16:05:59

25

4

我有一些推文，我希望将其拆分成单词。大部分功能都可以正常工作，除非人们组合使用以下单词:trumpisamoron 或 makeamericagreatagain。但还有一些诸如 password 之类的内容不应分为 pass 和 word。

我知道 nltk 包有一个 punkt tokenizer 模块，它以智能的方式分割句子。词有类似的东西吗？即使它不在 nltk 包中？

注意:password -> pass + word 的示例比拆分单词问题问题要小得多。

最佳答案

引用:我对另一个问题的回答 - Need to split #tags to text .

我对此答案所做的更改是 - (1) 使用不同的语料库来获取 WORDS 和 (2) 添加了 def memo(f) 以加快处理速度。您可能需要添加/使用语料库，具体取决于您正在处理的域。

检查 - Word Segmentation Task来自Norvig的工作。

from __future__ import division
from collections import Counter
import re, nltk
from datetime import datetime

WORDS = nltk.corpus.reuters.words() + nltk.corpus.words.words()
COUNTS = Counter(WORDS)

def memo(f):
    "Memoize function f, whose args must all be hashable."
    cache = {}
    def fmemo(*args):
        if args not in cache:
            cache[args] = f(*args)
        return cache[args]
    fmemo.cache = cache
    return fmemo

def pdist(counter):
    "Make a probability distribution, given evidence from a Counter."
    N = sum(counter.values())
    return lambda x: counter[x]/N

P = pdist(COUNTS)

def Pwords(words):
    "Probability of words, assuming each word is independent of others."
    return product(P(w) for w in words)

def product(nums):
    "Multiply the numbers together.  (Like `sum`, but with multiplication.)"
    result = 1
    for x in nums:
        result *= x
    return result

def splits(text, start=0, L=20):
    "Return a list of all (first, rest) pairs; start <= len(first) <= L."
    return [(text[:i], text[i:]) 
            for i in range(start, min(len(text), L)+1)]

@memo
def segment(text):
    "Return a list of words that is the most probable segmentation of text."
    if not text: 
        return []
    else:
        candidates = ([first] + segment(rest) 
                      for (first, rest) in splits(text, 1))
        return max(candidates, key=Pwords)

print segment('password')     # ['password']
print segment('makeamericagreatagain')     # ['make', 'america', 'great', 'again']
print segment('trumpisamoron')     # ['trump', 'is', 'a', 'moron']
print segment('narcisticidiots')     # ['narcistic', 'idiot', 's']

有时，如果单词分散成较小的标记，则该单词不存在于我们的 WORDS 词典中的可能性可能会更高。

在最后一段中，它将 narcisticidiots 分解为 3 个标记，因为标记 idiots 不存在于我们的 WORDS 中。

# Check for sample word 'idiots'
if 'idiots' in WORDS:
    print("YES")
else:
    print("NO")

您可以将新的用户定义单词添加到WORDS。

.
.
user_words = []
user_words.append('idiots')

WORDS+=user_words
COUNTS = Counter(WORDS)
.
.
.
print segment('narcisticidiots')     # ['narcistic', 'idiots']

为了获得比这更好的解决方案，您可以使用二元组/三元组。

更多示例:Word Segmentation Task

关于python - 边界上的拆分词，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/39781936/

25

4

0

文章推荐： c# - WPF 窗体的布局 - 水平列表框

文章推荐： C# ExcelPackage 将单元格类型设置为数字

文章推荐： python - Django:扩展其他应用程序的模型

ios - UILabel 分词
大家好，其实我快疯了，我竭尽全力解决这个简单的问题。如您所见，狭窄空间中的简单标签导致单个单词“Verification”被分成两行，这当然是 Not Acceptable 。我知道我只能将行数设
Python - 分词、替换单词
我正在尝试创建类似句子的东西，其中包含随机单词。具体来说，我会有类似的东西: "The weather today is [weather_state]." 并且能够做一些事情，比如找到 [brack
响应式导航栏中的 HTML 分词
我希望我的导航栏 (.top-bar) 比现在更具响应性。目前，如果屏幕缩小太多，.top-bar-right 类只会下降到 .menu 类之下。我需要 .top-bar-right 来分割自己或打破
C 命令行参数，分词
我正在尝试编写一个函数来将命令行参数解析为一个 vector 。问题是我似乎无法消除使用全局指针数组作为 vector 。代码是: /** parse command line arguments
Python:用一个字符序列找出所有可能的单词组合(分词)
我正在做一些分词实验，如下所示。 lst是一个字符序列，output是所有可能的词。 lst = ['a', 'b', 'c', 'd'] def foo(lst): ... retu
c++ - 动态规划 - 分词
我正在尝试解决 this问题。问题如下给定一个输入字符串和一个单词字典，看看是否可以将输入字符串分割成以空格分隔的字典单词序列。字典是一个字符串数组。我的方法是以下递归 fn 并存储递归调用的结
java - leetcode 139. 分词
我正在研究这个问题。似乎我找到了正确的答案并返回 true，但随后它被 false 覆盖。Java 新手，抱歉，如果这是一个虚拟问题。我如何返回 true？预先感谢您问题给定一个字符串 s 和一本单
javascript - 分词 css 选项无效
我正在使用 word-break css 属性，但即使是一个简单的示例似乎也无法让它工作。我的代码是: react : render() { return ( A very very lo
css - 内联元素的 Firefox 分词
我正在尝试更改 word-break某些内联元素的属性，例如和以获得更好的页面内容流。 Firefox 似乎只识别显示为 block 的元素的分词属性(例如 )，而 Chrome 尊重分词的请求
C - 从 scanf 分词
我想标记用户输入的任何字符串。我的代码是这样的: #include #include #include int main(void) { char str; char *toke
html - 分词 css 未相应对齐
有没有办法让单词正确对齐？我尝试添加 word-break 和 word-wrap 属性，但没有任何不同。 Subtotal S$42.50 Tota
linux - 防止子字符串中的 Bash 分词
如何防止 Bash 拆分子字符串中的单词？这是一个有点人为的例子来说明这个问题: touch file1 'foo bar' FILES="file1 'foo bar'" ls -la $FILES
css - 分词，更喜欢正常，但如果不可能，则全部中断
我正在创建一个非常薄的页面(它被打印在收据纸上:56 毫米宽) 我正在尝试显示一些文本(在本例中为运送选择)。有时这个文本是正常的一些间隔单词，例如'Signed for 1st Class'，有时是
bash - 如何在 bash 中控制 IFS 分词
我正在尝试弄清楚 IFS 如何影响 bash 中的分词。该行为依赖于上下文，其方式似乎与分词的直觉不符。总体思路似乎很简单。引自 bash 手册页: The shell treats each ch
html - iOS7 webkit 上的 Span 分词
今天我 Handlebars 机升级到 iOS7，发现了一些奇怪的问题。 (博客.niwyclin.org)这是我网站的测试帖子页面在桌面浏览器上它看起来不错。我用Responsivator查了一
javascript - chrome 中标点符号的 js 分词、全部使用出现问题
我在 jsfiddle 中有以下示例: https://jsfiddle.net/27L545rr/3/ Word-break should cause just the extra charact
java - 解析/扫描/分词 "raw XML"
我有一个应用程序，我需要解析或标记 XML 并保留原始文本(例如，不解析实体、不转换属性中的空格、保持属性顺序等)在 Java 程序中。我今天花了几个小时尝试使用 StAX、SAX、XSLT、Tag
css - 如何使用 CSS 使 Firefox 分词？
到目前为止，这是我的代码: ssssssssssssssssssssssssssssssssssssss 但是， word-wrap:break-word; word-br
html - CSS3 分词 Firefox 和 Chrome 输出不同
我正在尝试使用 word-break打破一个长字符超过其父宽度的单词。在这个例子中，我有一个与 width:43px和里面的“玩”字。在 chrome 中，这个词很合适，但在 Firefox 中，
python - 为什么 gensim 的 simple_preprocess Python 分词器似乎跳过了 "i"分词？
list(gensim.utils.simple_preprocess("i you he she I it we you they", deacc=True)) 给出结果: ['you', 'he'

首页

博学

6Ren·AI

商城

python - 边界上的拆分词