python - 二元组和单词排名-6ren

python - 二元组和单词排名

转载作者：行者123 更新时间：2023-11-30 23:46:26

24

4

我使用此代码来获取二元组的频率:

text1='the cat jumped over the dog in the dog house'
text=text1.split()

counts = defaultdict(int)
for pair in nltk.bigrams(text):
    counts[pair] +=1

for c, pair in ((c, pair) for pair, c in counts.iteritems()):
    print pair, c

输出是:

('the', 'cat') 1
('dog', 'in') 1
('cat', 'jumped') 1
('jumped', 'over') 1
('in', 'the') 1
('over', 'the') 1
('dog', 'house') 1
('the', 'dog') 2

我需要的是列出二元组，但我需要打印单词的排名，而不是每个单词。当我的意思是“排名”时，我的意思是频率最高的单词排名为 1，第二个单词排名为 2 等...这里的排名是: 1.the 2.dog 和频率相同的单词按降序分配排名。 3.猫4.跳5.过等等..

例如

1 3 1

而不是

('the', 'cat') 1

我相信要做到这一点，我需要一本包含单词及其排名的字典，但我陷入困境，不知道如何继续。我所拥有的是:

fd=FreqDist()
ranks=[]
rank=0
for word in text:
    fd.inc(word)
for rank, word in enumerate(fd):
    ranks.append(rank+1)

word_rank = {}
for word in text:
    word_rank[word] = ranks

print ranks

最佳答案

假设已经创建了 counts，以下内容应该会得到您想要的结果:

freq = defaultdict(int)
for word in text:
    freq[word] += 1

ranks = sorted(freq.keys(), key=lambda k: (-freq[k], text.index(k)))
ranks = dict(zip(ranks, range(1, len(ranks)+1)))

for (a, b), count in counts.iteritems():
    print ranks[a], ranks[b], count

输出:

以下是一些可能有助于理解其工作原理的中间值:

>>> dict(freq)
{'house': 1, 'jumped': 1, 'over': 1, 'dog': 2, 'cat': 1, 'in': 1, 'the': 3}
>>> sorted(freq.keys(), key=lambda k: (-freq[k], text.index(k)))
['the', 'dog', 'cat', 'jumped', 'over', 'in', 'house']
>>> dict(zip(ranks, range(1, len(ranks)+1)))
{'house': 7, 'jumped': 4, 'over': 5, 'dog': 2, 'cat': 3, 'in': 6, 'the': 1}

关于python - 二元组和单词排名，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/8931512/

24

4

0

文章推荐： jquery - 如何处理 Backbone.js 集合请求中的 204 响应

文章推荐： python - 验证 get 请求中的表单，如何？

文章推荐： python - osx python - 如何解码 sys.argv？

文章推荐： python - 在 Tkinter 文本小部件中交换行

r 元素频率和索引，排名
我正在查看下面的示例代码， r element frequency and column name 并且想知道除了r中的排名和频率之外，是否有任何方法可以显示每列中每个元素的索引。因此，例如，所需的输
sql - 如何根据列的变化值对记录进行分组/排名？
我有下表按 Id、Year DESC 排序 ID 年份有效 1 2011 1 1 2010 1 1 2009 0 1 2002 1 4 2013 1 4 2012 1 4 2011 1 等等。我想要
SQL 排名，同时保持时间排序
鉴于此数据 Type Time Outcome Wanted Result 1 8:00 1 1 1 9:00 1 1 1 10:00 1 1 0
Java - 排名/匹配句子
我正在寻找一种对两个句子进行排名/匹配的方法。例如，取以下2个例句。这是一个简短的句子。这是一个包含很多单词的长句子。我的新句子是这是一个句子。我想将我的新句子与现有句子进行比较。我的新句子
python - Scikit分类比较/排名
我是 scikit 新手，我正在按照此处的示例 http://scikit-learn.org/stable/tutorial/text_analytics/working_with_text_dat
Mysql - 获取用户上下5行(排名)
我有一张 table : r_user | r_points | -------------------- user1 | 12 | user2 | 124 | use
MySql - 排名，给定玩家的排名及周围
我需要获得顶级玩家、给定玩家的排名以及与该给定玩家排名相关的少数玩家。为了更清楚地解释，下表是我想要的，它显示了得分最高的 3 名玩家、给定玩家的排名 (id=11) 以及得分略高于和低于该给定玩家
MySQL右外连接空值，所有用户的排名(排名)
我正在尝试创建一个排名(排名)查询。我使用表users、schedule 和picks来计算排名。然而，这样做的缺陷是，如果用户未提交任何选择，则该用户将不会出现在排名中。下面的查询返回所有已提交
php - 选择标识符并显示其中的行/排名
这个问题已经有答案了: 已关闭10 年前。 Possible Duplicate: High score system from my iphone game 我的查询是: $sql = "SELEC
mysql - 根据比赛表中的胜率获取排名/排名
我有一个玩家表和MatchUps表。 MatchUps 表具有一个 winner_id 列和一个 loser_id 列。我可以根据一次查询的胜率获得排名/排名吗？如果我能为每个玩家返回这样的东西，那就
php - 排名/天梯系统
我正在尝试创建一个排名/阶梯系统，其中排名最高的氏族 (1) 应位于顶部，排名为 2 的氏族应位于顶部，依此类推。但我无法让它工作......我尝试了不同的方法: PHP: $sql = mysql_
MySQL 排名(排名靠前的用户)
我需要一份游戏中排名最高的玩家列表。排名是即时计算的，数据取自两个表。我设法以正确的方式对它们进行排序，但是@rank:=0 -> @rank:=@rank+1 技巧，其中一个名为 rank 的附加字
mySQL 排名(和抽奖)
下周末我们将进行一场包含 3 项资格赛(半决赛和决赛)的比赛。只有最好的 15 名参赛者才能参加半决赛。只有最好的 6 人才能参加总决赛。在资格考试中，每项资格考试的分数从 0 到 100 不等我
php - 排名/人气系统
我正在尝试找出对我的产品进行加权的最佳方式，以及它们应该以何种顺序出现在主页等地方。我想处理四个指标并将其转化为排名: 购买产品产品有多久了(以天为单位) 产品被保存了多少次产品被浏览了多少次
使用变量在存在索引的情况下进行 MySQL 排名
使用 @N=@N + 1 的经典技巧来获取某些有序列上的项目排名。现在在订购之前，我需要通过将它与其他表内部连接来从基表中过滤掉一些值。所以查询看起来像这样 -: SET @N=0; SELECT
并列情况下的 MySQL 排名
我需要一些帮助来处理在 MySQL 中排名时的关系。例如: 播放器 |积分玛丽:90 鲍勃:90 吉姆:65 凯文:12 Bob 和 Mary 应该都排名第一。吉姆应该是#3。凯文应该是#4。 My
arrays - 具有特定强度的下一个排列/排名
我正在寻找一种算法，该算法可以为我提供具有特定强度的下一个排列。长度为 n 的排列由元素 (1,2,3,...n) 定义排列的强度是多少？长度为 10 的排列的强度定义为 |a1-a2|+|a2-
algorithm - 排名/信誉算法
我正在编写一个具有信誉组件的电子商务引擎。我希望用户能够对项目进行评论和评分，并能够对评论进行评分。用于根据“最佳”评论对项目进行排序的最佳算法是什么？它必须根据给出最佳评论的人获得的质量评论数量进
MySQL Volley 排名
我有一个按游戏结果填满游戏的数据库表，想知道我是否可以计算以下内容: GP(玩过的游戏) 获胜失败积分(每胜2分，每负1分) 这是我的表结构: CREATE TABLE `results` (
MySQL:获取特定行的行号(排名)
我有一个 users 表，其中有一列名为 money_sent。我想按 money_sent 降序排列此表，然后找出特定用户的“排名”。例如，只有 111 人比用户 12392 花费更多的钱，因此他

首页

博学

6Ren·AI

商城

python - 二元组和单词排名