python - gensim word2vec : Find number of words in vocabulary-6ren

python - gensim word2vec : Find number of words in vocabulary

转载作者：IT老高更新时间：2023-10-28 22:20:09

30

4

使用 python 训练 word2vec 模型后 gensim ，如何找到模型词汇表中的单词数？

最佳答案

在最近的版本中，model.wv 属性包含单词和向量，并且 can 本身可以报告长度 - 它包含的单词数。因此，如果 w2v_model 是您的 Word2Vec(或 Doc2Vec 或 FastText)模型，那么只需这样做:

vocab_len = len(w2v_model.wv)

如果您的模型只是一组原始词向量，例如 KeyedVectors 实例而不是完整的 Word2Vec/etc 模型，那么它只是:

vocab_len = len(kv_model)

Gensim 4.0+ 中其他有用的内部组件包括 model.wv.index_to_key，每个索引位置的键(单词)的普通列表，以及 model.wv.key_to_index，一个普通的字典，将键(单词)映射到它们的索引位置。

在 4.0 之前的版本中，词汇表位于 Word2Vec 模型的 wv 属性的 vocab 字段中，作为字典，键是每个标记(单词) .所以这只是获取字典长度的常用 Python:

len(w2v_model.wv.vocab)

在 0.13 之前的非常古老的 gensim 版本中，vocab 直接出现在模型上。所以回到那时你会使用 w2v_model.vocab 而不是 w2v_model.wv.vocab。

但是，如果您仍在使用 Gensim 4.0 之前的任何东西，那么您绝对应该升级!内存和性能有了很大的改进，调用代码所需的更改相对较小——一些重命名和移动，在 4.0 Migration Notes 中有介绍。 .

关于python - gensim word2vec : Find number of words in vocabulary，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/35596031/

30

4

0

文章推荐： android - 在 Android Studio 中更改 Github 帐户

文章推荐： c++ - 运行C++程序时出现"The system cannot find the file specified"

文章推荐： android - 有什么方法可以将 View 稍微放在其父布局之外？

mongodb - pymongo find() vs mongodb find()，pymongo find() 给出的文档数据较少
我有一个合作伙伴集合，我正在使用 pymongo 来检索数据当我使用 MongoDB 查询集合时，我看到以下结果 db.partner.find({'unique_key': 'c89dbe313
find - Linux find 命令有什么问题？
嗨，我正在尝试在一个 find 命令中查找所有 js 和 css 文件。我尝试了以下所有方法但徒劳无功: find WebContent -name "*.[jc]ss?" find WebConte
find - 使用 find 命令搜索所有具有某种文本模式的文件
我使用以下 find 命令查找并显示所有具有输入文本模式的文件。找。 -type f -print|xargs grep -n "模式" 我有很多项目文件夹，每个文件夹都有自己的名为“Makefi
find - Gnuwin32 find.exe在执行搜索之前会扩展通配符
我在Windows环境中使用Gnuwin32二进制文件。当我想查找某种类型的文件时（例如PDF），我通常运行： find . -iname '*.pdf' -print 这在任何UNIX系统上均可完
find - 使用带有两个向量的 find() 函数
我使用的是 Julia 编程语言，我知道你可以通过以下方式使用 find 函数: a = [ 1 2 3 4 3 5 3 6 7 8 9 3 ] find(a .== 3) 它将返回:3,5,7,12
javascript - find ('a,b' ) 比 find ('a' )+find ('b' 慢，为什么？
jsperf's link 我不是 jQuery 专家(甚至不是一个好的用户)，我没有研究它的整个源代码(只有一小部分不能帮助我解决这个问题)。有人可以为我解释一下吗？最佳答案这个: $p.fi
python -/cs/software/anaconda3/compiler_compat/ld : cannot find -lm cannot find -lpthread cannot find -lc
我应该如何在 CentOS 7 中修复这个错误？ [jalal@goku HW4]$ git clone https://github.com/pathak22/pyflow.git Cloning
find - 更改 {} 的参数 find exec
是否可以更改传递给 find 中的 exec 的参数？例如，我需要以不同的名称复制文件:*.txt -> *.new.txt现在我正在为两个命令执行此操作: find /root/test -name
find - clearcase: find -name 不允许多个模式？
我想通过cleartool find 命令找到*.cs 和*.cpp 文件。但它失败了。 cleartool find "M:\test_view\code" -name "*.cs *.cpp"
python - pymongo find() 与 find()[:]?
我正在使用 PyMongo，看到有人建议使用 find()[:] 而不是 find()。很好奇有什么区别？最佳答案 [:] 制作列表的浅拷贝，因此对对象的引用是相同的。我查看了 Pymongo 文档
ruby - 如何处理 Find.find 中的异常
我正在处理文件和目录，以在每个目录中查找最近修改的文件。我的代码可以工作，但作为 Ruby 的新手，我无法正确处理错误。我使用 Find.find 获取递归目录列表，为每个目录调用我自己的函数 ne
c++ -/usr/bin/ld : cannot find -ldlib/usr/bin/ld: cannot find -lcblas/usr/bin/ld: cannot find -llapack
/usr/bin/ld: cannot find -ldlib /usr/bin/ld: cannot find -lcblas /usr/bin/ld: cannot find -llapack 在
find - bash find 链接到一个 grep 然后打印
我有一些数据文件的一系列索引文件，它们基本上采用这种格式索引文件:asdfg.log.1234.2345.index 数据文件:asdfg.log 这个想法是搜索所有索引文件。如果值 XXXX 出现
find - 如何防止 find 打印 .git 文件夹？
我有一个 find我运行以查找名称包含 foo 的文件的命令. 我想跳过 .git目录。下面的命令有效除了它打印一个烦人 .git任何时候它跳过 .git目录: find . ( -name .
find - 'find' 与 'xargs' 和 'tar'
我有以下想做的事情: find . -maxdepth 6 \( -name \*.tar.gz -o -name bediskmodel -o -name src -o -name ciao -o
javascript - 在 find 的结果集上使用 jquery find
当我在表中查找隐藏字段时，我看到了两个隐藏字段。但是，我想通过 ID 进一步细化这两个字段。我注意到，当我使用“包含”在整个表上使用 find 时，我得到了 2 个字段。但是，如果我对隐藏字段的查找结
find - 列出所有文件的 md5sum : find command with xargs?
我正在使用下面的命令生成文件列表及其 m5sum。问题是某些文件或文件夹的名称中有空格。我将如何处理这些？ find -type f -name \* | xargs md5sum 最佳答案尝试:
find - 列出所有文件的 md5sum : find command with xargs?
我正在使用下面的命令生成文件列表及其 m5sum。问题是某些文件或文件夹的名称中有空格。我将如何处理这些？ find -type f -name \* | xargs md5sum 最佳答案尝试:
regex - Find -regex 比 find | 慢grep
我有一个使用正则表达式查找文件的脚本。代码如下: find $dir | grep "$regex" 脚本运行有点慢，我想优化一下。搜索需要一些时间来执行，我想从中获得更好的性能。我试过这种尝试: f
javascript - 类型错误 : Cannot find function find in object
这令人沮丧。我认为问题出在 api 响应返回的对象上。也许它是在字符串中，所以我所做的就是复制“postman”的响应并将其直接粘贴到js上。这样我就可以确定它在对象/数组中。但结果还是同样的错误。

首页

博学

6Ren·AI

商城

python - gensim word2vec : Find number of words in vocabulary