- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我正在尝试使用训练数据训练 doc2vec 模型,然后使用以下方法查找测试数据中特定文档的测试数据中的相似性经过训练的 doc2vec 模型。但是,我无法确定如何执行此操作。
我目前使用model.docvecs.most_similar(...)
。但是,此函数只能查找训练数据中每个文档与测试数据中特定文档的相似性。
我尝试使用 model.docvecs.n_similarity(inferred_vector.tolist(), testvectors[i].tolist())
手动将测试数据中特定文档的推断向量与测试数据中每个其他文档的推断向量进行比较但这会返回 KeyError: "tag '-0.3502606451511383' not seen in training corpus/invalid"
因为字典中没有向量。
最佳答案
训练 Doc2Vec
模型的行为会留下从训练数据中学习到的文档向量的记录,是的,most_similar()
只是看起来在这些向量中。
通常,对新文档执行任何不属于训练的操作都需要使用 infer_vector()
。请注意这样的推论:
most_similar()
的比较另一方面,来自“卡住”模型的此类推理可以跨进程或机器并行化。
您提到的 n_similarity()
方法并不真正适合您的需求:它需要现有文档向量的查找键(“标签”)列表,不是 像您提供的原始向量。
您在答案中提到的 similarity_unseen_docs()
方法有点合适,但只需要一对文档,每次重新计算它们的向量 - 如果单个新文档的文档向量有点浪费需要与许多其他新文档的文档向量进行比较。
您可能只想使用“训练文档”和“测试文档”来训练一个全新的模型。然后,作为批量训练的一部分,所有“测试文档”都会计算其文档向量,并将其存储在模型中。对于许多可能的应用程序来说,这是一个适当的选择,并且确实可以基于仅以完全无监督的方式出现在“测试文档”中的单词来学习有趣的关系。而且您的问题中还没有任何部分可以解释为什么这里不能考虑它。
或者,您需要infer_vector()
所有新的“测试文档”,并将它们放入类似于中的各种
- 记住一个数组中的所有向量,记住从 doc-key 到向量索引的映射,并在一组向量上提供高效的批量 KeyedVectors
实用程序类的结构中>gensimmost_similar()
。
关于python - Doc2Vec - 查找测试数据中的文档相似性,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/55924378/
我编写了一个 c# 程序,并在未安装 MS-Office 的 PC 中将其与文件扩展名(如 DOC)相关联。然后,我双击名称中包含空白字符的任何文件,我的程序将启动以打开该文件。我使用了以下语句: s
我试过创建、批量更新、从 https://developers.google.com/docs/api/how-tos/overview 获取. 即使在 batchUpdate 中,我也看不到编辑 t
关闭。这个问题不符合Stack Overflow guidelines .它目前不接受答案。 这个问题似乎不是关于 a specific programming problem, a softwar
我正在尝试使用新 API 更新 Google 文档中的表格。表格链接自 Google 表格。 我尝试了谷歌云中的 API 资源管理器。我能够以 json 格式提取文档,然后过滤出表格。但是在表 jso
将 Google Docs Java API 与 Google Apps 帐户一起使用,是否可以模拟用户并下载文件? 当我运行下面的程序时,它显然是登录到域并冒充用户,因为它检索其中一个文件的详细信息
我试图通过 apidoc 生成 API 文档 如果我的回应是一个数组 [ {"id" : 1, "name" : "John"}, {"id" : 2, "name" : "Mary"}
是否可以在没有身份验证的情况下在 Google Docs 中查询公开共享的用户文档? 我正在寻找的特定最终目标是能够提供用户 ID,然后列出所有公开共享的文档,并在集合中带有特定标记。 谢谢。 最佳答
我对Elasticsearch映射感到困惑 首先,我创建了一个带有映射请求的文档 PUT /person { "mappings":{ "properties":{ "firs
我有一个可在一个电子表格中运行的 Google 文档查询。但是,当我复制电子表格时,查询不起作用,并且收到解析错误:无法解析函数 QUERY 参数 2 的查询字符串:NO_COLUMNCol2。 我的
我有一个如下所示的 XML 文档: _1 _2 TASK _3 TASK 我必须使用第一个文档中的节点属性创建另一
我没有看到什么? RTD features页面说: PDF Generation When you build your project on RTD, we automatically build
我有一个网页,我在 iFrame 中嵌入了一个 Google 文档查看器 (其中 URL-encoded-URL 是实际编码的 URL)。 对于我的许多/大多数用户,Google PDF 文档查看器
我如何在我的项目中使用 GOOGLE DOCS,我正在使用 asp.net 和 C# 作为后面的代码。 基本上我需要在浏览器中以只读形式显示一些 pdf、doc、dox、excel 文档。 提前致谢
从看起来像的 Google Doc 开始: * Item 我希望进行一系列 API 调用以将文档转换为: * Item - Subitem 但是,我不知道如何使用 API 做到这一点。 Crea
我需要控制我网站中嵌入的 Google 文档查看器。更具体地说,我需要能够启用/禁用 Google 幻灯片 View 的控件,并能够使用 JavaScript 启动/停止演示文稿。 我无法为此找到任何
我想使用 Google Docs API 将页眉和页脚添加到现有的 Google 文档文件中. 看着documents.batchUpdate ( link ) 我们可以插入文本、替换文本、添加图像和
已关闭。此问题不符合Stack Overflow guidelines 。目前不接受答案。 这个问题似乎与 help center 中定义的范围内的编程无关。 . 已关闭 4 年前。 Improve
我已按照 GitHub 的文档进行操作,并使用 docs 成功发布了我的项目页面。我的项目存储库下的文件夹。但我想知道如何解决这个小问题: 我正在开发一个 JavaScript 库 wesa.js ,
我的程序正在创建文档,每个文档都有需要放入其中的文本。任何调用 InsertTextRequest 的尝试调用错误。 List requests = new ArrayList<>(); reques
基于此: Set field to automatically insert time-stamp on UPDATE? 我正在尝试创建适合我需要的触发器,但我发现使用 OLD 和 NEW 关键字不方
我是一名优秀的程序员,十分优秀!