- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我有一个非常大的语料库作为我的 doc2vec 训练的输入,大约有 2300 万个文档使用可迭代函数流式传输。我想知道是否完全有可能看到我的训练进度的发展,可能是通过找出它当前进行的迭代、每秒字数或一些类似的指标。
除了减小语料库的大小之外,我还想知道如何加快 doc2vec 的性能。我发现了 workers 参数,目前我正在训练 4 个进程;这个数字背后的直觉是多处理不能利用虚拟核心。我想知道 doc2vec workers 参数是否属于这种情况,或者我是否可以使用 8 个 worker 代替甚至可能更高(我有一个四核处理器,运行 Ubuntu)。
我必须补充一点,使用 unix 命令 top -H
仅报告使用 8 个工作人员时每个 python 进程的 CPU 使用率约为 15%,而使用 4 个工作人员时每个进程的 CPU 使用率约为 27%。
最佳答案
如果您在 INFO 级别启用日志记录,您应该会看到大量的进度输出。正在关注gensim
's Doc2Vec tutorial , 那看起来像
import logging
logging.basicConfig(format='%(asctime)s : %(levelname)s : %(message)s', level=logging.INFO)
gensim 的 Word2Vec
或 Doc2Vec
模型的最佳吞吐量通常在 3 到 12 之间的某个 workers
级别,但绝不会超过可用的处理器内核数。 (如果您使用特定的磁盘语料库格式,则有一个进一步的优化对于具有更多内核的机器特别有用,该格式在最新的 3.6.0 gensim 版本中可用 - 请参阅 release notes 了解更多信息。)
如果您在 4 核、4 工作人员设置上看到如此低的利用率,瓶颈可能是您的语料库迭代器。如果它正在执行任何复杂的 IO 或基于正则表达式的文本处理,那么训练工作线程通常会空闲,等待一个主语料库迭代器线程生成更多文本,从而限制整体利用率和效率。
您应该尝试将复杂的事情做一次,然后将标记/标记化的结果作为更简单的文件重新写入磁盘。然后使用一个非常简单的以行和空格分隔的迭代器阅读它以进行实际模型训练。
(如果您的 4 个核心实际上支持更多的虚拟核心,则某些 workers
值高达 8 可能会实现更高的吞吐量......但只能通过反复试验,使用您的特定模型参数,目前可以找到您的局部最优值。最优值可能随其他参数(如 size
、window
、negative
等)而变化)
关于python - doc2vec:性能测量和 'workers' 参数,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/53639236/
我编写了一个 c# 程序,并在未安装 MS-Office 的 PC 中将其与文件扩展名(如 DOC)相关联。然后,我双击名称中包含空白字符的任何文件,我的程序将启动以打开该文件。我使用了以下语句: s
我试过创建、批量更新、从 https://developers.google.com/docs/api/how-tos/overview 获取. 即使在 batchUpdate 中,我也看不到编辑 t
关闭。这个问题不符合Stack Overflow guidelines .它目前不接受答案。 这个问题似乎不是关于 a specific programming problem, a softwar
我正在尝试使用新 API 更新 Google 文档中的表格。表格链接自 Google 表格。 我尝试了谷歌云中的 API 资源管理器。我能够以 json 格式提取文档,然后过滤出表格。但是在表 jso
将 Google Docs Java API 与 Google Apps 帐户一起使用,是否可以模拟用户并下载文件? 当我运行下面的程序时,它显然是登录到域并冒充用户,因为它检索其中一个文件的详细信息
我试图通过 apidoc 生成 API 文档 如果我的回应是一个数组 [ {"id" : 1, "name" : "John"}, {"id" : 2, "name" : "Mary"}
是否可以在没有身份验证的情况下在 Google Docs 中查询公开共享的用户文档? 我正在寻找的特定最终目标是能够提供用户 ID,然后列出所有公开共享的文档,并在集合中带有特定标记。 谢谢。 最佳答
我对Elasticsearch映射感到困惑 首先,我创建了一个带有映射请求的文档 PUT /person { "mappings":{ "properties":{ "firs
我有一个可在一个电子表格中运行的 Google 文档查询。但是,当我复制电子表格时,查询不起作用,并且收到解析错误:无法解析函数 QUERY 参数 2 的查询字符串:NO_COLUMNCol2。 我的
我有一个如下所示的 XML 文档: _1 _2 TASK _3 TASK 我必须使用第一个文档中的节点属性创建另一
我没有看到什么? RTD features页面说: PDF Generation When you build your project on RTD, we automatically build
我有一个网页,我在 iFrame 中嵌入了一个 Google 文档查看器 (其中 URL-encoded-URL 是实际编码的 URL)。 对于我的许多/大多数用户,Google PDF 文档查看器
我如何在我的项目中使用 GOOGLE DOCS,我正在使用 asp.net 和 C# 作为后面的代码。 基本上我需要在浏览器中以只读形式显示一些 pdf、doc、dox、excel 文档。 提前致谢
从看起来像的 Google Doc 开始: * Item 我希望进行一系列 API 调用以将文档转换为: * Item - Subitem 但是,我不知道如何使用 API 做到这一点。 Crea
我需要控制我网站中嵌入的 Google 文档查看器。更具体地说,我需要能够启用/禁用 Google 幻灯片 View 的控件,并能够使用 JavaScript 启动/停止演示文稿。 我无法为此找到任何
我想使用 Google Docs API 将页眉和页脚添加到现有的 Google 文档文件中. 看着documents.batchUpdate ( link ) 我们可以插入文本、替换文本、添加图像和
已关闭。此问题不符合Stack Overflow guidelines 。目前不接受答案。 这个问题似乎与 help center 中定义的范围内的编程无关。 . 已关闭 4 年前。 Improve
我已按照 GitHub 的文档进行操作,并使用 docs 成功发布了我的项目页面。我的项目存储库下的文件夹。但我想知道如何解决这个小问题: 我正在开发一个 JavaScript 库 wesa.js ,
我的程序正在创建文档,每个文档都有需要放入其中的文本。任何调用 InsertTextRequest 的尝试调用错误。 List requests = new ArrayList<>(); reques
基于此: Set field to automatically insert time-stamp on UPDATE? 我正在尝试创建适合我需要的触发器,但我发现使用 OLD 和 NEW 关键字不方
我是一名优秀的程序员,十分优秀!