- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我目前正在开发一个基于 Twitter 内容的推荐系统,并拥有一个针对 4 亿条推文进行预训练的 word2vec 模型。
我将如何使用这些词嵌入来创建文档/推文级别的嵌入,然后根据他们发布的推文获取用户嵌入?
我最初打算对具有词向量表示的推文中的这些词进行平均,然后对文档/推文向量进行平均以获得用户向量,但我不确定这是否是最佳的甚至是正确的。非常感谢任何帮助。
最佳答案
对短文本中所有单词的向量进行平均是获得文本摘要向量的一种方法。它通常可以作为快速基线。 (并且,如果您拥有的只是词向量,则可能是您的主要选择。)
如果您根据其他一些相对术语重要性度量(例如 TF-IDF)进行加权平均,或者使用原始词向量(在标准化为单位长度之前,作为预标准化),这种表示有时可能会有所改善原始大小有时可以暗示意义的强度)。
您可以通过平均所有文本来创建用户级向量,或者通过(大致等效)将所有创作的单词放入伪文档中并将所有这些单词平均在一起来创建用户级向量。
您可以通过首先将用户的推文聚类到 N 个簇中,然后将用户建模为簇的 N 个质心向量,从而保留更多用户帖子的多样性,尤其是当他们的兴趣跨越多个领域时。甚至可能每个用户的 N 也会有所不同,具体取决于他们推文的数量或他们推文的主题范围有多广。
对于原始推文,您还可以使用“Paragraph Vector”(在 Python gensim 等库中又名“Doc2Vec”)等算法来训练每条推文向量。但是,这对 RAM 要求可能具有挑战性,需要 4 亿个不同的文件。 (如果您的用户数量较少,也许他们可以是“文档”,或者可以是 FastText-in-classification-mode 训练类(class)的预测类别。)
关于python - word2vec:具有预训练模型的用户级、文档级嵌入,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/53565271/
在为 Web 应用程序用例图建模时,为用户可以拥有的每个角色创建一个角色是否更好?或拥有一个角色、用户和一个具有特权的矩阵? guest < 用户 < 版主 < 管理员 1: guest 、用户、版主
我无法使用 Elixir 连接到 Postgres: ** (Mix) The database for PhoenixChat.Repo couldn't be created: FATAL 28P
这个问题已经有答案了: Group by field name in Java (7 个回答) 已关闭 7 年前。 我必须编写一个需要 List 的方法并返回 Map> . User包含 Person
感谢您的帮助,首先我将显示代码: $dotaz = "Select * from customers JOIN contracts where customers.user_id ='".$_SESS
我只想向所有用户中的一个用户显示一个按钮。我尝试了 orderByKey() 但没有成功! 用户模型有 id 成员,我尝试使用 orderByChild("id") 但结果相同! 我什至尝试了以下技巧
我们在工作中从 MongoDB 切换到 Postgres,我正在建立一个 BDR 组。 在这一步,我正在考虑安全性并尽可能锁定。因此,我希望设置一个 replication 用户(角色)并让 BDR
export class UserListComponent implements OnInit{ users; constructor(private userService: UserS
我可以使用 Sonata User Bundle 将 FOS 包集成到 sonata Admin 包中。我的登录功能正常。现在我想添加 FOSUserBundle 中的更改密码等功能到 sonata
在 LinkedIn 中创建新应用程序时,我得到 4 个单独的代码: API key 秘钥 OAuth 用户 token OAuth 用户密码 我在 OAuth 流程中使用前两个。 的目的是什么?最后
所以..我几乎解决了所有问题。但现在我要处理另一个问题。我使用了这个连接字符串: SqlConnection con = new SqlConnection(@"Data Source=.\SQLEX
我有一组“用户”和一组“订单”。我想列出每个 user_id 的所有 order_id。 var users = { 0: { user_id: 111, us
我已经为我的Django应用创建了一个用户模型 class User(Model): """ The Authentication model. This contains the u
我被这个问题困住了,找不到解决方案。寻找一些方向。我正在用 laravel 开发一个新的项目,目前正致力于用户认证。我正在使用 Laravels 5.8 身份验证模块。 对密码恢复 View 做了一些
安装后我正在使用ansible配置几台计算机。 为此,我在机器上本地运行 ansible。安装中的“主要”用户通常具有不同的名称。我想将该用户用于诸如 become_user 之类的变量. “主要”用
我正在尝试制作一个运行 syncdb 的批处理文件来创建一个数据库文件,然后使用用户名“admin”和密码“admin”创建一个 super 用户。 到目前为止我的代码: python manage.
关闭。这个问题是opinion-based 。目前不接受答案。 想要改进这个问题吗?更新问题,以便 editing this post 可以用事实和引文来回答它。 . 已关闭 6 年前。 Improv
我已在 Azure 数据库服务器上设置异地复制。 服务器上运行的数据库之一具有我通过 SSMS 创建的登录名和用户: https://learn.microsoft.com/en-us/azure/s
我有一个 ionic 2 应用程序,正在使用 native FB Login 来检索名称/图片并将其保存到 NativeStorage。流程是我打开WelcomePage、登录并保存数据。从那里,na
这是我的用户身份验证方法: def user_login(request): if request.method == 'POST': username = request.P
我试图获取来自特定用户的所有推文,但是当我迭代在模板中抛出推文时,我得到“User”对象不可迭代 观看次数 tweets = User.objects.get(username__iexact='us
我是一名优秀的程序员,十分优秀!