- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我正在尝试制作一个轻量级的推荐引擎。我已经连续思考了几个小时如何实现这一目标,我想我可能会做一些事情,但我需要第三人对此事的看法。这里是:
假设我有 100,000 个可能的不同元素,每个用户都可以将任意数量的元素添加到他的库存
中。
用户也可以将这 100,000 个项目中的任何一个添加到他的愿望 list
中。
假设一个用户在他的愿望 list 中添加了 100 件商品,我想找到库存中拥有这些商品的所有其他用户。然后根据谁提供的元素最多对它们进行排名。
我想到解决这个问题的第一个方法是通过简单的 MySQL 连接。我尝试启动一些测试数据,只有 50,000 个用户,每个用户都有自己的库存/愿望 list ,查询似乎非常慢(约 10 秒),分页又如何呢?因此,我考虑也许可以在不同的软件上进行数据聚合,将数据移植到另一个软件(或表格)以对它们进行分页。
我也尝试了一些方法(Redis LUA 循环、MongoDB MapReduce),但它们都获得了相同的速度。我想做的是能够实时做到这一点,我不禁想知道这是否可能,而且我只是还没有找到正确的解决方案。或者也许我只是把事情复杂化了。我最近的探索让我开始进行位与操作,因为我听说它们非常快,但我似乎也遇到了困难。
我的想法是让每个用户拥有一个包含 100,000 个字符(其中包含 1 和 0)的字符串,其中每个字符/位将代表用户库存中的一个项目。
每个用户的愿望 list 都会有另一个字符串,该字符串将用作对数据库的查询。
理想的情况是循环遍历每个用户,对愿望 list 与库存进行 AND 运算,并计算结果中的位数。循环完成后,将结果传输到另一个表,您可以在其中进行分页。
我知道 100,000 位二进制有点傻。甚至可以对这样的东西进行二元运算吗?您认为我忽略了其他解决方案吗?我还没有研究过的一件事是布隆过滤器,它可以消除用户愿望 list 上没有单个项目的用户,这将缩小要搜索的用户数量。我愿意接受任何建议。
编辑:
以下是我在 MySQL 中所做的我想要改进的事情:
SELECT
user_id, SUM(card_qty) qty
FROM (
SELECT
cc.user_id, card_info_id, LEAST(c.card_qty, cc.card_qty) card_qty
FROM mb_decks d
JOIN mb_decks_cards c USING (deck_id)
JOIN mb_collection_cards cc USING (card_info_id)
WHERE d.deck_id = 1
AND cc.user_id <> d.deck_user_id
) t1
GROUP BY user_id
ORDER BY qty DESC;
# Showing rows 0 - 24 (33002 total, Query took 4.2979 sec)
请下载架构和测试数据here .
最佳答案
您的查询和表格是什么样的?通过适当的索引,这个问题对我来说应该不会太难。
如果您确实打算摆脱 mysql,elasticsearch 就是为这种快速查询而构建的。
关于php - 字符串运算,如二进制 AND,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/25320766/
我正在尝试将谷歌地图集成到 Xamarin Android。但是,如标题中所写,收到错误。此错误出现在我的 SetContentView (Resource.Layout.Main); 上,如下所示:
在 Delphi 中如何以非文本模式打开二进制文件?类似于 C 函数 fopen(filename,"rb") 最佳答案 有几个选项。 1。使用文件流 var Stream: TFileStrea
我现在正在处理一个问题,如下所示: 有两个数字 x1 和 x2 并且 x2 > x1。 例如 x1 = 5; x2 = 10; 而且我必须在二进制表示中找到 x1 和 x2 之间的总和。 5 = 10
我有这个“程序集”文件(仅包含 directives ) // declare protected region as somewhere within the stack .equiv prot_s
有没有办法在powershell中确定指定的文件是否包含指定的字节数组(在任何位置)? 就像是: fgrep --binary-files=binary "$data" "$filepath" 当然,
我是一名工程师,而不是软件程序员,所以请原谅我的无知。 我编写了一个 Delphi(7SE) 程序,用于从连接到两个数字温度计的 USB 端口读取“真实”数据类型。 我已经完成了该计划的大部分内容。
我有一些代码,例如: u=(float *)calloc(n, sizeof(float)); for(i=1; i
typedef struct pixel_type { unsigned char r; unsigned char g; unsigned char b;
如何判断二进制数是否为负数? 目前我有下面的代码。它可以很好地转换为二进制文件。转换为十进制时,我需要知道最左边的位是否为 1 以判断它是否为负数,但我似乎无法弄清楚该怎么做。 此外,我如何才能让它返
我有一个带有适当重载的 Vect*float 运算符的 vector 类,我正在尝试创建全局/非成员 float*Vect 运算符,如下所示:(注意这是一个经过大量编辑的示例) class Vect
对于使用 C 编程的项目,我们正在尝试将图像转换为二进制数据,反之亦然。我们在网上找到的所有其他解决方案都是用 C++ 或 Java 编写的。这是我们尝试过的方法: 将图像转换为包含二进制数据的文本文
我需要对列表的元素求和,其中包含所有零或一,如果列表中有 1,则结果为 1,否则为 0。 def binary_search(l, low=0,high=-1): if not l: retu
我到处搜索以找到将 float 转换为八进制或二进制的方法。我知道 float.hex 和 float.fromhex。是否有模块可以对八进制/二进制值执行相同的工作? 例如:我有一个 float 1
当我阅读有关 list.h 文件中的 hlist 的 FreeBSD 源代码时,我对这个宏感到困惑: #define hlist_for_each_entry_safe(tp, p, n, head,
我不知道出了什么问题,也不知道为什么会出现此错误。我四处搜索,但我终究无法弄明白。 void print_arb_base(unsigned int n, unsigned int b) {
在任何语言中都可以轻松地将十进制转换为二进制,反之亦然,但我需要一个稍微复杂一点的函数。 给定一个十进制数和一个二进制位,我需要知道二进制位是开还是关(真或假)。 示例: IsBitTrue(30,1
在下面的代码中,我创建了两个文件,一个是文本格式,另一个是二进制格式。文件的图标显示相同。但是这两个文件的特征完全相同,包括大小、字符集(==二进制)和流(八位字节)。为什么没有文本文件?因为如果我明
我想通读一个二进制文件。谷歌搜索“python binary eof”引导我here . 现在,问题: 为什么容器(SO 答案中的 x)不包含单个(当前)字节而是包含一大堆字节?我做错了什么? 如果应
为什么只允许以 10 为基数使用小数点?为什么以下会引发语法错误? 0b1011101.1101 我输入的数字是否有歧义?除了 93.8125 之外,字符串似乎没有其他可能的数字 同样的问题也适用于其
boost 库中有二进制之类的东西吗?例如我想写: binary a; 我很惭愧地承认我曾尝试找到它(Google、Boost)但没有结果。他们提到了一些关于 binary_int<> 的内容,但我既
我是一名优秀的程序员,十分优秀!