nosql - NoSQL 数据库如何执行聚合函数(AVG、SUM 等)-6ren

nosql - NoSQL 数据库如何执行聚合函数(AVG、SUM 等)

转载作者：IT王子更新时间：2023-10-29 06:04:42

26

4

我们需要定期处理相当大的数据集 (30-40GB)。它有很多按时间排序的值(以及更多信息)，但我们基本上需要按月执行一些数学运算。

我们的第一种方法是使用 MySQL 数据库来支持数据，因为我们对引擎和关系方法有一定的经验。但是，这个过程花费的时间太长，我们想知道 NoSQL 方法是否可以做得更好。

基本上我们需要表达的数据是:

Value: { NumericalValue, Year, Month }
Entity: List of 'Value'

我们处理这个列表三次，执行简单的数学运算，当我说“处理”时，我的意思是遍历数据集并执行微积分。当一切都结束时，我们有相同的结构(但数据不同):

Value: { NumericalValue, Year, Month }
Entity: List of 'Value'

现在我们发现了最大的问题，因为我们需要计算一些平均值，这需要很多时间。当我们多次重复这个过程时，我认为最耗时的任务是:

1) 将数据集导出到 MySQL。这意味着大量来自文本文件的插入。

当数据被转换时:

2) 使用 LIMIT 计算一些包含聚合函数 (AVG,SUM) 的查询。 3) 计算一些包含对整个数据集的聚合函数的查询。

通常，即使添加了一些索引，我们仍然觉得事情花费的时间太长(某些查询需要 20 分钟)。任何提示或解决策略将不胜感激。我觉得 NoSQL 数据库并不是专门为此设计的，但也许一些经验会有所帮助:)。

谢谢你的时间，

最佳答案

您的任务非常适合列式数据库。面向列的 NoSQL(例如 Cassandra)数据库将数据表存储为数据列的部分而不是数据行。这大大提高了聚合速度。这与依赖硬盘存储的系统有关。如果不是这种情况(例如内存数据库)，则有更多选项可以提高性能。

关于nosql - NoSQL 数据库如何执行聚合函数(AVG、SUM 等)，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/18203214/

26

4

0

文章推荐： ruby-on-rails - 如何使用 Redis/Node/Rails 延迟和合并 pub/sub

文章推荐： java - MapReduce 从 Redis 读取输入

文章推荐： search - 对多方面搜索软件栈的建议

MySQL : AVG of AVG impossible?
我想做一个平均值:问题是我正在计算每个元素的 AVG 的 1 个项目(工作)但是一旦我想要类别平均值的 GLOBAL 平均值(something and foo) 它不起作用(mysql 向我抛出一个
MySQl - AVG ( AVG IF) & 分组依据
我使用 MySQL。我有以下格式的数据 - DATE , PAGE , PAGE_LOAD_DURATION , VISIT_TYPE 01-01-15 , A ,
mysql - 从按条件分组的所有记录中获取 AVG，然后获取这些平均值的 AVG
我有下表: +--------+-------+ |Username|Points | +--------+-------+ |User1 | 75.00 | |User1 | 87.50 |
MySQL AVG ... LIMIT 返回总 AVG
表格: a | b 1 | 15 2 | 10 3 | 20 4 | 30 查询: SELECT AVG(table.b) FROM table ORDER BY table.a ASC LIMIT
sql - AVG , group by, WHERE AVG greater (>) 问题
这是我的数据库 CREATE TABLE korisnici( name VARCHAR(30) NOT NULL, amount DECIMAL(65,2) ); INSER
sql - AVG , group by, WHERE AVG greater (>) 问题
这是我的数据库 CREATE TABLE korisnici( name VARCHAR(30) NOT NULL, amount DECIMAL(65,2) ); INSER
php - mySQL AVG - 一种为 AVG 合并两个结果的方法
我正在尝试获取我的指标的平均交互次数，但此查询获取的是那些进行了交互的人的平均交互次数(那些在 metricsActions 中的人只有在他们已经交互时才会存在，他们的 metricsID 仍然存在于
mysql - 将 AVG(整数) 与类别的 AVG(整数) 进行比较
我与三列有关系:ProductName、CategoryID 和 Price。我需要选择仅那些价格高于给定类别中平均产品价格的产品。(例如，当apple(ProductName)是fruit(Cate
c++, 'avg = sum/5' 给了我垃圾值，但写 avg = sum/2 给出了工作，我不知道为什么
我正在尝试使用 C++ 创建一个简单的程序。它计算用户输入的 5 个数字的平均值，但当我运行它时，它一直给我一个垃圾值。我花了 30 多分钟来解决这个问题，但我似乎无法弄清楚。 #include
mysql - YEAR(AVG(UNIX(date))) 与 ROUND(AVG(YEAR(date))) 不同
总结一个练习题: 我需要从 datetime 列查询平均年份。我最初的解决方案是YEAR(AVG())所有日期。但由于我无法 AVG() 为 datetime，因此我将日期转换为 unix，然后再转换
sql - 当每个想要的 AVG() 值使用不同的 WHERE 子句时，基本 sql : selecting AVG() values from the same column multiple times in one query,
我想从一个表中的一列 (value_to_count) 获得三个不同的平均值，其中所有这些平均值都有不同的 WHERE 子句(根据时间)。示例数据: ###services#### Table se
sql - 如何构建一个 sql 查询以返回 avg(price)、min(price)、max(price) 与 avg(order)、min(order)、max(order)
我想创建一个 sql 查询，为 2 个不同的查询一起返回结果。例如，我想要以下形式的结果:产品名称, avg(price), min(price), max(price), avg(order), m
多个内部连接的mysql avg
我有以下查询: SELECT ROUND(AVG( p.price ),2) as Avg_value FROM quotes inner join `system_users` ON quotes.
SQL AVG() 函数返回不正确的值
我想在 sql 中使用 AVG 函数来返回某些值的工作平均值(即基于上周而不是整体平均值)。我有两个正在计算的值，体重和 restingHR(心率)。我对每个都有以下 sql 语句: SELECT A
sql - SQL中的嵌套聚合函数Max(Avg())
It's difficult to tell what is being asked here. This question is ambiguous, vague, incomplete, over
Rethinkdb 在一个查询中执行多个 avg
我有一个包含多个数字列的评论表。我想计算一个查询中所有列的平均值。如果表格看起来像这样: { foo : 2, bar : 5, foobar : 10 }, { foo :
azure 什么是最大时间聚合或 AVG
我正在为我的应用程序使用 SQL Azure SQL Server。我的应用程序直到最近都运行良好，MAX dtu 使用率为 100%，但 AVG DTU 使用率约为 50%。我应该监控哪个值来扩展
azure 什么是最大时间聚合或 AVG
我正在为我的应用程序使用 SQL Azure SQL Server。我的应用程序直到最近都运行良好，MAX dtu 使用率为 100%，但 AVG DTU 使用率约为 50%。我应该监控哪个值来扩展
java - $avg 未返回平均值
这个问题不太可能对任何 future 的访客有帮助；它只与一个较小的地理区域、一个特定的时间点或一个非常狭窄的情况相关，通常不适用于全世界的互联网受众。如需帮助使此问题更广泛适用，visit the
SQL - AVG 和分组依据
我有下表: Date | Product | Price 06-12-17 | 1.1 | 10 06-12-17 | 1.2 | 2

首页

博学

6Ren·AI

商城

nosql - NoSQL 数据库如何执行聚合函数(AVG、SUM 等)