sql-server - 当操作涉及对任何列进行排序、聚合和过滤时，针对读取(低/无写入)进行了优化的内存数据库-6ren

sql-server - 当操作涉及对任何列进行排序、聚合和过滤时，针对读取(低/无写入)进行了优化的内存数据库

转载作者：行者123 更新时间：2023-12-04 00:00:11

25

4

我希望将 ~10GB 的数据加载到内存中并以以下形式对其执行 SQL:

按单列(任何列)排序

在单个列(任何列)上聚合

过滤单列(任何列)

什么是性能的好选择？我遇到的一些可能有效的解决方案是 TimesTen 、 ExtremeDB 和 SQL In-memory ，甚至是 Vaex 或 Cudf 等数据帧。
我希望优化查询时间——这才是我真正关心的。对于概念性示例，请考虑类似 Excel 表的内容，用户可以在其中对任何列进行排序或过滤(并且应用程序不知道要“索引”哪些列，因为可能会使用所有列)。

更新 :我在下面发布了来自 Pandas 的基准测试。我知道 Pandas 不适合这个，但是制作原型(prototype)并获得基准数据很棒:
文件 (20M 行，1.2GB): https://storage.googleapis.com/gcp-files/Sales20M.csv 。

加载时间 ( pd.read_csv ): 10.7s

聚合 : ( df.groupby('currency_code_id').count ): 3.3s

排序 : ( df.sort_values('price') ): 6.8s

枢轴 : ( df.pivot_table(index='code',columns='territory_id', values='id', aggfunc=len, fill_value=0) ): 3.4s。

如果使用数据库，请不要创建索引，因为用例是我们事先不知道使用的列。 (或者，我想您可以在每个字段上创建一个索引——但如果是这样，请在加载时包括所有这些索引的创建)。
哪种工具最适合这种情况？

最佳答案

我猜您想对随机数据文件进行 materialized 并对其执行亚秒级查询，并且您已准备好为此付出代价(因为内存功能通常是企业级的)。
以 SQL Server 为例，有很多选项:

使用 column store indexes which achieve gains up to 10 times the query performance

在 in memory tables 中使用并从 5 times to 20 times faster 性能

中获取

使用 Azure Hyperscale

或者只是使用分区，或者 PostgreSQL 或 MongoDB 分片。有很多此类技术的示例和演示显示亚秒级性能……但这取决于具体情况，因为存在局限性。
例如:

与传统索引相比，

列存储索引在过滤和仅获取几行时可能会出现问题

in-memory OLTP

在您的情况下，拥有 10 GB 的数据并希望获得良好的性能，您不需要做一些特别的事情。只需在插入之前分析和规范化数据并创建相应的索引。 Well begun is half done 并花一些时间以正确的方式写入数据将为您提供所需的性能。
例如:

在表中插入数据文件

对于表中的每一列

执行 count distinct

如果值更小 count distinct / count 小于 X，则创建一个单独的表，其中包含 id 和 value

在其中插入不同的值

向表中添加新列并在那里添加新 id

在该列上创建索引

减小表的大小将提高 IO 操作计数。按数字搜索和分组比按文本搜索和分组要快。
当然，您需要更改应用程序 - 不是按 some city name 搜索，而是按其 ID 进行过滤。在每个 count 的城市 countries ids 之后，您将执行第二个查询以将这些 ids 转换为 names 。
我觉得在你的案例中应用一些基本原则会比使用一些高价格和限制的高级技术更好，这些技术在 future 对应用程序提出新要求时可能至关重要。

在具有 8 GB RAM 和 4 个虚拟处理器的虚拟机上。不幸的是，它位于 HDD 上，并且来自此处的 I/O 非常糟糕。运行 SQL Server 2019 标准版。因此，由于硬件的原因，数据加载速度很慢。

表 2 分钟(我使用 SSMS 接口(interface)导入数据，如果使用 bcp 会更好，但...毕竟是 HDD)

1.5 分钟在每个字段上添加索引

因此，该表如下所示:

你可以看到我有多懒。每个字段都没有标准化和索引，导致为数据和索引分配了 3.2 GB:

exec sp_spaceused 'dbo.Sales20M'

但有些结果:
从 dbo.Sales20M 组中选择 count(*) ,currency_code_id bycurrency_code_id
当然，我们使用索引时为 0 秒:

select TOP 10 * from dbo.Sales20M   order by PRICE_IN_USD desc;

0 秒，但请注意我使用的是 TOP - 基本上，当您进行排序时，您需要显示部分行，对吗？如果我出于某种原因对整行进行排序:

select  * 
INTO #X
from dbo.Sales20M   order by PRICE_IN_USD desc;

它运行了 2 秒(我将数据插入表中，因为渲染也需要时间)。
至于 PIVOT ，它在 SQL Server 中不是很快，但如果你需要大量的东西，你可以使用 R 。我不明白你的，但通过 PIVOT 和 Code 制作了一个 territory_id 计算美元的平均价格:

SELECT *
FROM 
( 
    SELECT Code
              ,territory_id
              ,AVG(price_in_usd) price_in_usd
    FROM dbo.Sales20M
    GROUP BY Code
            ,territory_id
)DS
PIVOT
(
    MAX(price_in_usd) FOR territory_id IN ([AE], [AG], [AI], [AL], [AM], [AO], [AR], [AT], [AU], [AW], [AZ], [BA], [BE], [BF], [BG], [BH], [BJ], [BM], [BN], [BO], [BR], [BS], [BW], [BY], [BZ], [CA], [CH], [CI], [CL], [CO], [CR], [CV], [CY], [CZ], [DE], [DK], [DM], [DO], [EC], [EE], [EG], [ES], [FI], [FJ], [FM], [FR], [GA], [GB], [GD], [GH], [GM], [GR], [GT], [GW], [HK], [HN], [HR], [HT], [HU], [ID], [IE], [IL], [IN], [IS], [IT], [JM], [JO], [JP], [KG], [KH], [KN], [KR], [KW], [KY], [KZ], [LA], [LB], [LK], [LT], [LU], [LV], [MD], [MK], [ML], [MN], [MO], [MT], [MU], [MX], [MY], [MZ], [NA], [NE], [NI], [NL], [NO], [NP], [NZ], [OM], [PA], [PE], [PG], [PH], [PL], [PT], [PY], [QA], [RU], [RW], [SA], [SE], [SG], [SI], [SK], [SN], [SV], [SZ], [TG], [TH], [TJ], [TM], [TR], [TT], [TW], [TZ], [UA], [UG], [US], [UY], [UZ], [VE], [VG], [VN], [ZA], [ZM], [ZW])
) PVT;

我又偷懒了，没有使用动态 PIVOT。需要0-1秒。

结论:
我的观点是，即使我的设置很糟糕，而且我非常懒惰，因为没有花时间对数据进行规范化并创建适当的索引，我仍然得到接近 0 秒的结果。你可以简单地从像 PostgreSQL 这样的免费软件开始，我相信你会得到很好的结果。当然，如果您需要它们以优化特定用例，“花哨”的东西总是存在的。

关于sql-server - 当操作涉及对任何列进行排序、聚合和过滤时，针对读取(低/无写入)进行了优化的内存数据库，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/62988224/

25

4

0

文章推荐： r - 如果任何剩余值为 0，则将值设置为 0

文章推荐： python - 如何根据输入创建不同的对象？

文章推荐： perl - 在 perl 中对哈希键进行排序，键是制表符分隔的

文章推荐： r - 函数内的操作顺序与函数外的操作顺序不同吗？

php - 将 PHP 写入 Javascript 或将 Javascript 写入 PHP
我有这个代码 var myChart = new FusionCharts("../themes/clean/charts/hbullet.swf", "myChartId", "400", "75
Linux 异步 (io_submit) 写入 v/s 正常(缓冲)写入
既然写入是立即进行的(复制到内核缓冲区并返回)，那么使用 io_submit 进行写入有什么好处？事实上，它 (aio/io_submit) 看起来更糟，因为您必须在堆上分配写入缓冲区并且不能使用基
javascript - 当从网络服务器提供服务时，写入 .innerHTML 不起作用，但当作为文件浏览时，写入 .innerHTML 不起作用，这可能是什么原因造成的？
我正在使用 mootool 的 Request.JSON 从 Twitter 检索推文。收到它后，我将写入目标 div 的 .innerHTML 属性。当我在本地将其作为文件进行测试时，即 file:
python - 为什么从 Spark 写入 Vertica DB 比从 Spark 写入 MySQL 需要更长的时间？
最终，我想将 Vertica DB 中的数据抓取到 Spark 中，训练机器学习模型，进行预测，并将这些预测存储到另一个 Vertica DB 中。当前的问题是确定流程最后部分的瓶颈:将 Spark
java - 更改将 double 写入 CSV 的 Java 代码以将 double[] 写入 CSV(用例 = WEKA 库)
我使用 WEKA 库编写了一个 Java 程序，训练分类算法使用经过训练的算法对未标记的数据集运行预测将结果写入 .csv 文件问题在于它当前写出离散分类结果(即算法猜测一行属于哪个类别)。我
clickonce - 写入/读取数据目录是否需要管理员权限？
背景 - 我正在考虑使用 clickonce 通过 clickonce(通过网站)部署 WinForms 应用程序。相对简单的应用程序的要素是: - 它是一个可执行文件和一个数据库文件(sqlite)
arrays - 快速初始化C数组(写入)
是否有更好的解决方案来快速初始化 C 数组(在堆上创建)？就像我们使用大括号一样 double** matrix_multiply(const double **l_matrix, const dou
java - 写入 JSONArray
我正在读取 JSON 文件，取出值并进行一些更改。基本上我向数组添加了一些值。之后我想将其写回到文件中。当我将 JSONArray 写回文件时，会被写入字符串而不是 JSONArray 对象。怎样才
c# - 从页面文件读取/写入
我为两个应用程序使用嵌入式数据库，其中一个是服务器，另一个是客户端。客户端应用程序。可以向服务器端发送获取数据请求以检索数据并显示在表格(或其他)中。问题是这样的:如何将获取的数据保存(写入)到页面文
arrays - 快速初始化C数组(写入)
是否有更好的解决方案来快速初始化 C 数组(在堆上创建)？就像我们使用大括号一样 double** matrix_multiply(const double **l_matrix, const dou
java - 如何在Java中从内存中逐位读取/写入
从问题得出问题:找到所有 result = new ArrayList(); for (int i = 2; i >(i%8) & 0x1) == 0) { result.add(i
python - 写入 CSV
由于某种原因，它没有写入 CSV。谁能明白为什么它不写吗？ def main(): list_of_emails = read_email_csv() #read input file, cr
javascript - 写入\: on a URL
关闭。这个问题是 not reproducible or was caused by typos 。它目前不接受答案。这个问题是由于错别字或无法再重现的问题引起的。虽然类似的问题可能在这里出现，
c - 写入/读取二进制保存游戏
我目前正在开发一个保存和加载程序，但我无法获得正确的结果。编写程序: #include #include #define FILENAME "Save" #define COUNT 6 type
java - 从二进制文件读取/写入
import java.io.*; public class Main2 { public static void main(String[] args) throws Exception {
iphone - 写入 UITextView
我需要使用预定义位置字符串“Office”从所有日历中检索所有 iOS 事件，然后将结果写入 NSLog 和 UITextView。到目前为止，这是我的代码: #import "ViewCo
ios - 写入 PFInstallation
我正在尝试将 BOOL 值写入 PFInstallation 中的列，但会不停地崩溃: - (IBAction)pushSwitch:(id)sender { NSUserDefaults *push
c# - 写入 MySQL
我以前在学校学过一些简单的数据库编程，但现在我正在尝试学习最佳实践，因为我正在编写更复杂的应用程序。写入 MySQL 数据库并不难，但我想知道让分布式应用程序写入 Amazon EC2 上的远程数据库
Java 写入 ResourceBundle
是否可以写回到ResourceBundle？目前我正在使用 ResourceBundle 来存储信息，在运行时使用以下内容读取信息 while(ResourceBundle.getBundle("bu
c - 写入 - 读取二进制文件中的结构
关闭。这个问题是not reproducible or was caused by typos .它目前不接受答案。这个问题是由于错别字或无法再重现的问题引起的。虽然类似的问题可能是on-topi

首页

博学

6Ren·AI

商城

sql-server - 当操作涉及对任何列进行排序、聚合和过滤时，针对读取(低/无写入)进行了优化的内存数据库