- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我有一个场景,我存储大量第三方数据以供业务用户进行临时分析。大多数针对数据的查询都会很复杂,需要使用多个自连接、投影和范围。
在选择用于 Azure DocumentDB 的 PartitionKey
时,我看到人们建议使用逻辑分隔符,例如 TenantId、DeviceId 等。
然而,鉴于 DocumentDB 的并行性质,我很好奇它如何处理基于某种 GUID 或大整数的 PartitionKey
,以便在大量读取期间,它将高度并行化.
考虑到这一点,我设计了一个包含两个集合的测试:
测试-col-1
PartitionKey
是具有大约 100 个可能值的 TenantId测试-col-2
PartitionKey
是第三方分配的唯一值,遵循模式“AB1234568”。由第三方保证全局唯一。两个集合都设置为 100,000 RU。
在我的实验中,我加载了两个包含大约 2,000 个文档的集合。每个文档的大小大约为 20 KB,并且是高度非规范化的。每个文档是一个订单,其中包含多个作业,每个作业包含用户、价格等。
示例查询:
SELECT
orders.Attributes.OrderNumber,
orders.Attributes.OpenedStamp,
jobs.SubOrderNumber,
jobs.LaborTotal.Amount As LaborTotal,
jobs.LaborActualHours As LaborHours,
jobs.PartsTotal.Amount As PartsTotal,
jobs.JobNumber,
jobs.Tech.Number As TechNumber,
orders.Attributes.OrderPerson.Number As OrderPersonNumber,
jobs.Status
FROM orders
JOIN jobs IN orders.Attributes.Jobs
JOIN tech IN jobs.Techs
WHERE orders.TenantId = @TentantId
AND orders.Attributes.Type = 1
AND orders.Attributes.Status IN (4, 5)";
在测试中我调整了以下设置:
ConnectionPolicy
ConnectionPolicy
ConnectionMode.Direct
、Protocol.Tcp
MaxDegreeOfParallelism
值MaxBufferedItemCount
使用 EnableCrossPartitionQuery = true
查询具有 GUID PartitionKey 的集合。我正在使用 C# 和 .NET SDK v1.14.0。
在使用默认设置的初始测试中,我发现使用 TentantId
作为 PartitionKey 查询集合的速度更快,与 相比,平均需要 3,765 毫秒>4,680 毫秒(在 GUID 键控集合上)。
当我使用 TCP
将 ConnectionPolicy
设置为 Direct
时,我发现 TenantID
集合查询时间减少了近乎1000 毫秒,平均为2,865 毫秒,而 GUID 收集增加了约 800 毫秒,平均为5,492 毫秒。
当我开始使用 MaxDegreeOfParellelism
和 MaxBufferedItemCount
时,事情开始变得有趣。 TentantID
集合查询时间通常不受影响,因为查询不是跨集合,但 GUID 集合的速度显着加快,达到450 毫秒的值( >MaxDegreeOfParellelism
= 2000,MaxBufferedItemCount
= 2000)。
鉴于这些观察结果,为什么您不想使 PartitionKey
的值尽可能广泛?
最佳答案
Things started getting interesting when I started playing around with MaxDegreeOfParellelism and MaxBufferedItemCount. The TentantID collection query times were generally unaffected because the query wasn't cross-collection, however the GUID collection sped up considerably, reaching values as fast as 450 ms (MaxDegreeOfParellelism = 2000, MaxBufferedItemCount = 2000).
MaxDegreeOfParallelism可以设置 ParallelOptions 实例启用的最大并发任务数。据我所知,这是客户端并行性,它会消耗您站点上的 CPU/内存资源。
Given these observations, why would you not want to make the PartitionKey as broad a value as possible?
对于写入操作,我们可以跨分区键进行扩展,以便使用您配置的整个空间。而对于读取操作,我们需要尽量减少跨分区查找以降低延迟。
此外,正如该官方文档提到的:
The choice of the partition key is an important decision that you have to make at design time. You must pick a property name that has a wide range of values and has even access patterns.
It is a best practice to have a partition key with many distinct values (100s-1000s at a minimum).
To achieve the full throughput of the container, you must choose a partition key that allows you to evenly distribute requests among some distinct partition key values.
更多详情,您可以引用How to partition and scale in Azure Cosmos DB这个 channel 9 教程是关于 Azure DocumentDB Elastic Scale - Partitioning .
关于azure - DocumentDB PartitionKey 和性能,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/44128354/
在这段令人惊叹的视频 ( https://www.youtube.com/watch?v=udix3GZouik ) 中,Alex Blom 谈到了 Ember 在移动世界中的“黑客攻击”。 在 22
我们希望通过我们的应用收集使用情况统计信息。因此,我们希望在服务器端的某个地方跟踪用户操作。 就性能而言,哪个选项更合适: 在 App Engine 请求日志中跟踪用户操作。即为每个用户操作写入一个日
在针对对象集合的 LINQ 查询的幕后究竟发生了什么?它只是语法糖还是发生了其他事情使其更有效的查询? 最佳答案 您是指查询表达式,还是查询在幕后的作用? 查询表达式首先扩展为“普通”C#。例如: v
我正在构建一个简单的照片库应用程序,它在列表框中显示图像。 xaml 是:
对于基于 Web 的企业应用程序,使用“静态 Hashmap 存储对象” 和 apache java 缓存系统有何优缺点?哪一个最有利于性能并减少堆内存问题 例如: Map store=Applica
我想知道在性能方面存储类变量的最佳方式是什么。我的意思是,由于 Children() 函数,存储一个 div id 比查找所有其他类名更好。还是把类名写在变量里比较好? 例如这样: var $inne
我已经阅读了所有这些关于 cassandra 有多快的文章,例如单行读取可能需要大约 5 毫秒。 到目前为止,我不太关心我的网站速度,但是随着网站变得越来越大,一些页面开始需要相当多的查询,例如一个页
最近,我在缓存到内存缓存之前的查询一直需要很长时间才能处理!在这个例子中,它花费了 10 秒。在这种情况下,我要做的就是获得 10 个最近的点击。 我感觉它加载了所有 125,592 行然后只返回 1
我找了几篇文章(包括SA中的一些问题),试图找到基本操作的成本。 但是,我尝试制作自己的小程序,以便自己进行测试。在尝试测试加法和减法时,我遇到了一些问题,我用简单的代码向您展示了这一点
这个问题在这里已经有了答案: Will Java app slow down by presence of -Xdebug or only when stepping through code? (
我记得很久以前读过 with() 对 JavaScript 有一些严重的性能影响,因为它可能对范围堆栈进行非确定性更改。我很难找到最近对此的讨论。这仍然是真的吗? 最佳答案 与其说 with 对性能有
我们有一个数据仓库,其中包含非规范化表,行数从 50 万行到 6 多万行不等。我正在开发一个报告解决方案,因此出于性能原因我们正在使用数据库分页。我们的报告有搜索条件,并且我们已经创建了必要的索引,但
我有一条有效的 SQL 语句,但需要很长时间才能处理 我有一个 a_log 表和一个 people 表。我需要在 people 表中找到给定人员的每个 ID 的最后一个事件和关联的用户。 SELECT
很难说出这里问的是什么。这个问题是含糊的、模糊的、不完整的、过于宽泛的或修辞性的,无法以目前的形式得到合理的回答。如需帮助澄清此问题以便重新打开它,visit the help center 。 已关
通常当我建立一个站点时,我将所有的 CSS 放在一个文件中,并且一次性定义与一组元素相关的所有属性。像这样: #myElement { color: #fff; background-
两者之间是否存在任何性能差异: p { margin:0px; padding:0px; } 并省略最后的分号: p { margin:0px; padding:0px } 提前致谢!
我的应用程序 (PHP) 需要执行大量高精度数学运算(甚至可能出现一共100个数字) 通过这个论坛的最后几篇帖子,我发现我必须使用任何高精度库,如 BC Math 或 GMP,因为 float 类型不
我一直在使用 javamail 从 IMAP 服务器(目前是 GMail)检索邮件。 Javamail 非常快速地从服务器检索特定文件夹中的消息列表(仅 id),但是当我实际获取消息(仅包含甚至不包含
我非常渴望开发我的第一个 Ruby 应用程序,因为我的公司终于在内部批准了它的使用。 在我读到的关于 Ruby v1.8 之前的所有内容中,从来没有任何关于性能的正面评价,但我没有发现关于 1.9 版
我是 Redis 的新手,我有一个包含数百万个成员(member) ID、电子邮件和用户名的数据集,并且正在考虑将它们存储在例如列表结构中。我认为 list 和 sorted set 可能最适合我的情
我是一名优秀的程序员,十分优秀!