cassandra - 了解 Cassandra 的存储开销-6ren

cassandra - 了解 Cassandra 的存储开销

转载作者：行者123 更新时间：2023-12-04 14:12:56

31

4

我一直在阅读this section Cassandra 文档，发现以下有点令人费解:

Determine column overhead:

regular_total_column_size = column_name_size + column_value_size + 15

counter - expiring_total_column_size = column_name_size + column_value_size + 23

Every column in Cassandra incurs 15 bytes of overhead. Since each row in a table can have different column names as well as differing numbers of columns, metadata is stored for each column. For counter columns and expiring columns, you should add an additional 8 bytes (23 bytes total).

我为 CQL3 定义的模式解释上述内容的方式，例如:

CREATE TABLE mykeyspace.mytable(
  id text,
  report_id text,
  subset_id text,
  report_date timestamp,
  start_date timestamp,
  end_date timestamp,
  subset_descr text,
  x int,
  y double,
  z int,
  PRIMARY KEY (id, report_id, subset_id)
);

是每一行都将包含列名称的元数据，例如，字符串 report_date , start_date , end_date等及其类型以及数据。但是，我不清楚表中的每一行都可以有不同的列名是什么意思。鉴于上面的架构完全是 ，这对我来说听起来是错误的。静态 ，即，如果我尝试编写，Cassandra 2.0 肯定会提示:

INSERT INTO mykeyspace.mytable (id, report_id , subset_id, x, y, z, w) 
VALUES ( 'asd','qwe','rty',100,1.234,12, 123.123);

Bad Request: Unknown identifier w

现在在我看来，列名在给定这个表架构的情况下是固定的，因此不需要每行存储元数据。我猜要么文档中的措辞已经过时(与 Cassandra 1.2 相同)，要么我误解了这里工作的一些核心概念。
有人可以澄清吗？底线:我是否必须担心我的列名称的长度？
我们一直在谨慎行事，并在可能的情况下使用单字符名称(因此上面的列实际上是 i、 r、 s、 dr、 ds、 de5| ..)，但它是如此非人类无法阅读，并且可能会令人困惑。

最佳答案

弄清楚在这种情况下发生了什么的最简单方法是检查数据的 sstable2json (cassandra/bin) 表示。这将显示最终实际保存在磁盘上的内容。

这是您的情况的示例

 [
 {"key": "4b6579","columns": [
       ["rid1:ssid1:","",1401469033325000],
       ["rid1:ssid1:end_date","2004-10-03 00:00:00-0700",1401469033325000],
       ["rid1:ssid1:report_date","2004-10-03 00:00:00-0700",1401469033325000],
       ["rid1:ssid1:start_date","2004-10-03 00:00:00-0700",1401469033325000], 
       ["rid1:ssid1:subset_descr","descr",1401469033325000],
       ["rid1:ssid1:x","1",1401469033325000], 
       ["rid1:ssid1:y","5.5",1401469033325000],
       ["rid1:ssid1:z","1",1401469033325000],
       ["rid2:ssid2:","",1401469938599000],
       ["rid2:ssid2:end_date", "2004-10-03 00:00:00-0700",1401469938599000],
       ["rid2:ssid2:report_date","2004-10-03 00:00:00-0700",1401469938599000],
       ["rid2:ssid2:start_date","2004-10-03 00:00:00-0700",1401469938599000], 
       ["rid2:ssid2:subset_descr","descr",1401469938599000],
       ["rid2:ssid2:x","1",1401469938599000],
       ["rid2:ssid2:y","5.5",1401469938599000],
       ["rid2:ssid2:z","1",1401469938599000]
 }
 ]

正如您在上面看到的那样，每个分区(每个 sstable)保存一次分区键的值，在这种情况下，列名根本无关紧要，因为它是隐式给定的表。聚类列的列名也不存在，因为使用 C* 你不能在没有指定键的所有部分的情况下插入。

剩下的虽然确实有列名，但如果对行进行部分更新，则需要这样做，以便可以在没有其余行信息的情况下保存它。您可以想象对一行中的单个列字段进行更新，以指示这是 C* 的哪个字段当前使用列名，但有票可以将其更改为较小的表示形式。
https://issues.apache.org/jira/browse/CASSANDRA-4175

要生成这个

cqlsh
CREATE TABLE mykeyspace.mytable(   id text,   report_id text,   subset_id text,   report_date timestamp,   start_date timestamp,   end_date timestamp,   subset_descr text,   x int,   y double,   z int,   PRIMARY KEY (id, report_id, subset_id) );
INSERT INTO mykeyspace.mytable (id, report_id , subset_id , report_date , start_date , end_date , subset_descr ,x, y, z) VALUES ( 'Key', 'rid1','ssid1', '2004-10-03','2004-10-03','2004-10-03','descr',1,5.5,1);
INSERT INTO mykeyspace.mytable (id, report_id , subset_id , report_date , start_date , end_date , subset_descr ,x, y, z) VALUES ( 'Key', 'rid2','ssid2', '2004-10-03','2004-10-03','2004-10-03','descr',1,5.5,1);
exit;
nodetool flush
bin/sstable2json $DATA_DIR/mytable/mykeyspace-mytable-jb-1-Data.db

关于cassandra - 了解 Cassandra 的存储开销，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/23958432/

31

4

0

文章推荐： common-lisp - Common Lisp 中 &environment 的作用是什么？

文章推荐： AdMob 自家广告 eCPM 订单

WebRTC 开销
我想知道，通过数据 channel 发送数据时 WebRTC 会产生多少开销。我知道 Websockets 每帧有 2 - 14 字节的开销。 WebRTC 是否使用更多开销？我在网上找不到一些有用
与类和对象相关的 JavaScript 开销
我想知道与创建新类而不是该类的新对象相关的开销是小还是大。我正在使用 dojo，但我将提供纯 JS 的示例。我将在启动时创建 10 到 100 个对象，我认为这不会是一个严重的问题，但我想涵盖所有基础
MySQL 开销，是我的查询错误还是应该优化表？
我有一个如下所示的表设置。 Table comment_flags user_id comment_id 我允许用户标记评论，然后给他们取消标记的选项，因为他们可能犯了一个错误。问题
Mysql phpmyadmin 开销
这个问题已经有答案了: 已关闭10 年前。 Possible Duplicate: In MySQL what does “Overhead” mean, what is bad about it,
重复分配的 JavaScript 开销
我正在制作一个非常简单的游戏，只是为了好玩/练习，但无论它现在有多简单，我仍然想很好地编写它，以防我想回到它并只是为了学习因此，在这种情况下，我的问题是: 对象分配涉及多少开销？解释器对此的优化程度
c# - 传递结构是否比传递其成员占用更多的内存/开销？
我有一些资源敏感的东西要写。我想知道与仅将这些变量一起传递(例如作为函数参数)相比，在结构中将变量组合在一起是否真的会导致内存开销。如果是这样，那么在不产生开销的情况下创建对惰性值进行操作的东西的好
Python:OOP 开销？
我一直在开发一个实时应用程序，并注意到一些 OOP 设计模式在 Python 中引入了难以置信的开销(使用 2.7.5 进行了测试)。直截了当，当字典被另一个对象封装时，为什么简单的字典值访问器方法
字符串连接的 C++ 开销
我正在从 ifstream 中读取随机 ascii 文本文件。我需要能够将整个消息放入字符串类型以进行字符解析。我当前的解决方案有效，但我认为我通过使用等效于此的方式来谋杀更冗长文件的处理时间: st
android - getActivity() 开销
纯粹从软件工程的角度来看，getActivity() 有多少开销？我在整个应用程序中经常多次使用此方法，并考虑使用一个引用 getActivity() 的全局变量。如果为 Activity 设置一
recursion - F# 递归与迭代速度/开销
我一直在研究 Riccardo Terrell 的 Akka.NET 分形演示 (https://github.com/rikace/akkafractal) 以尝试理解它。 (这很棒，顺便说一句)
performance - 高分辨率计时器/代码运行时间-> 开销？
我正在尝试使用高分辨率计时器查找我的代码运行时间，我注意到计时器的结果不一致，我想知道为什么会这样。我找到了这篇文章 How do you test running time of VBA code
WPF 绑定(bind)开销
我正在学习WPF。我现在开始装订了。使用 INotifyPropertyChanged 时绑定(bind)是否依赖反射？是这样，价格是多少？我正在考虑使用 WPF 来显示通过 UDP 流式传输的数据，
C++ 静态成员函数与 lambda 开销
我有某种模板化基类 template class Base { }; 并希望将其派生实例存储在列表中。为此，我使用 using derived_handle = std::unique_ptr v
haskell - GHC TypeLit 开销
使用GHC.TypeLits中的Sing有任何开销吗？？以程序为例: {-# LANGUAGE DataKinds #-} module Test (test) where import GHC.T
C++ 静态成员函数与 lambda 开销
我有某种模板化基类 template class Base { }; 并希望将其派生实例存储在列表中。为此，我使用 using derived_handle = std::unique_ptr v
python - 如何跳过结果中的 ORM 开销？
我有一个 ORM sqlalchemy 模型，我需要构建一个查询(使用 ORM 类更容易构建)，但这需要大量时间。当我直接像 SQL 一样向数据库执行相同的查询时，速度相当快。使用 SQLAlche
php - MySQL 开销 - 如何调整服务器以加速不良查询
我在 PHP 平台上有一家商店(开发不善)，那里有很多不好的查询(没有索引的长查询、rand() 排序、动态计数，..) 我现在无法更改查询，但我必须调整服务器才能保持事件状态。我尝试了我所知道的一
php - 本地服务器上的 MySQL 开销
我有一个使用 JQuery mobile 构建的移动应用程序，响应时间对我来说非常重要，因为我希望为我的用户提供流畅的体验。我刚刚将网站的安装移至本地服务器，以提高应用程序的性能，因为它连接到本地
mysql - 列的 SQL 开销
关于数据库设计的问题。如果我有 28 个 bool 值并且能够将它们添加为每行 28 个 bool 值或一个整数，哪一个会更快？哪种方法将使磁盘上的表大小保持最低？这是在假设我需要的可以通过查询中的
c++ - 接口(interface)开销
我有一个看起来像 Boost.Array 的简单类。有两个模板参数 T 和 N。Boost.Array 的一个缺点是，每个使用这种数组的方法都必须是带有参数 N 的模板(T 可以)。结果是整个程序往往

首页

博学

6Ren·AI

商城

cassandra - 了解 Cassandra 的存储开销