33、HBase模式案例：日志数据和时间序列数据-6ren

33、HBase模式案例：日志数据和时间序列数据

转载作者：大佬之路更新时间：2024-01-07 13:06:53

28

4

HBase案例：日志数据和时间序列数据

本节为你介绍了 HBase 模式案例之一：日志数据和时间序列数据

假设正在收集以下数据元素。

主机名（Hostname）
时间戳（timestamp）
日志事件（Log event）
值/消息（Value/message）

我们可以将它们存储在名为 LOG_DATA 的 HBase 表中，但 rowkey 会是什么呢？从这些属性中，rowkey 将是主机名，时间戳和日志事件的一些组合，但具体是什么？

行密钥（Rowkey）主导位置中的时间戳（Timestamp）

rowkey [timestamp][hostname][log-event] 受单调递增的行键/时间戳数据（Monotonically Increasing Row Keys/Timeseries Data）中描述的单调增长 rowkey 问题的影响。

通过在时间戳上执行 mod 操作，在关于 “bucketing” 时间戳的 dist-lists 中经常提到另一种模式。如果时间扫描很重要，这可能是一个有用的方法。必须注意 bucket 的数量，因为这需要相同数量的扫描来返回结果。

long bucket = timestamp % numBuckets;

构造：

[bucket][timestamp][hostname][log-event]

如上所述，要选择特定时间范围（timerange）的数据，需要为每个存储 bucket 执行 Scan。例如，100个存储 bucket 将在密钥空间中提供广泛的分布，但它需要 100 次 Scan 才能获得单个时间戳的数据，因此存在权衡。

行密钥（Rowkey）主导位置中的主机（Host）

如果有大量的主机在整个密钥空间中进行写入和读取操作，则 rowkey [hostname][log-event][timestamp] 是一个候选项。如果按主机名扫描是优先事项，则此方法非常有用。

时间戳或反向时间戳

如果最重要的访问路径是拉取最近的事件，则将时间戳存储为反向时间戳（例如，timestamp = Long.MAX_VALUE – timestamp）将创建能够对 [hostname][log-event] 执行 Scan 以获取最近捕获的事件的属性。

这两种方法都不是错的，它只取决于什么是最适合的情况。

反向扫描 API

HBASE-4811 实现了一个 API，它以反向扫描表格或范围内的表格，从而减少了对正向或反向扫描进行模式优化的需求。此功能在 HBase 0.98 和更高版本中可用。

可变长度或固定长度的行键

记住，在 HBase 的每一列上加盖行密码是非常重要的。如果主机名为 a，并且事件类型是 e1，那么结果 rowkey 会很小。但是，如果摄入的主机名是myserver1.mycompany.com 和事件类型是 com.package1.subpackage2.subsubpackage3.ImportantService，会怎么样？

在rowkey 中使用一些替换可能是有意义的。至少有两种方法：哈希和数字。在 Rowkey Lead Position 示例中的主机名中，它可能如下所示：

带有哈希的复合 Rowkey：

[主机名的MD5哈希] = 16个字节（[MD5 hash of hostname] = 16 bytes）
[事件类型的MD5哈希] = 16个字节（[MD5 hash of event-type] = 16 bytes）
[时间戳] = 8个字节（[timestamp] = 8 bytes）

具有数值替换的复合 Rowkey：

对于这种方法，除了 LOG_DATA（称为LOG_TYPES）之外，还需要另一个查找表。LOG_TYPES 的 rowkey 是：

[type]，（例如，指示主机名与事件类型的字节）。
[bytes]，原始主机名或事件类型的可变长度字节。

此rowkey 的列可能是一个具有指定编号的长整数，可通过使用 HBase 计数器获得。

所以得到的复合 rowkey 将是：

[代替主机名长] = 8个字节（[substituted long for hostname] = 8 bytes）
[长时间取代事件类型] = 8个字节（[substituted long for event type] = 8 bytes）
[时间戳] = 8个字节（[timestamp] = 8 bytes）

在Hash 或 Numeric 替换方法中，主机名和事件类型的原始值可以存储为列。

28

4

0

文章推荐： 35、HBase模式案例：客户-订单

文章推荐： 34、HBase案例：Steroids上的日志数据

文章推荐： 32、HBase限制因素

文章推荐： 31、HBase二级索引和备用查询路径

hbase - HBase 什么时候真正删除一行？
发出时Delete对于 hbase，我知道它不会立即删除数据。但是什么时候删除数据，我的意思是，物理上？最佳答案当您向 HBase 写入内容时，它会存储在内存存储 (RAM) 中，然后再写入磁盘。
hbase - HBase 会在不同机器上存储同一行的列族吗？
同一行的列族属于同一个 RegionServer。那么，这里的问题是一个 RegionServer 会在不同的机器上存储不同的列族吗？最佳答案不一定，但在某些时候它会。这是基本 HBase 架构
hbase - hbase 中是否有最大版本号？
如果我想插入表格: row | fam:qualifier | timestamp | value 1 | foo:bar | 12345 | 2 1 | foo:bar | 12346 | 3 1
hbase - 如何停止在 hbase shell 中运行的命令而不退出 hbase shell
有时我想退出我在 HBase shell 中运行的命令，例如扫描操作通常需要太多时间。所以我想停止运行这个命令，但我不想退出 HBase shell。我常用的停止运行命令的方式，我使用了Ctrl+
hbase - Hbase 中的多个数据库或命名空间
有没有办法设置 Hbase 以便我们可以在同一个集群中创建多个数据库？最佳答案只是为了刷新主题:http://hbase.apache.org/book.html#namespace 5.3.1.
hbase - 我使用的是哪个版本的 hbase？
怎么看version的 hbase我在用？你能下命令吗？最佳答案 hbase version命令行界面中的命令给出了 version的 hbase正在使用中。以下是来自 Cloudera 的两个
hbase - HBase 是否对每行施加了最大大小？
高级问题: HBase 是否对所有分布(因此不是实现的工件)通用的每行施加了最大大小，无论是在方面吗？字节存储或在方面细胞数 ? 如果是这样: 限制是什么？极限存在的原因是什么？限制在哪里记
hbase - 将数据仓库星型模式映射到 HBASE
假设，假设我在数据仓库设置中有一个星型模式。有一个非常非常长的事实表(想想几十亿到几万亿行)和几个低基数维度表(想想 100 个维度表)。每个事实表外键指向一个维度表的主键是位图索引的。每个维度表
hbase - 如何确保 HBase Java 客户端正在使用 hbase-site.xml
版本:Hadoop: 2.0.0-cdh4.3.1 HBase: 0.94.6-cdh4.3.1 我正在运行 cloudera quick start vm，这是我的小型远程 HBase Java 客
ubuntu - HBase - 运行 start-hbase.sh 时出现完全分布式 HBase 错误
我正在尝试以完全分布式模式配置 HBase。 (使用 Ubuntu 12.04，Apache Hadoop 2.2(以伪模式运行，HBase 版本 0.98) 以下是我的 bashrc 设置: exp
hbase - hbase-site.xml 中的 hbase.zookeeper.quorum 是什么
我想知道如何正确配置 hbase.zookeeper.quorum 以将 zookeeper 实例指向集群模式。最佳答案 hbase.zookeeper.quorum 属性是运行 ZooKeeper
hbase - hbase-site.xml 中的 hbase.zookeeper.quorum 是什么
我想知道如何正确配置 hbase.zookeeper.quorum 以将 zookeeper 实例指向集群模式。最佳答案 hbase.zookeeper.quorum 属性是运行 ZooKeeper
hadoop - Hbase mapside join-其中一张表没有被读取？从 hbase 中读取正确的结果到 hbase
我正在尝试对位于 Hbase 中的两个表进行映射连接。我的目的是在hashmap中保留小表的记录并与大表进行比较，一旦匹配，再次将记录写入hbase中的表中。我使用 Mapper 和 Reducer
hadoop - HBase ERROR : hbase-default. xml 文件似乎是针对旧版本的 HBase (null)
我正在尝试编写一个程序来连接到 HBase。但是当我执行以下命令时HBaseConfiguration.create();我收到以下错误:. "hbase-default.xml 文件似乎是旧版本的
hbase - 为什么说 HBase 行按字典顺序存储？
基于HBase documentation ，再次遵循 Google BigTable 论文的引用，据说这些行是按行键的字典顺序存储的。很明显，当我们在 rowkey 中有一个字符串或者如果我们将一
hbase - 如何进行 hbase 范围扫描？
我有一个 hbase 表，其中的行键如 row1、row2、row3 .... 和 rowN，我想要的是获取行键从 row100 到 row200 的行，如何编写查询子句或将 hbase 表设计为让查
hbase - 在 HBASE 上创建命名空间
我正在尝试创建命名空间，但出现类似下面给出的错误 hbase(main):031:0> create namespace 'Aniruddha'
hbase - 适用的 HBase 表模型
我发现为以下要求建模 HBase 表有困难。我有一个表“商店”，它存储了商店的详细信息(必胜客)。我有一个表格“订单”，其中包含交易摘要(总交易金额等...)。我有另一个表“Order_Item
hbase - 在不禁用 HBASE 表的情况下更改表结构的含义
谁能告诉我如果在不首先禁用表的情况下使用“alter”命令可能影响表结构的可能影响？据我所知，禁用表意味着关闭与表的所有连接。如果我在不禁用表的情况下使用 alter，可能会发生什么异常情况？我正
hbase - 无法从 HBase 导出表
我无法将表从 HBase 导出到 HDFS。下面是错误跟踪。它是相当大的尺寸。还有其他方法可以导出吗？我使用以下命令导出。我增加了 rpc 超时，但工作仍然失败。 sudo -u hdfs hbas

首页

博学

6Ren·AI

商城