hadoop - Hbase Schema设计-6ren

hadoop - Hbase Schema设计

转载作者：行者123 更新时间：2023-12-02 20:11:09

25

4

我必须设计一个 Hbase 表来存储用户信息，此信息面向社交网络，例如:年龄，性别，教育程度，爱好，看书，旅行的国家...
注意:我们将来可能会添加更多信息，我们现在不知道所有信息。

例如:
姓名:Olha，年龄:25，性别:女，教育程度:信息技术学士，教育程度:计算机科学，业余爱好:篮球，爱好:乒乓球，书籍:随风而逝，书籍:达芬奇密码，语言:英语，语言:法文，国家/地区:德国

主要思想是能够执行以下查询:
返回所有女性，年龄:22岁，说:英语，说:法语，读随风而逝的书，例如乒乓球，篮球和德语。

因此您可以将任何条件添加到搜索查询中。

您对优化这种搜索查询的HBASE表架构(行键，列族...)有何建议(考虑到我们将来会添加更多信息)
编写此类查询的最佳方法是什么(scan，get，MapReduce)。

谢谢

最佳答案

从某种意义上说，这并不是HBase的好用，因为这正是搜索索引(如Lucene)所擅长的。

一种用于存储用户及其信息的普通模式可能看起来很像一个关系数据库，因为每个用户只有1行，并将所有属性存储为列和值(age = 22，language = french等)。这对于您提到的可扩展性非常有效(您无需更改任何架构即可存储新属性)。使用这种模式，您可以通过唯一的用户ID查找任何一个用户(及其所有属性)。无论您有多少用户，这都将是非常快的事情。

但是，使用该架构，如果您要按照描述的方式进行搜索(“返回年龄在22岁以下的所有用户”)，则每个查询最终都将是对整个表的扫描，因为HBase仅允许您执行以下操作:通过主键访问事物；它没有任何二级索引。这将是非常低效的(每次您要进行任何单个查询时图片都必须扫描一百万行)。

如何解决这个问题？您可以“反转”数据的顺序，并将值放入行键，然后指向具有该值的所有用户。例如，行键可以是“age:22”，然后在行的列中可以是所有22岁的用户ID。这有很多问题，其中有很多原因，其中最主要的原因是更新非常昂贵且棘手。但是，对于那些特定的查询，它的效果很好。

俩？这正是搜索索引(如Lucene)所做的事情，它比使用HBase滚动搜索要好得多。听起来像您想在这里使用的工具。

如果您必须使用HBase(正如您所说，因为这是一个研究项目)，那么可能值得一起使用HBase和Lucene。谷歌的指针。

关于hadoop - Hbase Schema设计，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/16005551/

25

4

0

文章推荐： eclipse - Hadoop:Filenotfound异常-Windows

文章推荐： hadoop - 具有独立模式的MRUnit

文章推荐： hadoop - 无法通过 gdb env 中的 libhdfs.so

文章推荐： docker - 无法从Nginx创建文件到docker-gen

user-interface - 交互设计、视觉设计、网页设计、UX 设计、UI 设计、UI 开发之间有什么区别？
关闭。这个问题需要更多focused .它目前不接受答案。想改善这个问题吗？更新问题，使其仅关注一个问题 editing this post . 4年前关闭。 Improve this questi
wpf - 仅适用于 VS 设计 View 的 Blend 中的 UnresolvedAssemblyException - 在 VS 设计 View 中工作正常
.NET 框架:4.5.1 我在 Blend for visual studio 2015 中遇到一个奇怪的错误，我找不到它的来源。如果我在 VS 中打开我的 WPF 解决方案，它会加载并运行良好。
web-services - RESTful URL 设计 : public vs private API, 层次结构 API 设计模式，URI 与 URL 设计？
我经常遇到这样的问题，与 Hierarchical RESTful URL design 非常相似假设该服务仅提供用户上传文档。 POST, GET /accounts PUT, DELETE /a
设计，无法登出
在 Rails 应用程序中，我使用 devise 来管理我的用户，而我用来销毁 session 的链接不再有效。它正在工作，现在我添加了事件管理员，但没有。我的链接是 :delete, :clas
设计:更改密码
我已经坚持了超过 24 小时，试图按照此处发布的其他解决方案进行操作，但我无法使其正常工作。我是 Rails 新手，需要帮助! 我想让我的/users/edit 页面正常工作，以便我可以简单地更改用户
设计 - 超时不起作用
Devise 在以下情况下不会使用户超时: 用户登录，关闭选项卡，然后在超时 + X 分钟内重新访问该 URL。用户仍处于登录状态。如果选项卡已打开并且稍后刷新/单击，则超时可以正常工作。这意味着
WPF slider 设计
我想使用这样的 slider 我希望该 slider 根据提供给它的值进行相应调整。到目前为止，我只能应用具有渐变效果的背景，但无法获得这种效果。请通过提供样式代码来帮助我。
WCF 设计 - 一个请求和响应对象还是多个？
您应该为每种方法创建一个请求/响应对象，还是应该为每个服务创建一个？如果我在所有方法中使用它，我的服务请求对象中将只有 5 个不同的东西，因为我对几乎所有方法使用相同的输入。响应对象将只有一个字典
RESTful 设计 - 如何为实体的附件建模
我正在尝试在 REST 中对实体的附件进行建模。假设一个缺陷实体可以附加多个附件。每个附件都有描述和一些其他属性(上次修改时间、文件大小...)。附件本身是任何格式的文件(jpeg、doc ...)
sql - 设计——第六范式
我有以下表格: Blogs { BlogName } BlogPosts { BlogName, PostTitle } 博客文章同时建模一个实体和一个关系，根据 6nf(根据第三个宣言)这是无效的。
OOP 设计 - 许多对象每个都与其他对象的有限子集具有独特的交互
如果 A 类与 B、C 和 D 类中的每一个都有唯一的交互，那么交互的代码应该在 A 中还是在 B、C 和 D 中？我正在编写一个小游戏，其中许多对象可以与其他对象进行独特的交互。例如，EMP点击
设计 + Omniauth + remember_me
关于如何记住我与 Omniauth 一起工作似乎有些困惑。根据这个wiki ，您需要在 OmniauthCallbacksController 中包含以下内容: remember_me(user)
multithreading - 将非线程安全组件与多线程组件一起使用(设计)
设计问题: 使用非线程安全组件(集合，API，...)在/带有多线程成分 ... 例子 : 组件 1 :多线程套接字服务器谁向消息处理程序发送消息... 组件 2 :非线程安全消息处理程序谁
XML 设计 - 如何？
我们目前正在设计一个 RESTful 应用程序。我们决定使用 XML 作为我们的基本表示。我有以下关于在 XML 中设计/建模应用程序数据的问题。在 XML 中进行数据建模的方法有哪些？从头开始然
XSD 设计 - 一个或多个规则
我正在设计一个新的 XSD 来从业务合作伙伴那里获取积分信息。对于每笔交易，合作伙伴必须提供至少一种积分类型的积分值。我有以下几点:
API 设计 - 最佳实践以及如何支持多个版本
设计支持多个版本的 API 的最佳方法是什么。我如何确保即使我的数据架构发生更改(微小更改)，我的 api 的使用者也不会受到影响？任何引用架构、指南都非常有用。最佳答案 Mark Nottingh
文件上传的 REST 设计
关闭。这个问题是opinion-based 。目前不接受答案。想要改进这个问题吗？更新问题，以便 editing this post 可以用事实和引文来回答它。 . 已关闭 4 年前。 Improv
PHP 文件布局/设计
我想用 php 创建一个网站，其工作方式与 https://www.bitcoins.lc/ 相同。确实，就每个页面上具有相同布局但内容会随着您更改链接/页面而改变而言，我如何在 php 中使用lay
Java Swing 设计
我有一个关于编写 Swing UI 的问题。如果我想制作一个带有某些选项的软件，例如在第一个框架上，我有三个按钮(新建、选项、退出)。现在，如果用户单击新按钮，我想将框架中的整个内容更改为其他内容。
docker - Kubernetes建筑/设计/？
我正在尝试找出并学习将应用程序拥有的一堆Docker容器移至Kubernetes的模式和最佳实践。诸如Pod设计，服务，部署之类的东西。例如，我可以创建一个其中包含单个Web和应用程序容器的Pod，但

首页

博学

6Ren·AI

商城

hadoop - Hbase Schema设计