scala - 读取保存在 HBase 列中的 AVRO 结构-6ren

scala - 读取保存在 HBase 列中的 AVRO 结构

转载作者：可可西里更新时间：2023-11-01 16:39:22

26

4

我是 Spark 和 HBase 的新手。我正在处理 HBase 表的备份。这些备份位于 S3 存储桶中。我正在使用 newAPIHadoopFile 通过 spark(scala) 阅读它们，如下所示:

conf.set("io.serializations", "org.apache.hadoop.io.serializer.WritableSerialization,org.apache.hadoop.hbase.mapreduce.ResultSerialization")
val data = sc.newAPIHadoopFile(path,classOf[SequenceFileInputFormat[ImmutableBytesWritable, Result]], classOf[ImmutableBytesWritable], classOf[Result], conf)

有问题的表称为 Emps。 Emps 的模式是:

key: empid {COMPRESSION => 'gz' }
  family: data
    dob - date of birth of this employee.
    e_info - avro structure for storing emp info.
    e_dept- avro structure for storing info about dept.

  family: extra - Extra Metadata {NAME => 'extra', BLOOMFILTER => 'ROW', VERSIONS => '1', IN_MEMORY => 'false', KEEP_DELETED_CELLS => 'FALSE', DATA_BLOCK_ENCODING => 'NONE', TTL => 'FOREVER', COMPRESSION => 'SNAPPY', MIN_VERSIONS => '0', BLOCKCACHE => 'true', BLOCKSIZE => '65536', REPLICATION_SCOPE => '0'}
    e_region - emp region
    e_status - some data about his achievements
    .
    .
    some more meta data

该表有一些列中包含简单的字符串数据，还有一些列中包含 AVRO 结构。

我试图直接从 S3 中的 HBase 备份文件中读取这些数据。我不想在我的本地机器上重新创建这个 HBase 表，因为该表非常非常大。

这就是我试图阅读的方式:

data.keys.map{k=>(new String(k.get()))}.take(1)
res1: Array[String] = Array(111111111100011010102462)

data.values.map{ v =>{ for(cell <- v.rawCells()) yield{
                        val family = CellUtil.cloneFamily(cell);
                        val  column = CellUtil.cloneQualifier(cell);
                        val  value = CellUtil.cloneValue(cell);
                            new String(family) +"->"+ new String(column)+ "->"+ new String(value)
                         }
                      }  
}.take(1)
res2: Array[Array[String]] = Array(Array(info->dob->01/01/1996,  info->e_info->?ж�?�ո� ?�� ???̶�?�ո� ?�� ????, info->e_dept->?ж�??�ո� ?̶�??�ո� �ո� ??, extra->e_region-> CA, extra->e_status->, .....))

正如预期的那样，我可以正确地看到简单的字符串数据，但 AVRO 数据是垃圾。

我尝试使用 GenericDatumReader 读取 AVRO 结构:

data.values.map{ v =>{ for(cell <- v.rawCells()) yield{
                        val family = new String(CellUtil.cloneFamily(cell));
                        val  column = new String(CellUtil.cloneQualifier(cell));
                        val  value = CellUtil.cloneValue(cell);
                        if(column=="e_info"){
                          var schema_obj =  new Schema.Parser
                          //schema_e_info contains the AVRO schema for e_info
                          var schema = schema_obj.parse(schema_e_info)
                          var READER2 = new GenericDatumReader[GenericRecord](schema)
                          var datum= READER2.read(null, DecoderFactory.defaultFactory.createBinaryDecoder(value,null))
                          var result=datum.get("type").toString()
                                family +"->"+column+ "->"+ new String(result) + "\n"
                            }
                        else
                           family +"->"+column+ "->"+ new String(value)+"\n"
                        }
                }        

}

但这给了我以下错误:

org.apache.spark.SparkException: Task not serializable
  at org.apache.spark.util.ClosureCleaner$.ensureSerializable(ClosureCleaner.scala:298)
  at org.apache.spark.util.ClosureCleaner$.org$apache$spark$util$ClosureCleaner$$clean(ClosureCleaner.scala:288)
  at org.apache.spark.util.ClosureCleaner$.clean(ClosureCleaner.scala:108)
  at org.apache.spark.SparkContext.clean(SparkContext.scala:2101)
  at org.apache.spark.rdd.RDD$$anonfun$map$1.apply(RDD.scala:370)
  at org.apache.spark.rdd.RDD$$anonfun$map$1.apply(RDD.scala:369)
  at org.apache.spark.rdd.RDDOperationScope$.withScope(RDDOperationScope.scala:151)
  at org.apache.spark.rdd.RDDOperationScope$.withScope(RDDOperationScope.scala:112)
  at org.apache.spark.rdd.RDD.withScope(RDD.scala:362)
  at org.apache.spark.rdd.RDD.map(RDD.scala:369)
  ... 74 elided
Caused by: java.io.NotSerializableException: org.apache.avro.Schema$RecordSchema
Serialization stack:
    - object not serializable (class: org.apache.avro.Schema$RecordSchema, value: .....

所以我想问:

有什么方法可以使不可序列化类 RecordSchema 与 map 函数一起工作？
到目前为止，我的方法是否正确？我很高兴知道处理此类数据的更好方法。
我读到在 Dataframe 中处理它会容易得多。我试图将如此形成的 Hadoop RDD 转换为 Dataframe，但我又在那里盲目地运行。

最佳答案

如异常所述 - 该架构是不可序列化的。你能在映射器函数中初始化它吗？这样它就不需要从驱动程序发送到执行程序。

或者，您也可以创建一个包含模式的 Scala 单例对象。您会在每个执行程序上初始化一个 Scala 单例，因此当您从单例访问任何成员时，它不需要序列化并通过网络发送。这避免了为数据中的每一行重新创建架构的不必要开销。

只是为了检查您是否可以正常读取数据 - 您还可以在执行程序上将其转换为字节数组，在驱动程序上收集它并在驱动程序代码中进行反序列化(解析 AVRO 数据)。但这显然不会扩展，它只是为了确保您的数据看起来不错，并在您编写原型(prototype)代码以提取数据时避免与 spark 相关的并发症。

关于scala - 读取保存在 HBase 列中的 AVRO 结构，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/44768000/

26

4

0

文章推荐： PHP curl : problems signing in to Hotmail

文章推荐： python - Pyspark 将数据写入配置单元

mysql - 连接的子查询(存在/存在)
SELECT *, `o_cheque_request.member_id`, `o_cheque_request.wallet_id` FROM `o_cheque_request`, `o_mem
SQL查找是否"存在"，别再count了！
根据某一条件从数据库表中查询『有』与『没有』，只有两种状态，那为什么在写SQL的时候，还要**SELECT count(*)**呢？无论是刚入道的程序员新星，还是精湛沙场多年的程序员老白，都是一如
c# - 存在、读写只需一步
我试图找出一个文件是否存在，如果存在，验证css样式是否已经存在，如果不存在，将它们写在文件末尾... 我已经完成了这一切，但分 3 个步骤: 该文件是否存在？ FileInfo fi= new Fi
android - 如何检测iOS用户或Android用户是否“存在”？
我们正在开发即时消息传递应用程序，并且需要在用户的化身上用绿点显示用户 friend 的“状态”。 “状态”远远超出了“my_app_is_opened_and_on_focus”，这意味着(我猜可能
SQL 查询不存在，存在
模式 Movie(title, year, director, budget, earnings) Actor(stagename, realname, birthyear) ActedIn(stag
MySQL 触发器语法错误 IF 存在
我有一个正在尝试创建的 MySQL 触发器，但无法获得正确的语法。触发器应该遍历一组关键字并将其与插入数据库的新帖子的标题进行匹配。如果找到匹配项，它应该将新帖子分配给该存储桶并更新存储桶的关键字集
MYSQL 选择子查询 IF 存在
我有 3 个表......用户、更新和碰撞。我想向发出 api 请求的用户返回最新订单的 feed 更新，并提供显示 feed 中每个状态所需的所有数据。我还需要包括更新是否已被发出 api 请求的
ios - UIViewController 存在
我正在尝试呈现一个带有 UIView 的 UIViewController。以下是我在 viewDidLoad 方法中尝试的代码。 //create the view controller UIVi
mysql - 如何在一个查询中进行多个计数/存在？
我正在努力弄清楚如何在不对 mysql 进行两次调用的情况下从一个表中检查两件事。我有一个 Members 表。我想测试MemberID 列中是否存在某个值，以及PhoneNumber 列中是否存在
vba - 循环没有 Do 错误但 Do 存在
以下代码给出了一个没有 Do Compile 错误的循环: Loop Sheets("Snap").Rows(1).AutoFilter Field:=5, Criteria1:=List
dns - 域名通过 "dig"存在
是否可以通过检查“dig”的输出来检查域名的存在？在绑定(bind)源中，我发现了这些常量: 0 DNS_R_NOEROR 1 DNS_R_FORMERR 2 DNS_R_SERVFAIL 3 DN
php - Controller 存在，但找不到页面
Controller 有问题我在 Windows 上使用服务器，一切正常，但在互联网上我试图访问页面 social_apartament/beauty_life/并且找不到该页面，代码错误 404这
d - 存在 `static if`时如何生成文档
/** This is struct S. */ struct S(T) { static if(isFloatingPoint!T) { /// This version works
clojure - 类型删除如何帮助 Clojure 存在？
JVM 类型删除如何帮助 Clojure？没有它，Clojure 还能存在吗？如果 JVM 有具体化的类型会发生什么？也就是说，Clojure 将如何改变？最佳答案 Clojure 根本不会有太大变
c - 为什么 system() 存在？
许多论文等提到对“system()”的调用是不安全且不可移植的。我不反对他们的论点。不过，我注意到许多 Unix 实用程序都有一个等效的 C 库。如果没有，源可用于各种这些工具。虽然许多论文和此类
javascript - js如何让一个变量值根据用户登录 Node 存在
在我的 Node js 应用程序中，我有一个用户登录 api。上面我在服务器端代码中创建了一个名为 customerid 的变量。现在，当用户身份验证成功时。我将他的 userid 值存储在我的 cu
azure - 存在 DNS 详细信息时重用资源管理器模板
我有一个工作资源管理器组，由 Ubuntu 14.04 虚拟机、网络接口(interface)、公共(public) IP 地址和存储帐户组成。我已经从这组资源中创建了一个模板。当我尝试部署这组资源
javascript - 存在 javascript 循环引用问题
我有一个函数createminor4(arr，锦标赛)它基本上将arr分成4组，每组8人，然后将它们一次交换到tourney 1组。从那里它插入四个{}，其中有 4 个带有空数组的键。我已经在 Ch
r - 存在 2 个图例时如何更改图例点的大小
我有一个图表，其中有两个图例。我需要更改其中一个图例的点的大小。我需要更改图例中“市场类型”的项目符号大小。我使用示例 here但不适用于我的图表。我的代码如下: k <- ggplot(subs
javascript - 存在 jQuery 字符串比较问题
我有 fiddle here展示我正在尝试做的事情。我有一个动态生成的表，因此列可以按用户选择的任何顺序显示。因此，我尝试获取两个特定 header 的索引，以便可以将 CSS 类添加到这两列以供稍

首页

博学

6Ren·AI

商城

scala - 读取保存在 HBase 列中的 AVRO 结构