hadoop - Hadoop 处理记录如何跨 block 边界拆分？-6ren

hadoop - Hadoop 处理记录如何跨 block 边界拆分？

转载作者：可可西里更新时间：2023-11-01 14:06:06

31

4

根据Hadoop - 权威指南

The logical records that FileInputFormats define do not usually fit neatly into HDFS blocks. For example, a TextInputFormat’s logical records are lines, which will cross HDFS boundaries more often than not. This has no bearing on the functioning of your program—lines are not missed or broken, for example—but it’s worth knowing about, as it does mean that data-local maps (that is, maps that are running on the same host as their input data) will perform some remote reads. The slight overhead this causes is not normally significant.

假设一条记录行被分成两个 block (b1 和 b2)。处理第一个 block (b1) 的映射器会注意到最后一行没有 EOL 分隔符，并从下一个数据 block (b2) 中获取该行的剩余部分。

处理第二个 block (b2) 的映射器如何确定第一条记录不完整并且应该从 block (b2) 中的第二条记录开始处理？

最佳答案

有趣的问题，我花了一些时间查看代码以了解详细信息，这是我的想法。拆分由客户端通过 InputFormat.getSplits 处理，因此查看 FileInputFormat 会提供以下信息:

对于每个输入文件，获取文件长度、 block 大小并计算分割大小为 max(minSize, min(maxSize, blockSize)) 其中 maxSize 对应mapred.max.split.size 和 minSize 是 mapred.min.split.size。

根据上面计算的分割大小，将文件分成不同的FileSplit。这里重要的是，每个 FileSplit 都使用与输入文件中的偏移量相对应的 start 参数进行初始化。那时仍然没有对线路的处理。代码的相关部分如下所示:

while (((double) bytesRemaining)/splitSize > SPLIT_SLOP) {
  int blkIndex = getBlockIndex(blkLocations, length-bytesRemaining);
  splits.add(new FileSplit(path, length-bytesRemaining, splitSize, 
                           blkLocations[blkIndex].getHosts()));
  bytesRemaining -= splitSize;
}

之后，如果您查看由 TextInputFormat 定义的 LineRecordReader，那是处理行的地方:

当您初始化 LineRecordReader 时，它会尝试实例化一个 LineReader，这是一个能够通过 FSDataInputStream 读取行的抽象。有2种情况:
如果定义了CompressionCodec，则此编解码器负责处理边界。可能与您的问题无关。

但是，如果没有编解码器，这就是有趣的地方:如果您的 InputSplit 的 start 不同于 0，那么您将回溯1 个字符，然后跳过您遇到的由\n 或\r\n (Windows) 标识的第一行!回溯很重要，因为如果您的行边界与分割边界相同，这可以确保您不会跳过有效行。相关代码如下:

if (codec != null) {
   in = new LineReader(codec.createInputStream(fileIn), job);
   end = Long.MAX_VALUE;
} else {
   if (start != 0) {
     skipFirstLine = true;
     --start;
     fileIn.seek(start);
   }
   in = new LineReader(fileIn, job);
}
if (skipFirstLine) {  // skip first line and re-establish "start".
  start += in.readLine(new Text(), 0,
                    (int)Math.min((long)Integer.MAX_VALUE, end - start));
}
this.pos = start;

因此，由于拆分是在客户端计算的，因此映射器不需要按顺序运行，每个映射器都已经知道是否需要丢弃第一行。

基本上，如果您在同一个文件中有 2 行，每行 100Mb，为了简化，我们假设拆分大小为 64Mb。然后在计算输入拆分时，我们将有以下场景:

Split 1 包含此 block 的路径和主机。在开始处初始化 200-200=0Mb，长度 64Mb。
Split 2 在开始时初始化 200-200+64=64Mb，长度 64Mb。
Split 3 在开始时初始化 200-200+128=128Mb，长度 64Mb。
Split 4 在开始时初始化 200-200+192=192Mb，长度 8Mb。
映射器 A 将处理拆分 1，开始是 0，因此不要跳过第一行，并读取超过 64Mb 限制的整行，因此需要远程读取。
Mapper B 将处理 split 2，start is != 0 所以跳过 64Mb-1byte 后的第一行，这对应于 100Mb 处第 1 行的末尾，它仍在 split 2 中，我们有 28Mb 的行在 split 2、所以远程读取剩下的72Mb。
Mapper C 将处理 split 3，start is != 0 所以跳过 128Mb-1byte 之后的第一行，它对应于 200Mb 处第 2 行的结尾，这是文件的结尾所以不要做任何事情。<
映射器 D 与映射器 C 相同，只是它在 192Mb-1 字节后寻找换行符。

关于hadoop - Hadoop 处理记录如何跨 block 边界拆分？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/14291170/

31

4

0

文章推荐： windows - 使用 JDK 7 构建 Cocoon 2.1.0 失败 : compile-build. xml:68

文章推荐： scala - Spark - 将 CSV 文件加载为 DataFrame？

文章推荐： windows - 指示 win32 线程在单个处理器内核上运行

文章推荐： hadoop - 在 Hadoop 中链接多个 MapReduce 作业

JavaScript 拆分
假设我有这个变量 var image = "image.jpg"; 我正在尝试拆分变量图像的内容并将 _thumbs 插入其中以获得类似 image_thumbs.jpg 的内容。我该如何解决这个问
excel - 拆分，转义某些拆分
我有一个包含多个问题和答案的单元格，其组织方式类似于 CSV。因此，为了将所有这些问题和答案分开，使用逗号作为分隔符的简单拆分应该很容易分开。不幸的是，有些值使用逗号作为小数分隔符。有没有办法避免这
d - 拆分/拆分的编译问题
这是简单的代码: import std.algorithm; import std.array; import std.file; void main(string[] args) { aut
java useDelimeter 拆分 -
我正在尝试解析一个看起来像的 txt 文件 A - 19 B - 2 C - 3 我正在使用扫描仪方法读取它并在“- ”中拆分，以便我的输出看起来像: A 19 B 2 C 3 但是它似乎没有正确拆分
qt - QString 拆分
我有这些网址字符串 file:///home/we/Pictures/neededWord/3193_n.jpg file:///home/smes/Pictures/neededWord/jds_2
没有最终修剪的 Groovy 拆分
我正在解析一个 CVS 文件，如下所示: "07555555555",25.70,18/11/2010,01/03/2011,N,133,0,36,,896,537,547,,Mr,John,Doe,
管道后的 PowerShell 拆分
我在脚本中使用以下行返回 $folder 处所有文件夹的所有路径地点。 dir -recurse $folder|?{$_.PSIsContainer}|select -ExpandProperty
Javascript 拆分、替换表现奇怪
我正在尝试将字符串格式化为word+word+word 例如 “超音乐节”变成“超+音乐+节日” 我尝试过使用以下代码 query.split(" ").join("+"); 或 query.repl
Perl系统+拆分+数组
我叫 luis，住在 arg。我有一个问题，无法解决。 **IN BASH** pwd /home/labs-perl ls file1.pl file2.pl **IN PERL** my $ls
java - 拆分 JsonArray
我想从包 javax.json 中拆分 JsonArray，但我找不到完成这项工作的便捷方法。我查看了文档，只能想到迭代 JsonArray 并使用 JsonArrayBuilder 手动添加项目。
Java 正则表达式/拆分
我希望在第一个 ':' 处拆分字符串，以防止字符串的第二部分包含 ':' 时出现问题。我一直在研究正则表达式，但仍然遇到一些问题，有人可以帮我吗？谢谢。最佳答案您可以使用overload of s
python - 拆分 RDD
我想拆分列表的列表 ((A,1,2,3),(B,4,5,6),(C,7,8,9))进入: (A,1) (A,2) (A,3) (B,4) (B,5) ... 我试过rdd.flatMapValues(
Javascript 数组 - 拆分
我有一个文本文件，其中每一行都有数据。它看起来像这样: number0;text0 number1;text1 number2;text2 ..等等所以我通过 xmlhttprequest 将该文本
C#数组题(拆分)
问题很简单——比如说，我得到了函数，它接收数组作为参数 void calc(double[] data) 如何将这些数据“拆分”成两个子数组并像这样传递给子函数 calc_sub(data(0, le
Java 拆分(字符串操作)
我想显示来自 EMAIL_TEXT 数据库列的数据，在定义的字符处拆分列。出于某种原因，我的结果只打印第一行到我拆分字符串的位置，跳过其余行。这是我希望在每个“|”之后拆分的数据。这里是要拆分的数据
JavaScript - 拆分，选择给定数字后的所有内容
我有一个动态数组，我想排除字符串的第一部分，但我不知道第一部分之后会有多少对象，我想将它们全部包含在一个新字符串中。 string = "text.'''hi''','''who''' '''are'
Javascript 拆分 URL
我想拆分 URL 的某些特定部分，这是我目前所做的。 var query = window.location.pathname.split( '/' ); query = window.locati
java - 拆分、丰富和组合
我有一条消息携带 XML(订单)，其中包含多个同质节点(比如产品列表)以及其他信息(比如地址、客户详细信息等)。我必须使用另一个外部服务提供的详细信息来丰富每个“产品”，并返回带有丰富“产品”的相同完
JavaScript 拆分，更改零件编号
我有一个动态生成的大字符串，我正在拆分它。 var myString="val1, val, val3, val4..... val400" 我对此字符串进行了简单的拆分， myString= myS
java - 拆分 - 如何在结果中获取尾随的空字符串
这个问题在这里已经有了答案: Java String split removed empty values (5 个答案) 关闭 7 年前。我正在尝试使用 split(";") 将字符串转换为数组

首页

博学

6Ren·AI

商城

hadoop - Hadoop 处理记录如何跨 block 边界拆分？