java - hadoop方法将输出发送到多个目录-6ren

java - hadoop方法将输出发送到多个目录

转载作者：可可西里更新时间：2023-11-01 14:24:35

26

4

我的 MapReduce 作业按日期处理数据，需要将输出写入特定的文件夹结构。目前的期望是生成以下结构的输出:

等等

在任何时候，我最多只能获得 12 个月的数据，因此，我使用 MultipleOutputs 类在驱动程序中使用以下函数创建 12 个输出:

public void createOutputs(){
    Calendar c = Calendar.getInstance();
    String monthStr, pathStr;

    // Create multiple outputs for last 12 months
    // TODO make 12 configurable
    for(int i = 0; i < 12; ++i ){
        //Get month and add 1 as month is 0 based index
        int month = c.get(Calendar.MONTH)+1; 
        //Add leading 0
        monthStr = month > 10 ? "" + month : "0" + month ;  
        // Generate path string in the format 2013/03/etl
        pathStr = c.get(Calendar.YEAR) + "" + monthStr + "etl";
        // Add the named output
        MultipleOutputs.addNamedOutput(config, pathStr );  
        // Move to previous month
        c.add(Calendar.MONTH, -1); 
    }
}

在 reducer 中，我添加了一个清理函数以将生成的输出移动到适当的目录。

protected void cleanup(Context context) throws IOException, InterruptedException {
        // Custom function to recursively process data
        moveFiles (FileSystem.get(new Configuration()), new Path("/MyOutputPath"));
}

问题:在将输出从 _temporary 目录移动到输出目录之前，reducer 的清理功能正在执行。因此，上述函数在执行时看不到任何输出，因为所有数据仍在 _temporary 目录中。

实现所需功能的最佳方法是什么？感谢任何见解。

思考以下问题:

有没有办法使用自定义输出提交器？
链接另一项工作是否更好，还是这样做有点矫枉过正？
有没有我不知道的更简单的替代方案..

这是cleanup函数的文件结构示例日志:

MyMapReduce: filepath:hdfs://localhost:8020/dev/test
MyMapReduce: filepath:hdfs://localhost:8020/dev/test/_logs
MyMapReduce: filepath:hdfs://localhost:8020/dev/test/_logs/history/job_201310301015_0224_1383763613843_371979_HtmlEtl
MyMapReduce: filepath:hdfs://localhost:8020/dev/test/_temporary
MyMapReduce: filepath:hdfs://localhost:8020/dev/test/_temporary/_attempt_201310301015_0224_r_000000_0
MyMapReduce: filepath:hdfs://localhost:8020/dev/test/_temporary/_attempt_201310301015_0224_r_000000_0/201307etl-r-00000
MyMapReduce: filepath:hdfs://localhost:8020/dev/test/_temporary/_attempt_201310301015_0224_r_000000_0/part-r-00000

最佳答案

您不需要第二份工作。我目前正在使用 MultipleOutputs 在我的一个程序中创建大量输出目录。尽管有超过 30 个目录，但我只能使用几个 MultipleOutputs 对象。这是因为你可以在写的时候设置输出目录，所以只在需要的时候才确定。如果你想以不同的格式输出，你实际上只需要多个 namedOutput(例如，一个带有键:Text.class，值:Text.class 和一个带有键:Text.class 和值:IntWritable.class)

设置:

MultipleOutputs.addNamedOutput(job, "Output", TextOutputFormat.class, Text.class, Text.class);

reducer 的设置:

mout = new MultipleOutputs<Text, Text>(context);

在reducer中调用mout:

String key; //set to whatever output key will be
String value; //set to whatever output value will be
String outputFileName; //set to absolute path to file where this should write

mout.write("Output",new Text(key),new Text(value),outputFileName);

您可以在编码时让一段代码确定目录。例如假设你想按月和年指定目录:

int year;//extract year from data
int month;//extract month from data
String baseFileName; //parent directory to all outputs from this job
String outputFileName = baseFileName + "/" + year + "/" + month;

mout.write("Output",new Text(key),new Text(value),outputFileName);

希望这对您有所帮助。

编辑:上面例子的输出文件结构:

关于java - hadoop方法将输出发送到多个目录，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/19820985/

26

4

0

文章推荐： c# - 设置全局代理设置后无法刷新窗口

文章推荐： Hadoop gen1 与 Hadoop gen2

目录
我正在为我的程序编写安装脚本，它应该在 Linux/Unix 操作系统上运行。以下文件的默认目录是什么: 可执行文件(程序)。程序应通过从命令行键入其名称来执行。共享库。第三方共享库(程序未开源，
asp.net-mvc - 将 AAD 从一个租户(目录)迁移到另一个租户(目录)
我有一堆用户、组和应用程序注册，我的 MVC 应用程序使用 AAD 数据进行身份验证和授权。是否可以将 Azure Active Directory 从一个租户(目录)迁移到另一个租户(目录)？如果可
clojure - lein-cljsbuild 源 cljs 目录 -> 输出 js 目录？
查看 cljsbuild 文档 https://github.com/emezeske/lein-cljsbuild :cljsbuild { :builds [{ ; The
svn利用TortoiseSVN忽略文件或文件夹(目录)
忽略已经版本控制的文件如果你不小心添加了一些应该被忽略的文件，你如何将它们从版本控制中去除而不会丢失它们？或许你有自己的IDE配置文件，不是项目的一部分，但将会花费很多时间使之按照自己的方式工作。
latex 目录？
我想使用\tableofcontents 命令，但没有目录从新页面开始或在末尾创建新页面，并且所有内容都是单倍行距。我怎样才能做到这一点？我假设使用 tocloft，但有哪些选择？谢谢最佳答案试
JavaScript 目录
我有一些 javascript 菜单代码，可以在单独的目录中正常工作。但是，当我尝试从同一目录中调用相同的 .js 文件时，它不会看到这些文件。以下内容来自另一个目录: script type="t
Python3列出与某个文件夹名称相同级别的所有文件/目录
我有这样的路径: /my/path/to/important_folder 在同一级别上，我还有其他文件和文件夹想要在达到与 important_folder 相同的级别时列出。我的文件夹可能更深，
Python如何获取文件路径/目录
1、获取文件路径实现 1.1 获取当前文件路径 ? 1
emacs 目录-局部变量问题
我正在使用最新版本的 NTEmacs。我写了一个名为“.dir-locals.el”的文件，如下所示。 ((nil . ((tab-width . 8) (fill-column .
Eclipse 的备忘单存储库/目录
关闭。这个问题不满足Stack Overflow guidelines .它目前不接受答案。想改善这个问题吗？更新问题，使其成为 on-topic对于堆栈溢出。 7年前关闭。 Improve thi
vim - 使用vim代码折叠标记生成索引(目录)
在我的 .vimrc 中有这些行 :set foldmethod=marker :set foldmarker=SECTION:,ENDSECTION: 用于自定义代码折叠。在我的文件中，相关语言的注
fish - 如何仅在fishshell中列出文件/目录？
在 fish 中: for x in * echo $x end *这里包括所有目录和文件，如何只列出文件(或目录)？最佳答案 fish 没有很多花哨的通配语法。但是，目录可以像这样迭代: f
Python 目录 hell
这是我的目录结构: ├── src │ ├── helpers │ │ ├── __init__.py │ │ ├── foo.py │ │ └── bar.py │
bash - 递归重命名文件夹/目录
我想递归重命名文件夹/目录名称并找到 this solution所以。但是这个命令没有效果 find . -type f -exec rename 's/old/new/' '{}' \; 这是一个正
iphone - 在相册中创建文件夹/目录
我想在相册中创建一个文件夹，并希望将图像保存在创建的相册中。这可能吗？有什么办法可以做到这一点吗？我已经搜索过，大多数人都说这是不可能的。感谢您的帮助。最佳答案您也许可以使用AssetsLi
python - 具有自定义名称的临时文件/目录？
如何在python中使用用户定义的名称创建临时文件/目录。我知道 tempfile .但是我看不到任何以文件名作为参数的函数。注意:我需要这个来对包含临时文件的临时目录上的 glob(文件名模式匹配
gradle - 从JaCoCo报告中删除特定的*目录*
我在项目中使用JaCoCo Gradle插件。作为问题的一个示例，我的大部分代码都在com.me.mysoftware包下。我正在使用代码生成器来生成build/generated/java/..
Gradle 找不到文件/目录
我正在尝试使用 Gradle 开始运行 jar 文件我的任务如下所示: task startServer(type: Exec) { workingDir file("${buildDir}/a
包含根目录的 Ant 目录
如何在 Ant 中定义一个目录集，其中包括两个目录:项目的基目录和子目录“test”？看起来您无法使用“/”、“.”或“”专门包含目录集的根目录。例如，这包括“./test”，但不包括“.”:
sublimetext2 - 项目查找器的设置是什么以避免搜索某些文件/目录？
我正在使用 CTAGs 包，它使用 Sublime Text 2 生成两个文件 .tags 和 .tags_sorted_by_file。那么当我进行项目搜索(CMD + SHIFT + F)时，如

首页

博学

6Ren·AI

商城

java - hadoop方法将输出发送到多个目录