- android - RelativeLayout 背景可绘制重叠内容
- android - 如何链接 cpufeatures lib 以获取 native android 库?
- java - OnItemClickListener 不起作用,但 OnLongItemClickListener 在自定义 ListView 中起作用
- java - Android 文件转字符串
我使用的是 Hadoop 2.6.4 版。我正在编写一个 MapReduce 作业,它将采用 3 个参数,即 -Keyword,输入文件和输出文件的路径。我理想的输出应该是所有包含关键字的文件的名称。简单的逻辑是遍历文本中的每一行并将其与我们的关键字匹配。如果它返回 true 打印文件名。
经过广泛的谷歌搜索后,我找到了 3 个获取文件名的选项
Context.getConfiguration().get("map.input.file")
Context.getConfiguration().get("mapreduce.map.input.file")
这两种方法都返回了一个值为“null”的字符串,即它们在我的终端屏幕上打印了“null”。
最后我从 site.google.com 尝试了这个
public Path filesplit;
filesplit=((FileSplit)context.getInputSplit()).getPath();
System.out.println(filesplit.getName())
上述方法产生了错误。终端输出看起来像这样:-
java.lang.Exception: java.lang.ClassCastException: org.apache.hadoop.mapreduce.lib.input.FileSplit cannot be cast to org.apache.hadoop.mapred.FileSplit
at org.apache.hadoop.mapred.LocalJobRunner$Job.runTasks(LocalJobRunner.java:462)
at org.apache.hadoop.mapred.LocalJobRunner$Job.run(LocalJobRunner.java:522)
Caused by: java.lang.ClassCastException: org.apache.hadoop.mapreduce.lib.input.FileSplit cannot be cast to org.apache.hadoop.mapred.FileSplit
at org.myorg.DistributedGrep$GrepMapper.map(DistributedGrep.java:23)
at org.myorg.DistributedGrep$GrepMapper.map(DistributedGrep.java:1)
at org.apache.hadoop.mapreduce.Mapper.run(Mapper.java:145)
at org.apache.hadoop.mapred.MapTask.runNewMapper(MapTask.java:784)
at org.apache.hadoop.mapred.MapTask.run(MapTask.java:341)
at org.apache.hadoop.mapred.LocalJobRunner$Job$MapTaskRunnable.run(LocalJobRunner.java:243)
at java.util.concurrent.Executors$RunnableAdapter.call(Executors.java:471)
at java.util.concurrent.FutureTask.run(FutureTask.java:262)
at java.util.concurrent.ThreadPoolExecutor.runWorker(ThreadPoolExecutor.java:1145)
at java.util.concurrent.ThreadPoolExecutor$Worker.run(ThreadPoolExecutor.java:615)
at java.lang.Thread.run(Thread.java:745)
有人可以建议解决这些错误的方法吗?可能出了什么问题,我有什么错误吗?
或者您有任何其他想法来获取映射器正在执行的当前行的文件名。
如果你想全面了解这里的代码,它是
package org.myorg;
import java.io.*;
import org.apache.hadoop.conf.Configuration;
import org.apache.hadoop.fs.*;
import org.apache.hadoop.io.*;
import org.apache.hadoop.mapred.FileSplit;
import org.apache.hadoop.mapreduce.Job;
import org.apache.hadoop.mapreduce.Mapper;
import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;
import org.apache.hadoop.mapreduce.lib.output.FileOutputFormat;
import org.apache.hadoop.util.GenericOptionsParser;
public class DistributedGrep {
public static class GrepMapper extends
Mapper<Object, Text, NullWritable, Text> {
public Path filesplit;
public void map(Object key, Text value, Context context)
throws IOException, InterruptedException {
filesplit = ((FileSplit)context.getInputSplit()).getPath();
String txt = value.toString();
String mapRegex = context.getConfiguration().get("mapregex");
// System.out.println(context.getConfiguration().get("mapreduce.map.input.file");
System.out.println(filesplit.getName());
if (txt.matches(mapRegex)) {
System.out.println("Matched a line");
context.write(NullWritable.get(), value);
}
}
}
public static void main(String[] args) throws Exception {
Configuration conf = new Configuration();
conf.set("mapregex", args[0]);
Job job = new Job(conf, "Distributed Grep");
job.setJarByClass(DistributedGrep.class);
job.setMapperClass(GrepMapper.class);
job.setOutputKeyClass(NullWritable.class);
job.setOutputValueClass(Text.class);
job.setNumReduceTasks(0); // Set number of reducers to zero
FileInputFormat.addInputPath(job, new Path(args[1]));
FileOutputFormat.setOutputPath(job, new Path(args[2]));
System.exit(job.waitForCompletion(true) ? 0 : 1);
}
}
最佳答案
选项 1 和 2
Context.getConfiguration().get("map.input.file")
Context.getConfiguration().get("mapreduce.map.input.file")
我相信这两个都返回 null
因为它们应该与旧的 mapred
API 及其 JobConf
配置对象一起使用。您的 #3
选项是为 mapreduce
API 执行此操作的方式。
使用 mapred
API,您可以执行以下操作:
public void configure(JobConf job) {
inputFile = job.get(JobContext.MAP_INPUT_FILE);
}
此处显示:https://hadoop.apache.org/docs/r2.7.2/api/org/apache/hadoop/mapred/Mapper.html
JobContext.MAP_INPUT_FILE
常量值以前是 map.input.file
并更改为 mapreduce.map.input.file
一些点。
https://hadoop.apache.org/docs/r2.7.2/hadoop-project-dist/hadoop-common/DeprecatedProperties.html
选项 3
您正在混合使用 MapReduce API。有两个 mapred
和 mapreduce
API。
您可以在收到的错误中看到这一点:
Caused by: java.lang.ClassCastException: org.apache.hadoop.mapreduce.lib.input.FileSplit 无法转换为 org.apache.hadoop.mapred.FileSplit
您已导入:
导入 org.apache.hadoop.mapred.FileSplit
它来自 mapred
API,但您使用的是 mapreduce
API。将导入更改为:
导入 org.apache.hadoop.mapreduce.lib.input.FileSplit;
您的代码中的一个线索(除了导入之外)已经发生了这种情况,即您需要添加强制转换以使代码编译:
filesplit = ((FileSplit)context.getInputSplit()).getPath();
这应该是:
filesplit = context.getInputSplit().getPath();
关于java - 在 Mapper 中检索当前行的文件名,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/37805250/
我试图通过这段代码读取未知数量的整数: while (1) { int c = getchar (); if (c == EOF) break;
我正试图找到一个类似于谷歌分析日期选择器的日期选择器: 知道 jQuery 是否提供了类似的东西吗? 最佳答案 这个 Twitter Bootstrap 风格的日期范围选择器非常接近。 https:/
我正在使用 javascript。如何获取当前 URL 的路径并将其分配给我的代码?这是我的代码: $(document).ready(function() { $(".share").hides
如何获得今天的Julian day number (JDN)相等的?或任何日期? 我看了又看,但只发现了一些产生“year-dayOfYear”的函数,而不是:2457854。 最佳答案 在 bash
我有相当简单的 UDP 服务器写在 c 上。 有时我需要知道在套接字中排队的所有 udp 数据包(字节)的当前长度。 据我了解,getsockopt 没有得到这样的信息。 欢迎使用 Linux 和 F
我一直在寻找几个小时来找到一个可以在图像中添加诸如“填充:5px”之类的东西的插件。每个人都通过纯 html 做到这一点吗?我们的客户需要一种方法来简单地使用按钮或右键单击上下文菜单来添加它。有什么建
是否有可能获得当前正在执行的 TCL 脚本的完整路径? 在 PHP 中,它将是:__FILE__ 最佳答案 根据“当前正在执行的 TCL 脚本”的含义,您实际上可能会寻找 info script ,甚
我最近从直接使用 ISession 转向了包装的 ISession,即工作单元类型模式。 我曾经使用 SQL Lite(内存中)对此进行测试。我有一个简单的帮助器类,它配置我的 SessionFact
我按照步骤操作 here在 WebStorm 中配置代码完成和其他内容,但我仍然收到以下语法错误。 我该如何解决这个问题? 最佳答案 通过相应地将“JavaScript 语言版本”(Settings/
我可以为我团队的 TFS 当前 Sprint 任务板添加书签吗?我们有两周的冲刺,因此 URL 每两周更改一次。 默认 URL 的形式为: http://[Server]/tfs/[Project]/
是否有 Subversion 命令可以显示当前版本号? 在svn checkout之后,我想启动一个脚本并需要变量中的修订号。如果有像 svn info get_revision_number 这样的
我正在编写表单的一个组件 首次安装组件时,sources={{}} ,一本空字典。由于该组件包装了现有的 Javascript 库,因此我正在实现一个自定义比较函数。为了让这个 diffing 函数
无论系统时间设置为多少以及机器所在的时区,我都需要正确的 UTC 时间。 (即使我必须打电话到互联网才能同步......) 是否有一些库或其他方法可以优雅地做到这一点? 最佳答案 如果您想获得准确可靠
我一边编码,一边拿出一些我和 friend 建立的旧网站来重新开始工作。我已经有一段时间没有做过任何 AJAX 了,当我试图找出我的代码失败的地方时,我发现没有显示很多资源。我猜这是因为我使用的是旧方
由于对性能的巨大影响,我从不怀疑我现在的桌面CPU是否有分支预测。当然可以。但各种 ARM 产品又如何呢? iPhone或Android手机有分支预测吗?较旧的任天堂 DS?基于 PowerPC 的
我有一个具有以下有效负载的 JWT: { "id": "394a71988caa6cc30601e43f5b6569d52cd7f6df", "jti": "394a71988caa6cc30
从其他一些帖子中,我能够通过以下方式获取当前 URI: 但是以下方法不起作用: 我很好奇为什么上面的方法不起作用,以及如何将当前 URI 分配给字符串。 最佳答案 每the javadocs ,g
我在表格 View 中有几个单元格。现在在任何给定的时间点,我想计算 View 中单元格的当前高度,即如果它是 View 的 3/4,它应该返回 (cellheight)*3/4 高度。 我通过以下方
这是网站的身份验证脚本。这安全吗?是最近的节目吗?它已经过时了吗?是否有“更好更安全的方法”我很新,但我没有看到太多地方使用 header 授权。 如有任何帮助,我们将不胜感激!这是我制作的第一个登录
我已经在其他 stackoverflow 线程上检查过这个错误,但在我的代码中没有发现任何错误。也许我累了,但我觉得还好。 网站.urls.py: from django.conf.urls impo
我是一名优秀的程序员,十分优秀!