- Java 双重比较
- java - 比较器与 Apache BeanComparator
- Objective-C 完成 block 导致额外的方法调用?
- database - RESTful URI 是否应该公开数据库主键?
我经常使用 Java 8 流来处理文件,但到目前为止总是逐行处理。
我想要的是一个函数,它获取一个 BufferedReader br
并且应该读取特定数量的单词(由 "\\s+"
分隔)并且应该离开BufferedReader 在准确的位置,达到字数的地方。
现在我有一个版本,它按行读取文件:
final int[] wordCount = {20};
br
.lines()
.map(l -> l.split("\\s+"))
.flatMap(Arrays::stream)
.filter(s -> {
//Process s
if(--wordCount[0] == 0) return true;
return false;
}).findFirst();
这显然将 Inputstream 留在了下一行的位置第20个字。
有没有办法获得从输入流中读取少于一行的流?
编辑
我正在解析一个文件,其中第一个单词包含后续单词的数量。我读了这个词,然后相应地读入了具体的字数。该文件包含多个这样的部分,其中每个部分都在所描述的函数中进行解析。
阅读了所有有用的评论后,我很清楚,使用 Scanner
是解决此问题的正确选择,并且 Java 9 将有一个 Scanner
类它提供流功能(Scanner.tokens()
和 Scanner.findAll()
)。
以我描述的方式使用 Streams 无法保证读者将在流的终端操作( API docs )之后处于特定位置,因此使流成为解析结构的错误选择,您只在其中解析一个部分,必须跟踪位置。
最佳答案
关于您的原始问题:我假设您的文件如下所示:
5 a section of five words 3 three words
section 2 short section 7 this section contains a lot
of words
你想得到这样的输出:
[a, section, of, five, words]
[three, words, section]
[short, section]
[this, section, contains, a, lot, of, words]
一般来说,Stream API 不太适合这类问题。在这里编写普通的旧循环看起来是一个更好的解决方案。如果您仍想查看基于 Stream API 的解决方案,我建议您使用我的 StreamEx包含 headTail()
的库方法允许您轻松编写自定义流转换逻辑。以下是如何使用 headTail
解决您的问题:
/* Transform Stream of words like 2, a, b, 3, c, d, e to
Stream of lists like [a, b], [c, d, e] */
public static StreamEx<List<String>> records(StreamEx<String> input) {
return input.headTail((count, tail) ->
makeRecord(tail, Integer.parseInt(count), new ArrayList<>()));
}
private static StreamEx<List<String>> makeRecord(StreamEx<String> input, int count,
List<String> buf) {
return input.headTail((head, tail) -> {
buf.add(head);
return buf.size() == count
? records(tail).prepend(buf)
: makeRecord(tail, count, buf);
});
}
使用示例:
String s = "5 a section of five words 3 three words\n"
+ "section 2 short section 7 this section contains a lot\n"
+ "of words";
Reader reader = new StringReader(s);
Stream<List<String>> stream = records(StreamEx.ofLines(reader)
.flatMap(Pattern.compile("\\s+")::splitAsStream));
stream.forEach(System.out::println);
结果看起来与上面期望的输出完全一样。将 reader
替换为您的 BufferedReader
或 FileReader
以从输入文件中读取。记录流是惰性的:流一次最多保留一条记录,如果你短路,输入的其余部分将不会被读取(好吧,当然当前文件行会被读取到最后).该解决方案虽然看起来是递归的,但不会占用堆栈或堆,因此它也适用于大文件。
解释:
headTail()
方法接受一个双参数 lambda,当请求流元素时,它在外部流终端操作执行期间最多执行一次。 lambda 接收第一个流元素(head)和包含所有其他原始元素的流(tail)。 lambda 应该返回一个新的流,它将被用来代替原来的流。在 records
中,我们有:
return input.headTail((count, tail) ->
makeRecord(tail, Integer.parseInt(count), new ArrayList<>()));
输入的第一个元素是 count
:将其转换为数字,创建空的 ArrayList
并为尾部调用 makeRecord
。下面是 makeRecord
辅助方法实现:
return input.headTail((head, tail) -> {
第一个流元素是head
,将它添加到当前缓冲区:
buf.add(head);
达到目标缓冲区大小?
return buf.size() == count
如果是,再次调用 tail
的 records
(处理下一条记录,如果有的话)并在结果流前添加单个元素:当前缓冲区。
? records(tail).prepend(buf)
否则,为尾部调用自己(向缓冲区添加更多元素)。
: makeRecord(tail, count, buf);
});
关于Java 8 流 : Read file word by word,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/35275884/
我想知道是否可以访问放在 tomcat 的 conf 文件夹中的文件。通常我会在这个文件中放置多个 webapp 的配置,在 war 之外。 我想使用类路径独立于文件系统。 我过去使用过 lib 文件
我有一个 PowerShell 脚本,它获取文件列表并移动满足特定条件的文件。为什么即使对象为空,foreach 循环也会运行? 我假设如果 $i 不存在,它就不会运行。但是如果 $filePath
我已将 BasicAccountRule.drl 放置在我的 Web 应用程序中,位置为:C:/workspace/exim_design/src/main/resources/rules/drl/i
我使用 File.open('file.txt').class 和 File.open('file.txt').readlines.class 以及前者进行了检查一个返回 File,后者返回 Arra
我正在尝试使用 FileOutputStream 删除文件,在其中写入内容后。这是我用来编写的代码: private void writeContent(File file, String fileC
我正在尝试使用 flink 和 python 批处理 api 测试 Wordcount 经典示例。我的问题是,将数据源从 env.from_elements() 修改为 env.read_text()
我正在尝试制作一个可以同时处理多个不同文件的程序。我的想法是制作一个包含 20 个 FILE* 的数组,以便在我达到此限制时能够关闭其中一个并打开请求的新文件。 为此,我想到了一个函数,它选择一个选项
我有两个文件A和B文件A: 976464 792992 文件B TimeStamp,Record1,976464,8383,ABCD 我想搜索文件 A 和文件 B 中的每条记录并打印匹配的记录。打印的
我有一些保存在 map 中的属性文件。示例: Map map = new HashMap<>(); map.put("1", "One"); map.put("2", "Two"); map.put(
我正在尝试找出一个脚本文件,该文件接受一个包含文件列表的文件(每一行都是一个文件路径,即 path/to/file)并将它们合并到一个文件中。 例如: list.text -- path/to/fil
为了使用 File.CreateText() 和 File.AppendText() 你必须: 通过调用这些方法之一打开流 写消息 关闭流 处理流 为了使用 File.AppendAllText()
使用rsync时,如何在使用--files-from参数复制时重命名文件?我有大约190,000个文件,在从源复制到目标时,每个文件都需要重命名。我计划将文件列表放在一个文本文件中传递给--files
我在非服务器应用程序中使用 Spring(只需从 Eclipse 中某个类的 main() 编译并运行它)。 我的问题是作为 new FileSystemXmlApplicationContext 的
QNX (Neutrino 6.5.0) 使用 ksh 的开源实现作为其 shell 。许多提供的脚本,包括系统启动脚本,都使用诸如 if ! test /dev/slog -ef /dev/slog
当我尝试打开从我的应用程序下载的 xls 文件时,出现此错误: excel cannot open the file because the file format or file extension
有一些相关的概念,即文件指针、流和文件描述符。 我知道文件指针是指向数据类型 FILE 的指针(在例如 FILE.h 和 struct_FILE.h 中声明)。 我知道文件描述符是 int ,例如成员
好吧,这应该很容易... 我是groovy的新手,我希望实现以下逻辑: def testFiles = findAllTestFiles(); 到目前为止,我想出了下面的代码,该代码可以成功打印所有文
我理解为什么以下内容会截断文件的内容: Get-Content | Out-File 这是因为 Out-File 首先运行,它会在 Get-Content 有机会读取文件之前清空文件。 但是当我尝
您好,我正在尝试将文件位置表示为变量,因为最终脚本将在另一台机器上运行。这是我尝试过的代码,然后是我得到的错误。在我看来,python 是如何添加“\”的,这就是导致问题的原因。如果是这种情况,我如何
我有一个只包含一行的输入文件: $ cat input foo bar 我想在我的脚本中使用这一行,据我所知有 3 种方法: line=$(cat input) line=$( input"...,
我是一名优秀的程序员,十分优秀!