shell - 以十六进制序列递归搜索二进制文件的目录？-6ren

shell - 以十六进制序列递归搜索二进制文件的目录？

转载作者：行者123 更新时间：2023-12-01 23:43:26

25

4

我用来搜索一些十六进制值的当前命令(比如 0A 8b 02 )涉及:
find . -type f -not -name "*.png" -exec xxd -p {} \; | grep "0a8b02" || xargs -0 -P 4
鉴于以下目标，是否可以改进这一点:

递归搜索文件

显示偏移量和文件名

排除具有某些扩展名的某些文件(以上示例不会搜索 .png 文件)

速度:搜索需要直接处理 200,000 个文件(大约 50KB 到 1MB)，总共约 2GB。

如果 xargs，我不太有信心为 4 个处理器正常工作。当 grep 打印文件名时，我也有困难找到匹配项，因为它是从 xxd 管道传输的.有什么建议？

最佳答案

如果:

你有 GNU grep

并且您搜索的十六进制字节从不包含换行符 ( 0xa )[1]

如果它们包含 NUL ( 0x )，您必须提供 grep通过文件( -f )而不是直接参数搜索字符串。

使用搜索 0e 8b 02 的示例，以下命令将带您到达那里:

LC_ALL=C find . -type f -not -name "*.png" -exec grep -FHoab $'\x{0e}\x{8b}\x{02}' {} + |
  LC_ALL=C cut -d: -f1-2

grep命令产生如下输出行:

<filename>:<byte-offset>:<matched-bytes>

其中 LC_ALL=C cut -d: -f1-2然后减少到 <filename>:<byte-offset>
该命令几乎适用于 BSD grep ，除了报告的字节偏移量始终是模式匹配行的开头。
换句话说:只有在文件中的匹配项之前没有换行符时，字节偏移量才会正确。
另外，BSD grep不支持将 NUL ( 0x0 ) 字节指定为搜索字符串的一部分，即使通过带有 -f 的文件提供时也不支持.

请注意，不会有并行处理，但只有少数 grep调用，基于使用 find的 -exec ... + ，其中，如 xargs , 将命令行中适合的尽可能多的文件名传递给 grep立刻。

通过出租 grep直接搜索字节序列，不需要xxd :

序列被指定为 ANSI C-quoted string ，这意味着转义序列被 shell 扩展为文字，使 Grep 能够搜索结果字符串作为文字(通过 -F )，这样更快。
链接文章来自 bash手册，但它们在 zsh 中工作(和 ksh )也是。

GNU Grep 的替代方法是使用 -P (支持 PCEs，Perl 兼容的正则表达式)带有非预扩展转义序列，但这会更慢:grep -PHoab '\x{0e}\x{8b}\x{02}'

LC_ALL=C确保 grep将每个字节视为自己的字符而不应用任何编码规则。

-F将搜索字符串视为文字(而不是正则表达式)

-H将相关的输入文件名添加到每个输出行；请注意，当给出超过 1 个文件名参数时，Grep 会隐式执行此操作

-o只报告匹配的字符串(字节序列)，而不是整行(无论如何，行的概念在二进制文件中没有任何意义)[2]

-a将二进制文件视为文本文件(如果没有这个，Grep 只会打印文本 Binary file <filename> matches 用于匹配的二进制输入文件)

-b报告匹配的字节偏移

如果在给定的输入文件中最多找到 1 个匹配项就足够了，请添加 -m 1 .

[1] 不能使用换行符，因为 Grep 总是将搜索模式字符串中的换行符视为分隔多个搜索模式。此外，Grep 是基于行的，因此您无法跨行匹配； GNU Grep 的 -null-data按 NUL 字节拆分输入的选项可能会有所帮助，但前提是您的搜索字节序列不包含 NUL 字节；您还必须将您的字节值表示为与 -P 结合的正则表达式中的转义序列。 - 因为你需要使用转义序列 \n代替实际的换行符。

[2] -o需要制作 -b报告匹配的字节偏移量，而不是行首的偏移量(不幸的是，BSD Grep 总是做后者)；此外，这里只报告匹配本身是有益的，因为尝试打印整行会导致不可预测的长输出行，因为二进制文件中没有行的概念；然而，无论哪种方式，从二进制文件输出字节都可能导致终端出现奇怪的渲染行为。

关于shell - 以十六进制序列递归搜索二进制文件的目录？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/30260835/

25

4

0

文章推荐： python - 如何使用 Pandas 获取 csv 文件的最后一 block ？

文章推荐： java - 停止供应商内部的 CompletableFuture 链

文章推荐： R聚类-带有观察标签的轮廓

android - 未处理的异常 : Android. Views.InflateException:二进制 XML 文件行 #1:二进制 XML 文件行 #1:类 fragment 膨胀时出错
我正在尝试将谷歌地图集成到 Xamarin Android。但是，如标题中所写，收到错误。此错误出现在我的 SetContentView (Resource.Layout.Main); 上，如下所示:
Delphi读取非文本文件(二进制)
在 Delphi 中如何以非文本模式打开二进制文件？类似于 C 函数 fopen(filename,"rb") 最佳答案有几个选项。 1。使用文件流 var Stream: TFileStrea
计算段中的一个(二进制)
我现在正在处理一个问题，如下所示: 有两个数字 x1 和 x2 并且 x2 > x1。例如 x1 = 5; x2 = 10; 而且我必须在二进制表示中找到 x1 和 x2 之间的总和。 5 = 10
gcc - 二进制 AND (&) 的无效操作数
我有这个“程序集”文件(仅包含 directives ) // declare protected region as somewhere within the stack .equiv prot_s
Powershell 二进制 grep
有没有办法在powershell中确定指定的文件是否包含指定的字节数组(在任何位置)？就像是: fgrep --binary-files=binary "$data" "$filepath" 当然，
Delphi 二进制/文本文件必要性
我是一名工程师，而不是软件程序员，所以请原谅我的无知。我编写了一个 Delphi(7SE) 程序，用于从连接到两个数字温度计的 USB 端口读取“真实”数据类型。我已经完成了该计划的大部分内容。
c++ - 二进制 + 的无效操作数
我有一些代码，例如: u=(float *)calloc(n, sizeof(float)); for(i=1; i
c++ - 二进制 * 的无效操作数
typedef struct pixel_type { unsigned char r; unsigned char g; unsigned char b;
c++ - 二进制-十进制负位集
如何判断二进制数是否为负数？目前我有下面的代码。它可以很好地转换为二进制文件。转换为十进制时，我需要知道最左边的位是否为 1 以判断它是否为负数，但我似乎无法弄清楚该怎么做。此外，我如何才能让它返
c++ - 二进制 * 运算符未找到
我有一个带有适当重载的 Vect*float 运算符的 vector 类，我正在尝试创建全局/非成员 float*Vect 运算符，如下所示:(注意这是一个经过大量编辑的示例) class Vect
图像的转换--->二进制--->图像使用C
对于使用 C 编程的项目，我们正在尝试将图像转换为二进制数据，反之亦然。我们在网上找到的所有其他解决方案都是用 C++ 或 Java 编写的。这是我们尝试过的方法: 将图像转换为包含二进制数据的文本文
python - (二进制)对列表的元素求和
我需要对列表的元素求和，其中包含所有零或一，如果列表中有 1，则结果为 1，否则为 0。 def binary_search(l, low=0,high=-1): if not l: retu
python - 如何将浮点十进制转换为浮点八进制/二进制？
我到处搜索以找到将 float 转换为八进制或二进制的方法。我知道 float.hex 和 float.fromhex。是否有模块可以对八进制/二进制值执行相同的工作？例如:我有一个 float 1
c - 二进制 "|"的无效操作数
当我阅读有关 list.h 文件中的 hlist 的 FreeBSD 源代码时，我对这个宏感到困惑: #define hlist_for_each_entry_safe(tp, p, n, head,
c - 二进制 % 的操作数无效？
我不知道出了什么问题，也不知道为什么会出现此错误。我四处搜索，但我终究无法弄明白。 void print_arb_base(unsigned int n, unsigned int b) {
algorithm - 十进制转位(二进制)
在任何语言中都可以轻松地将十进制转换为二进制，反之亦然，但我需要一个稍微复杂一点的函数。给定一个十进制数和一个二进制位，我需要知道二进制位是开还是关(真或假)。示例: IsBitTrue(30,1
c - 为什么使用此代码创建的文本文件具有字符集 == 二进制？
在下面的代码中，我创建了两个文件，一个是文本格式，另一个是二进制格式。文件的图标显示相同。但是这两个文件的特征完全相同，包括大小、字符集(==二进制)和流(八位字节)。为什么没有文本文件？因为如果我明
Python 二进制 EOF
我想通读一个二进制文件。谷歌搜索“python binary eof”引导我here . 现在，问题: 为什么容器(SO 答案中的 x)不包含单个(当前)字节而是包含一大堆字节？我做错了什么？如果应
python - 二进制/十六进制浮点输入
为什么只允许以 10 为基数使用小数点？为什么以下会引发语法错误？ 0b1011101.1101 我输入的数字是否有歧义？除了 93.8125 之外，字符串似乎没有其他可能的数字同样的问题也适用于其
c++ - boost::二进制<>
boost 库中有二进制之类的东西吗？例如我想写: binary a; 我很惭愧地承认我曾尝试找到它(Google、Boost)但没有结果。他们提到了一些关于 binary_int<> 的内容，但我既

首页

博学

6Ren·AI

商城

shell - 以十六进制序列递归搜索二进制文件的目录？