gpt4 book ai didi

java - 应用程序查找重复匹配项应遵循什么标准

转载 作者:行者123 更新时间:2023-12-01 22:07:32 26 4
gpt4 key购买 nike

我基本上是编程新手,我想做一个程序,可以在文件夹中查找重复文件(有很多程序,其中一些是免费的,不在乎,我想做我的程序),问题是什么属性需要 2 个文件才能匹配? 起初我在想如果它们是mp3,要进行名称和大小检查,pdf相同,txt相同+实际内容检查? 而且按照这个顺序,我在某处读到他们首先检查尺寸,然后检查其他东西,我觉得这种方式不对。 我需要一些其他或更好的想法。

谢谢

最佳答案

我认为这是您检查扩展名的想法,并且文件大小也不错。根据您的需要,我可以提示您一些我认为可行的内容:

<强>1。检查扩展:

当你想排除其中一些时。但如果你想确切地检查里面有什么,它就行不通了。

简单的例子:

具有内部 0001 位的 My_file.pdf 和具有内部 0001 位的 My_file.jpg 将被排除,但它们仍然相同。

<强>2。检查尺寸:

如果您要检查扩展名,检查文件大小并不是一个好主意,因为有两个文件“.pdf”包含(0001)和第二个(0100),您可以很容易地看到它们不相等,但检查大小将返回确实如此,但当然,如果两个文件大小不相等,您可以删除它们并说它们不相等。

<强>3。检查哈希值:

从您的文件中创建哈希值,然后比较它们,如果它们相等,就会为您提供信息,因为哈希函数将始终为相同的对象返回相同的哈希值。

查看更多:https://en.wikipedia.org/wiki/Hash_function

<强>4。每个字节检查一个字节:

虽然这不是一个好主意,但假设你有 2x4GB 文件,你的哈希函数可以工作很长时间,当然每个字节会工作更长时间,但你可能会遇到这样的情况:

File1.pdf (4GB) 文件开头:011010...0 File2.pdf (4GB) 111010...0

如您所见,第一次检查第一个字节将自动返回这些文件不相等,这样您将节省大量时间。

当然,您必须思考,您需要什么,您想如何比较文件,这些只是可以帮助您构建应用程序的片段。

所有这些方法在 Java 中都很简单,实现它们不会有任何问题。

PS:对不起我的英语,这不是我的主要语言。

关于java - 应用程序查找重复匹配项应遵循什么标准,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/32396936/

26 4 0
Copyright 2021 - 2024 cfsdn All Rights Reserved 蜀ICP备2022000587号
广告合作:1813099741@qq.com 6ren.com