重复文件查找

重复文件查找,是把一批文件先按大小分组、再对大小相同的文件计算 SHA-256 哈希,找出内容逐字节完全相同的文件(哪怕文件名不同),并统计删掉多余副本能腾出多少空间的工具。它按内容不按文件名判断,大小唯一的文件一个字节都不读;全程在浏览器本地比对,文件不上传。

拖入文件夹或文件,或点击选择文件
文件不上传 · 可分多次追加 · 单次最多 5,000 个文件
比对选项
哈希算法
只看大文件

请选择文件夹,或拖入要查重的文件

🔒 文件大小比较与哈希计算全部在你的浏览器本地完成,文件不上传;工具只读取文件、不删除不移动任何文件。

如何使用重复文件查找

1

点「选择整个文件夹」选中要查重的照片、下载或备份文件夹(手机上用多选文件),也可以把文件夹直接拖进来;可分多次添加,比如先加 D 盘照片、再加 U 盘备份做跨目录查重。

2

看预估:工具会立刻告诉你有多少个文件大小撞车、约需读取多少数据,按需勾选过滤项后点「开始查找」,进度条会显示正在比对哪个文件,可随时取消。

3

在结果里选保留规则(默认保留修改时间最早的),核对每组的「保留 / 多余副本」标记,再复制或下载多余副本清单、报告或 CSV,自己在电脑上把多余副本移到回收站。

关于重复文件查找的常见问题

重复文件查找会把我的文件上传到服务器吗?
不会。文件大小比较与 SHA-256 计算都在你的浏览器本地完成,读取文件用的是本地 File API,没有任何一次把文件名或文件内容发往服务器的请求;关掉或刷新页面即全部清除。工具也不会把文件名、路径或哈希存进浏览器缓存,只会记住算法、保留规则这类偏好设置。
重复文件查找是按文件名还是按内容判断的?
按内容。文件名不同、修改时间不同、放在不同文件夹都不影响判断,只有逐字节完全相同的文件才算重复;反过来,名字一样但内容不同的文件也不会被当成重复,而是单独列在「文件名相同、内容不同」区提醒你,合并两个文件夹时不要按文件名直接覆盖。
重复文件查找能找出相似或压缩过的照片吗?
不能。本工具只找字节完全相同的文件,同一张照片被压缩、改过尺寸、裁剪或重新导出后,文件内容已经变了,不会被判为重复。找「看起来差不多」的相似图片需要图像感知哈希,属于图片处理的范畴,可以到姊妹站在线图片处理看看。
找到重复文件后工具能直接帮我删除吗?
不能,这是有意为之。浏览器没有权限删除或移动你电脑上的文件,这正是本地处理的安全边界;工具也不生成删除脚本,因为相对路径一旦在错的目录执行就会删错。工具会给出每组建议保留哪一份,并导出多余副本清单,由你自己核对后移到回收站。
几千个文件的文件夹查找重复文件要多久?
通常比把每个文件都算一遍哈希快得多:大小各不相同的文件完全不读,大小撞车的文件只读开头 64 KB,开头仍相同的才完整读取。所以耗时主要取决于真正重复的大文件有多大和硬盘速度,而不是文件总数。单次最多 5,000 个文件,单个文件不限大小(分片流式读取,内存占用与文件大小无关)。
手机上能用重复文件查找找出重复照片吗?
可以多选文件查重,但大多数手机浏览器不支持选择整个文件夹,所以「选择整个文件夹」按钮在手机上会隐藏。另外 iPhone 从相册选照片时,系统可能把 HEIC 自动转成 JPEG,同一张照片两次选出来的字节也可能不同;要整理手机相册,建议先导到电脑上再查。
两个看起来一样的文件为什么没被判为重复文件?
说明它们的字节确实不同。常见原因:其中一个被重新保存或压缩过;照片的拍摄信息、标签等元数据不同;文本的换行符或编码不同;其中一个下载不完整。想知道具体差在哪,可以用「文件对比」工具比对这两个文件,它会定位到第一处不同的字节。
查找重复文件用 SHA-256 还是 MD5,会不会误判?
默认用 SHA-256,日常查重可视为不会误判。MD5 稍快一点,算出的值与 md5sum 等系统命令一致,但理论上可以被人为构造碰撞;对你自己的文件查重来说足够。两种算法都只在头部采样仍相同的文件上做完整计算,最终结论一律以完整哈希为准。
查找重复文件时空文件和 .DS_Store 会算进去吗?
默认不算。0 字节空文件彼此内容相同,但删掉也腾不出空间;.DS_Store、Thumbs.db、desktop.ini 和 ._ 开头的文件是系统自动生成的,删了还会再出现,所以这两类默认跳过,并在预估里显示跳过了多少个。确实需要时可在开始查找前取消对应勾选,空文件会照常成组,可释放空间记为 0 B。
重复文件查找建议保留的那一份是怎么选的?
默认保留修改时间最早的那一份(原件通常比副本更早),也可以改成最新修改、路径最短或最先添加;在单组里点「设为保留」还能手动指定。修改时间取自系统记录,文件复制到某些 U 盘或网盘后可能变成复制时间,所以保留建议只是参考,请以实际核对为准。

重复文件查找能找出哪些重复文件

  • 按内容判重,名字不同内容相同的文件也能找出来:改过名的照片副本、「新建文件夹 (2)」里的同一份文档、聊天软件重复保存的附件,只要字节相同就会归到一组。
  • 只读必要的字节:先按大小分桶,大小唯一的文件不读;撞车的只读开头 64 KB;开头还相同的才完整计算 SHA-256。
  • 重复文件占用多少空间一目了然:每组显示「每个多大 × 几个副本 · 可释放多少」,组按可释放空间从大到小排,先处理最占地方的。
  • 建议保留一份:按最早修改 / 最新修改 / 路径最短 / 最先添加四种规则标出「保留」与「多余副本」,单组可手动改。
  • 同名不同内容提醒:两个相机都会产生 IMG_0001.JPG,合并文件夹时按文件名覆盖会丢照片,这类文件单独列出。
  • 本地比对不上传:文件查重全程在浏览器里完成,免安装、免注册,适合在线查找重复文件又不想把私人照片交给网站的场景。

查找重复文件为什么比逐个算 MD5 快得多

网上流传的按 MD5 查找重复文件脚本,或命令行里用 sha256 查找重复文件的写法(sha256sum 全部文件后排序找相同哈希),都会把每个文件从头到尾读一遍。但两个文件只要大小不同,内容就不可能相同,根本不必读。 以一个 1000 张照片、共 2.37 GB 的文件夹为例:其中只有 40 张大小撞车,工具只读这 40 张的前 64 KB;开头仍然相同的只有 6 张,再把这 6 张完整读一遍,确认出 3 组重复。

整个过程实际读取约 11.09 MB,只占全部数据的 0.5%。头部采样只用来提前排除,最终结论一律以完整哈希为准: 两个文件哪怕前 64 KB 一模一样、只有最后一个字节不同,也不会被误判为重复。

找到重复文件后,怎么安全地做重复文件清理

找出重复文件只是第一步,真正动手删之前建议按下面的顺序来:

  1. 先导出,不急着动手:下载「多余副本清单」或 CSV,清单里每行一个相对路径,按组排好,方便你对照着在资源管理器或 Finder 里逐个找到。
  2. 抽查几组再批量处理:挑几组打开看看,确认确实是同一份文件、保留的那份放在你想要的位置;尤其留意「同名不同内容」区,那些文件只是名字一样。
  3. 移到回收站,而不是直接删除:多余副本先拖进回收站 / 废纸篓,过几天确认没有程序或相册引用它们再清空,误删也还能找回来。
  4. 同步目录先暂停同步:网盘同步盘、手机相册备份目录里的文件,删除会同步到云端和其它设备;清理前先暂停同步,处理完再恢复。

本工具不提供一键删除,也不打包「去重后的文件」下载。只想确认两个文件是否一致,用 文件对比;想拿某个文件的哈希值去核对官方发布,用 文件校验和验证。重复照片查找在这里只认字节完全相同的照片,相似图片请到 在线图片处理。

不同场景怎么查找重复文件

  • 电脑重复文件怎么找:不必整盘扫,单次上限 5,000 个文件;重复最集中的通常是「下载」「桌面」「图片」和聊天软件的接收目录,按这几个文件夹分批添加,比漫无目的地扫系统盘有效得多。
  • 文件夹重复文件查找 / 备份文件夹去重:把原文件夹和备份文件夹分两次添加,工具会跨目录比对。备份副本的修改时间往往更晚,默认的「保留最早修改」规则通常会保留原文件夹那一份;不放心就在单组里手动「设为保留」。
  • U盘重复文件清理:U 盘读取速度通常比本机硬盘慢,耗时主要花在完整读取大小撞车的大文件上;可以先用「只看大文件」档位跳过小文件,优先处理最占空间的那几组。
  • 重复照片查找:同一张照片被多次导入、改名另存,字节没变就能找出来;被压缩、裁剪或从 HEIC 转成 JPEG 的则不算重复,这类相似图片不在本工具的判断范围内。

默认会忽略两类文件:0 字节空文件(它们彼此「内容相同」,但删掉腾不出任何空间,列出来只会干扰),以及 .DS_Store、Thumbs.db、desktop.ini 和 ._ 开头的系统附带文件(macOS 与 Windows 自动生成,删了还会再生成)。两个选项都可以在开始查找前取消勾选,被跳过的个数会单独显示。

英文语境下这类工具通常叫 duplicate file finder 或 duplicate file remover,搜 find duplicate files online 找到的都是同一件事;区别在于本工具只负责找出重复和导出清单,删除留给你自己确认后再做。