7.09.2026
Jak wykryć zduplikowane pliki za pomocą sum kontrolnych SHA-256 i MD5
Znalezienie zduplikowanych plików po nazwach czy rozmiarze to pułapka, która często kończy się fałszywymi trafieniami i straconym czasem. Dwa pliki mogą mieć identyczną nazwę, ale kompletnie inną zawartość, zwłaszcza po przekopiowaniu z innego źródła, zmianie rozszerzenia lub podmianie w ramach ataku. Odwrotnie, ten sam plik może występować pod dziesiątkami różnych nazw w różnych folderach, z dodatkowymi spacjami, polskimi znakami czy wersjami „_kopia(2)”. W takich przypadkach jedynym wiarygodnym kryterium jest zawartość, a nie etykieta. Suma kontrolna, czyli hash kryptograficzny wyliczony z całego strumienia bajtów, działa jak odcisk palca cyfrowy. Jeśli dwa pliki dają ten sam wynik SHA-256, MD5 lub CRC32, to z bardzo wysokim prawdopodobieństwem są bitowo identyczne. To właśnie ta właściwość sprawia, że porównanie po sumach kontrolnych jest podstawą weryfikacji integralności, audytach, dziennikarstwie śledczym i sporach o pliki.
Suma kontrolna nie mówi, co plik przedstawia, ani kto jest jego autorem. Mówi wyłącznie to, że zawartość jest taka sama lub zmieniona. Jedna zmieniona spacja w dokumencie daje zupełnie inny hash. To techniczne stwierdzenie faktu, nie dowód prawny.
W praktyce najprościej zacząć od ręcznego sprawdzenia kilku podejrzanych plików. Na Windowsie PowerShell pozwala wyliczyć SHA-256 w jednej linii, na macOS w Terminalu polecenie shasum -a 256 robi to samo, a na Linuksie działa sha256sum. Dla większej liczby plików wygodniej jest wygenerować listę hashy w jednym przejściu i później porównać wyniki. Typowy skrypt przegląda wybraną gałąź dysku, zapisuje ścieżkę i hash do pliku tekstowego, a następnie sortuje plik i szuka duplikatów za pomocą polecenia uniq -d. Takie podejście jest szybkie, ale nie daje dokumentacji. Nie ma znacznika czasu, nie ma kontekstu metadanych pliku i nie ma czytelnego raportu dla osób trzecich. Dla pojedynczych weryfikacji wystarczy, ale w pracy audytowej potrzebna jest powtarzalność i przejrzystość.
Właśnie dlatego w środowiskach, gdzie liczy się dokumentacja, stosuje się dedykowane narzędzia do ekstrakcji dowodów technicznych. Przesłanie pliku na stronę główną FilesAudit pozwala od razu uzyskać zestaw sum kontrolnych SHA-256, MD5 i CRC32 wraz z pełną metadaną techniczną, znacznikiem czasu analizy i profesjonalnym raportem PDF. Raport ten nie ustala praw własności, a jedynie rejestruje stan techniczny pliku w momencie analizy, co jest kluczowe przy porównywaniu wersji i wykrywaniu duplikatów w toku postępowania. Takie podejście jest szczególnie przydatne, gdy trzeba wykazać, że dwa pliki pobrane z różnych źródeł są identyczne, albo że jeden z nich został zmodyfikowany po publikacji.
Warto pamiętać o ograniczeniach metod. MD5 jest szybki, ale podatny na kolizje i w środowiskach forensycznych traktowany jest już tylko jako wsparcie. CRC32 jest bardzo szybki i świetny do wykrywania przypadkowych błędów, lecz nie zapewnia bezpieczeństwa kryptograficznego. SHA-256 jest obecnie standardem do jednoznacznego potwierdzania tożsamości pliku. Dwa pliki mogą mieć ten sam hash tylko wtedy, gdy są identyczne bit po bicie. Jeśli szukasz duplikatów, najlepiej porównywać SHA-256, a MD5 i CRC32 traktować jako dodatkowe szybkie filtry.
Gdy problem dotyczy tysięcy zdjęć, filmów, dokumentów czy archiwów, ręczne porównywanie staje się niewykonalne. Tutaj liczy się analiza wsadowa i możliwość porównania hashy bezpośrednio w przeglądarce. Aplikacja Desktop FilesAudit została stworzona właśnie do tego typu pracy lokalnej, bez wysyłania danych na serwer, z nieograniczoną liczbą analiz i wsparciem dla ponad dwustu formatów od JPG i PNG przez MP4 i DOCX po DWG, STL czy ZIP. W praktyce oznacza to, że można przeskanować cały dysk, wyeksportować listę hashy i w kilka minut zidentyfikować grupy plików o identycznej zawartości, nawet jeśli mają różne nazwy i znajdują się w różnych folderach. To oszczędność czasu i gwarancja, że nic nie umknie uwadze.
Realny przykład wygląda tak. Dziennikarz otrzymuje dwa zestawy zdjęć z tego samego wydarzenia od dwóch różnych świadków. Pliki mają różne nazwy i różne daty modyfikacji. Po wyliczeniu SHA-256 dla każdego zdjęcia okazuje się, że pięć plików ma identyczne sumy kontrolne. Można więc stwierdzić technicznie, że są to te same pliki binarne, niezależnie od tego, jak zostały opisane. Jeśli natomiast jeden plik ma inny hash, ale bardzo podobną treść wizualną, to oznacza, że został poddany ponownemu zapisowi, kompresji lub edycji. W takim kontekście pomocne jest też sprawdzenie metadanych EXIF, XMP, IPTC czy danych C2PA, które FilesAudit odczytuje automatycznie i dołącza do raportu. Szczegółowy przewodnik jak sprawdzić sumę kontrolną SHA-256 pobranego pliku pomoże uziemić cały proces w prostych krokach.
Najlepszą praktyką jest łączenie szybkiego przesiewu i dokumentacji. Na początek użyj szybkiego skanowania hashami, aby znaleźć kandydatów na duplikaty. Następnie dla kluczowych par plików wygeneruj pełny raport forensyczny z hashami, metadanymi i datą analizy. Przechowuj listy hashy w bezpiecznym miejscu i traktuj je jak rejestr inwentaryzacyjny. Unikaj polegania wyłącznie na nazwach i rozmiarach, zawsze weryfikuj zawartość.