
Tool zum Durchsuchen von PDFs in Google und Extrahieren von PDF-Metadaten
Dies ist ein wiederbelebtes Tool aus der Epoche, in der Dinosaurier über die Erde stapften. Grundsätzlich analysiert es PDF-Dateien auf Metadaten. Du kannst es auf eine Datei oder ein Verzeichnis mit PDFs richten. Du kannst ihm die URL einer PDF zeigen oder die integrierte Google-Suche nutzen (Dank an die Klasse von Mario Vilas), um auf der Zielseite nach PDFs zu suchen, sie herunterzuladen und zu analysieren.
Das hängt von der Software ab, die zum Erstellen der PDF verwendet wurde. Und davon, ob sie bereinigt wurde. Üblich sind jedoch die folgenden Dinge:
und einiges mehr :)
Nun, das kann für eine Reihe von Dingen verwendet werden. Ich werde mich jedoch nur auf den Sicherheitsaspekt konzentrieren. Abhängig von deinem Ziel erhältst du Informationen über:
Überhaupt nicht. Bitte beachte, dass Metadaten wie alle anderen Daten einfach in die Datei geschrieben werden. Sie können also geändert werden, bevor sie hochgeladen wird. Abgesehen davon liegt der Anteil der Unternehmen, die solche Daten tatsächlich ändern, vielleicht bei 20 %. Außerdem erkennst du, wenn sie leer sind oder Ähnliches.
Jeder komplexere Dateityp jenseits von .txt oder Ähnlichem nutzt Metadaten aus Bequemlichkeit, für den Kundensupport oder nur, um zu verbreiten, dass er verwendet wurde. Im Internet gibt es viele Informationen über Metadaten in verschiedenen Dateitypen wie Bildern, Dokumenten, Videos und Musik. Dieses Tool konzentriert sich ausschließlich auf PDFs. Wenn dir dieser Begriff neu ist, wirf einen Blick hierauf:
Wenn du an einer echten PDF-Analyse interessiert bist, erledigt dieses Tool nur die Grundlagen für dich. Es wurde nicht geschrieben, um bösartige Dateien, Malware oder auch nur interessante Dateien zu analysieren. Sein Zweck ist es, dir eine Vorstellung davon zu geben, was beim Ziel xyz verwendet wird. Wenn du nach einer tiefergehenden Analyse suchst, empfehle ich die Tools von Didier Stevens:
git clone https://github.com/c0decave/pdfgrab
cd pdfgrab
python3 pdfgrab.py -h
Das sind deine wichtigsten Optionen:
# ./pdfgrab.py -u https://www.kernel.org/doc/mirror/ols2004v2.pdf
Ergebnis:
[+] Grabbing https://www.kernel.org/doc/mirror/ols2004v2.pdf
[+] Written 3893173 bytes for File: pdfgrab/ols2004v2.pdf
[+] Opening pdfgrab/ols2004v2.pdf
--------------------------------------------------------------------------------
File: pdfgrab/ols2004v2.pdf
/Producer pdfTeX-0.14h
/Creator TeX
/CreationDate D:20040714015300
--------------------------------------------------------------------------------
# ./pdfgrab.py -f pdfgrab/ols2004v2.pdf
Ergebnis:
[+] Parsing pdfgrab/ols2004v2.pdf
[+] Opening pdfgrab/ols2004v2.pdf
--------------------------------------------------------------------------------
File: pdfgrab/ols2004v2.pdf
/Producer pdfTeX-0.14h
/Creator TeX
/CreationDate D:20040714015300
--------------------------------------------------------------------------------
./pdfgrab.py -F pdfgrab/
Analysiert alle PDFs in diesem Verzeichnis
# ./pdfgrab.py -s kernel.org
Ergebnis:
[+] Seek and analysing site:kernel.org
http://vger.kernel.org/lpc_bpf2018_talks/bpf_global_data_and_static_keys.pdf
http://vger.kernel.org/netconf2018_files/JiriPirko_netconf2018.pdf
http://vger.kernel.org/netconf2018_files/PaoloAbeni_netconf2018.pdf
http://vger.kernel.org/lpc_net2018_talks/LPC_XDP_Shirokov_paper_v1.pdf
http://vger.kernel.org/netconf2018_files/FlorianFainelli_netconf2018.pdf
http://vger.kernel.org/lpc_net2018_talks/tc_sw_paper.pdf
https://www.kernel.org/doc/mirror/ols2009.pdf
https://www.kernel.org/doc/mirror/ols2004v2.pdf
http://vger.kernel.org/lpc_net2018_talks/ktls_bpf.pdf
http://vger.kernel.org/lpc_net2018_talks/ktls_bpf_paper.pdf
[+] Written 211391 bytes for File: pdfgrab/bpf_global_data_and_static_keys.pdf
[+] Opening pdfgrab/bpf_global_data_and_static_keys.pdf
--------------------------------------------------------------------------------
File: pdfgrab/bpf_global_data_and_static_keys.pdf
/Author
/Title
/Subject
/Creator LaTeX with Beamer class version 3.36
/Producer pdfTeX-1.40.17
/Keywords
/CreationDate D:20181102231821+01'00'
/ModDate D:20181102231821+01'00'
/Trapped /False
/PTEX.Fullbanner This is pdfTeX, Version 3.14159265-2.6-1.40.17 (TeX Live 2016) kpathsea version 6.2.2
# ./pdfgrab.py -s example.com,example.us
pdfgrab gibt die Informationen in verschiedenen Formaten aus. Wenn nicht durch eines der Reporting-Flags deaktiviert (siehe -h), findest du im Ausgabeverzeichnis:
pdfgrab erstellt im Arbeitsverzeichnis eine Logdatei namens „pdfgrab.log“.
Viel Spaß!