
Outil pour rechercher des PDFs dans Google et extraire les métadonnées PDF.
C'est un outil ressuscité, utilisé à l'époque où les dinosaures parcouraient la terre. En gros, il analyse les fichiers PDF pour en extraire les métadonnées. Vous pouvez le pointer vers un fichier ou un répertoire contenant des PDF. Vous pouvez lui fournir l'URL d'un PDF ou utiliser la recherche Google intégrée (merci à la classe de mario vilas) pour chercher des PDF sur le site cible, les télécharger et les analyser.
Cela dépend du logiciel utilisé pour créer le PDF, et de son éventuel nettoyage. Cependant, les éléments courants sont les suivants :
et quelques autres :)
Eh bien, cela peut servir à toute une série de choses. Cependant, je ne me concentrerai que sur l'aspect sécurité. Selon votre cible, vous obtiendrez des informations sur :
Pas du tout. Veuillez noter que les métadonnées, comme toutes les autres données, sont simplement écrites dans le fichier. Elles peuvent donc être modifiées avant le téléversement. Cela dit, le nombre d'entreprises qui modifient réellement ce type de données est peut-être de 20 %. Vous remarquerez également si elles sont vides ou presque.
Tout type de fichier plus complexe que .txt ou équivalent utilise des métadonnées pour le confort, le support client ou simplement pour montrer qu'il a été utilisé. Il existe beaucoup d'informations en ligne sur les métadonnées de différents types de fichiers : images, documents, vidéos, musique. Cet outil se concentre uniquement sur les PDF. Si ce terme est nouveau pour vous, jetez un œil ici :
Par ailleurs, si vous êtes intéressé par une véritable analyse de PDF, cet outil ne fera que les bases pour vous. Il n'a pas été écrit pour analyser des fichiers malveillants, des logiciels malveillants ni même des fichiers intéressants. Son but est de vous donner une idée de ce qui est utilisé sur la cible xyz. Si vous cherchez une analyse plus approfondie, je recommande les outils de Didier Stevens :
git clone https://github.com/c0decave/pdfgrab
cd pdfgrab
python3 pdfgrab.py -h
Voici vos principales options :
# ./pdfgrab.py -u https://www.kernel.org/doc/mirror/ols2004v2.pdf
Résultat :
[+] Grabbing https://www.kernel.org/doc/mirror/ols2004v2.pdf
[+] Written 3893173 bytes for File: pdfgrab/ols2004v2.pdf
[+] Opening pdfgrab/ols2004v2.pdf
--------------------------------------------------------------------------------
File: pdfgrab/ols2004v2.pdf
/Producer pdfTeX-0.14h
/Creator TeX
/CreationDate D:20040714015300
--------------------------------------------------------------------------------
# ./pdfgrab.py -f pdfgrab/ols2004v2.pdf
Résultat :
[+] Parsing pdfgrab/ols2004v2.pdf
[+] Opening pdfgrab/ols2004v2.pdf
--------------------------------------------------------------------------------
File: pdfgrab/ols2004v2.pdf
/Producer pdfTeX-0.14h
/Creator TeX
/CreationDate D:20040714015300
--------------------------------------------------------------------------------
./pdfgrab.py -F pdfgrab/
Analysera tous les PDF de ce répertoire
# ./pdfgrab.py -s kernel.org
Résultat :
[+] Seek and analysing site:kernel.org
http://vger.kernel.org/lpc_bpf2018_talks/bpf_global_data_and_static_keys.pdf
http://vger.kernel.org/netconf2018_files/JiriPirko_netconf2018.pdf
http://vger.kernel.org/netconf2018_files/PaoloAbeni_netconf2018.pdf
http://vger.kernel.org/lpc_net2018_talks/LPC_XDP_Shirokov_paper_v1.pdf
http://vger.kernel.org/netconf2018_files/FlorianFainelli_netconf2018.pdf
http://vger.kernel.org/lpc_net2018_talks/tc_sw_paper.pdf
https://www.kernel.org/doc/mirror/ols2009.pdf
https://www.kernel.org/doc/mirror/ols2004v2.pdf
http://vger.kernel.org/lpc_net2018_talks/ktls_bpf.pdf
http://vger.kernel.org/lpc_net2018_talks/ktls_bpf_paper.pdf
[+] Written 211391 bytes for File: pdfgrab/bpf_global_data_and_static_keys.pdf
[+] Opening pdfgrab/bpf_global_data_and_static_keys.pdf
--------------------------------------------------------------------------------
File: pdfgrab/bpf_global_data_and_static_keys.pdf
/Author
/Title
/Subject
/Creator LaTeX with Beamer class version 3.36
/Producer pdfTeX-1.40.17
/Keywords
/CreationDate D:20181102231821+01'00'
/ModDate D:20181102231821+01'00'
/Trapped /False
/PTEX.Fullbanner This is pdfTeX, Version 3.14159265-2.6-1.40.17 (TeX Live 2016) kpathsea version 6.2.2
# ./pdfgrab.py -s example.com,example.us
pdfgrab affiche les informations dans différents formats. Si elles ne sont pas désactivées par l'une des options de rapport (voir -h), vous trouverez dans le répertoire de sortie :
pdfgrab crée un fichier journal dans le répertoire d'exécution appelé « pdfgrab.log »
Amusez-vous bien !