Skip to content
KitploitKITPLOIT
OutilsBlog
Soumettre
OutilsBlog
Soumettre

Outils de Hacking, PenTest et Cybersécurité pour votre Arsenal de Sécurité !

Kitploit est un répertoire d'outils de hacking, de cybersécurité et de pentesting. Découvrez les dernières mises à jour des projets pour trouver des vulnérabilités, analyser des systèmes, automatiser les tests et renforcer votre sécurité.

··Flux·Contact·Confidentialité·© 2026 Kitploit

Répertoire d'outils

Catégories

Voir toutes les catégories
Loading categories
pdfgrab — Outil pour rechercher des PDFs dans Google et extraire les métadonnées PDF. | Kitploit
Outils/GitHubGitHub/c0decave/pdfgrab
OSINT (Renseignement de Sources Ouvertes)ReconnaissanceAnalyse des VulnérabilitésCollecte d'InformationsCriminalistique Numérique
GitHubc0decave/pdfgrab

pdfgrab

Outil pour rechercher des PDFs dans Google et extraire les métadonnées PDF.

Voir le dépôt
31il y a 6 ansPas encore vérifié

Populaires

Voir tout →

Découvrez les outils les plus utilisés par notre communauté.

Explorer tous les outils

Parcourez notre collection d'outils

Voir tous les outils →
Partager

pdfgrab

  • Version 0.4.9

Qu'est-ce que c'est ?

C'est un outil ressuscité, utilisé à l'époque où les dinosaures parcouraient la terre. En gros, il analyse les fichiers PDF pour en extraire les métadonnées. Vous pouvez le pointer vers un fichier ou un répertoire contenant des PDF. Vous pouvez lui fournir l'URL d'un PDF ou utiliser la recherche Google intégrée (merci à la classe de mario vilas) pour chercher des PDF sur le site cible, les télécharger et les analyser.

Quoi de neuf dans 0.4.9 ?

  • export des méthodes de rapport vers libreport.py
  • ajout d'options facultatives pour désactiver différentes méthodes de rapport
  • rapport HTML rendu un peu plus attrayant
  • ajout d'une fonction pour générer le rapport HTML après l'analyse
  • export des requêtes et du stockage des données vers une nouvelle bibliothèque
  • correctifs de code et gestion des erreurs plus claire
  • suppression du paramètre site: requis pour l'option de recherche -s
  • readme mis à jour
  • l'option -s accepte désormais plusieurs domaines
  • journalisation console plus propre

Quelles informations peuvent être collectées ?

Cela dépend du logiciel utilisé pour créer le PDF, et de son éventuel nettoyage. Cependant, les éléments courants sont les suivants :

  • Producteur
  • Créateur
  • Date de création
  • Date de modification
  • Auteur
  • Titre
  • Sujet

et quelques autres :)

À quoi ça sert, de toute façon ?

Eh bien, cela peut servir à toute une série de choses. Cependant, je ne me concentrerai que sur l'aspect sécurité. Selon votre cible, vous obtiendrez des informations sur :

  • le logiciel utilisé dans l'entreprise xyz
    • numéros de version possibles
      • cela vous aidera à identifier les vulnérabilités existantes
    • parfois les PDF sont générés à nouveau, par exemple lors de téléversements
      • vous pouvez alors déterminer quel moteur de rendu est utilisé et y trouver des bugs
  • qui est l'auteur des documents
    • parfois les noms d'utilisateur sont ceux du système d'exploitation lui-même
      • félicitations, vous venez de trouver, en analysant un PDF, un nom d'utilisateur existant dans le domaine
      • combinez cette information avec la première partie, vous savez quel utilisateur utilise quel logiciel
  • mots de passe... dois-je en dire plus ?

Est-ce infaillible ?

Pas du tout. Veuillez noter que les métadonnées, comme toutes les autres données, sont simplement écrites dans le fichier. Elles peuvent donc être modifiées avant le téléversement. Cela dit, le nombre d'entreprises qui modifient réellement ce type de données est peut-être de 20 %. Vous remarquerez également si elles sont vides ou presque.

Comment ça marche ?

Tout type de fichier plus complexe que .txt ou équivalent utilise des métadonnées pour le confort, le support client ou simplement pour montrer qu'il a été utilisé. Il existe beaucoup d'informations en ligne sur les métadonnées de différents types de fichiers : images, documents, vidéos, musique. Cet outil se concentre uniquement sur les PDF. Si ce terme est nouveau pour vous, jetez un œil ici :

  • https://en.wikipedia.org/wiki/Metadata

Par ailleurs, si vous êtes intéressé par une véritable analyse de PDF, cet outil ne fera que les bases pour vous. Il n'a pas été écrit pour analyser des fichiers malveillants, des logiciels malveillants ni même des fichiers intéressants. Son but est de vous donner une idée de ce qui est utilisé sur la cible xyz. Si vous cherchez une analyse plus approfondie, je recommande les outils de Didier Stevens :

  • https://blog.didierstevens.com/programs/pdf-tools/

Téléchargement

root@kitploit:~
git clone https://github.com/c0decave/pdfgrab
cd pdfgrab
python3 pdfgrab.py -h

Utilisation

Voici vos principales options :

  • récupérer un PDF depuis une URL et l'analyser
  • rechercher des PDF sur un site via Google, les récupérer et les analyser
  • analyser un PDF local
  • analyser un répertoire local contenant des PDF

Mode URL unique

root@kitploit:~
# ./pdfgrab.py -u https://www.kernel.org/doc/mirror/ols2004v2.pdf

Résultat :

root@kitploit:~
[+] Grabbing https://www.kernel.org/doc/mirror/ols2004v2.pdf
[+] Written 3893173 bytes for File: pdfgrab/ols2004v2.pdf
[+] Opening pdfgrab/ols2004v2.pdf
--------------------------------------------------------------------------------
File: pdfgrab/ols2004v2.pdf
/Producer pdfTeX-0.14h
/Creator TeX
/CreationDate D:20040714015300
--------------------------------------------------------------------------------

Mode fichier unique

root@kitploit:~
# ./pdfgrab.py -f pdfgrab/ols2004v2.pdf 

Résultat :

root@kitploit:~
[+] Parsing pdfgrab/ols2004v2.pdf
[+] Opening pdfgrab/ols2004v2.pdf
--------------------------------------------------------------------------------
File: pdfgrab/ols2004v2.pdf
/Producer pdfTeX-0.14h
/Creator TeX
/CreationDate D:20040714015300
--------------------------------------------------------------------------------

Mode répertoire

root@kitploit:~
./pdfgrab.py -F pdfgrab/

Analysera tous les PDF de ce répertoire

Mode recherche Google

root@kitploit:~
# ./pdfgrab.py -s kernel.org

Résultat :

root@kitploit:~
[+] Seek and analysing site:kernel.org
http://vger.kernel.org/lpc_bpf2018_talks/bpf_global_data_and_static_keys.pdf
http://vger.kernel.org/netconf2018_files/JiriPirko_netconf2018.pdf
http://vger.kernel.org/netconf2018_files/PaoloAbeni_netconf2018.pdf
http://vger.kernel.org/lpc_net2018_talks/LPC_XDP_Shirokov_paper_v1.pdf
http://vger.kernel.org/netconf2018_files/FlorianFainelli_netconf2018.pdf
http://vger.kernel.org/lpc_net2018_talks/tc_sw_paper.pdf
https://www.kernel.org/doc/mirror/ols2009.pdf
https://www.kernel.org/doc/mirror/ols2004v2.pdf
http://vger.kernel.org/lpc_net2018_talks/ktls_bpf.pdf
http://vger.kernel.org/lpc_net2018_talks/ktls_bpf_paper.pdf

[+] Written 211391 bytes for File: pdfgrab/bpf_global_data_and_static_keys.pdf
[+] Opening pdfgrab/bpf_global_data_and_static_keys.pdf
--------------------------------------------------------------------------------
File: pdfgrab/bpf_global_data_and_static_keys.pdf
/Author 
/Title 
/Subject 
/Creator LaTeX with Beamer class version 3.36
/Producer pdfTeX-1.40.17
/Keywords 
/CreationDate D:20181102231821+01'00'
/ModDate D:20181102231821+01'00'
/Trapped /False
/PTEX.Fullbanner This is pdfTeX, Version 3.14159265-2.6-1.40.17 (TeX Live 2016) kpathsea version 6.2.2

Mode recherche Google, plusieurs domaines

root@kitploit:~
# ./pdfgrab.py -s example.com,example.us

Rapports

pdfgrab affiche les informations dans différents formats. Si elles ne sont pas désactivées par l'une des options de rapport (voir -h), vous trouverez dans le répertoire de sortie :

  • rapport HTML
  • rapport texte
  • liste d'URLs texte
  • données JSON
  • liste d'URLs JSON

Journalisation

pdfgrab crée un fichier journal dans le répertoire d'exécution appelé « pdfgrab.log »

Google

  • Recherche : filetype:pdf site:com
  • Résultats : 264.000.000

Avertissement

Amusez-vous bien !

Télécharger l’outil