Skip to content
KitploitKITPLOIT
HerramientasBlog
Enviar
HerramientasBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

··Feeds·Contacto·Privacidad·© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
pdfgrab — Herramienta para buscar PDFs en Google y extraer metadatos de PDF | Kitploit
Herramientas/GitHubGitHub/c0decave/pdfgrab
OSINT (Inteligencia de Fuentes Abiertas)ReconocimientoAnálisis de VulnerabilidadesRecopilación de InformaciónForensia Digital
GitHubc0decave/pdfgrab

pdfgrab

Herramienta para buscar PDFs en Google y extraer metadatos de PDF

Ver Repositorio
31hace 6 añosAún no revisado

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →
Compartir

pdfgrab

  • Versión 0.4.9

¿Qué es?

Esta es una herramienta renacida, utilizada en la época en que los dinosaurios deambulaban por la tierra. Básicamente analiza archivos PDF en busca de metadatos. Puedes dirigirla a un archivo o directorio con pdfs. Puedes darle la url de un pdf o usar la búsqueda de Google integrada (gracias a la clase de mario vilas) para buscar pdfs en el sitio objetivo, descargarlos y analizarlos.

¿Qué hay de nuevo en 0.4.9?

  • métodos de informe exportados a libreport.py
  • añadidos optargs para deshabilitar diferentes métodos de informe
  • el informe html ahora es un poco más vistoso
  • añadida función para generar el informe html después del análisis
  • exportadas las peticiones y el almacenamiento de datos a una nueva librería
  • correcciones de código y manejo de errores más claro
  • eliminado el requisito del parámetro site: en la bandera de búsqueda -s
  • readme actualizado
  • la bandera -s ahora acepta varios dominios
  • registro en consola más limpio

¿Qué información se puede obtener?

Esto depende del software utilizado para crear el pdf. Y de si ha sido limpiado. Sin embargo, lo común es lo siguiente:

  • Productor
  • Creador
  • Fecha de creación
  • Fecha de modificación
  • Autor
  • Título
  • Asunto

y algo más :)

¿Para qué sirve esto de todos modos?

Bueno, esto puede usarse para diversas cosas. Sin embargo, solo me centraré en la parte de seguridad. Dependiendo de tu objetivo, obtendrás información sobre:

  • software utilizado en la empresa xyz
    • posibles números de versión
      • esto te ayudará a identificar vulnerabilidades existentes
    • a veces los pdfs se renderizan de nuevo, por ejemplo al subirlos
      • ahora puedes averiguar cuál es el motor de renderizado y encontrar fallos en él
  • quién es el autor de los documentos
    • a veces los nombres de usuario son usuarios del propio SO
      • felicidades, acabas de encontrar, analizando un pdf, un nombre de usuario existente en el dominio
      • combina la información con la primera parte, sabes qué usuario usa qué software
  • contraseñas... ¿acaso necesito decir más?

¿Es infalible?

En absoluto. Ten en cuenta que los metadatos, como cualquier otro dato, simplemente se escriben en ese archivo. Por lo tanto, pueden modificarse antes de que se suba. Dicho esto, la cantidad de empresas que realmente cambian ese tipo de datos quizá sea del 20%. Además, podrás detectar si está vacío o algo similar.

¿Cómo funciona?

Todo tipo de archivo más complejo que .txt o similar utiliza metadatos por conveniencia, soporte al cliente o simplemente para difundir que ha sido utilizado. Hay mucha información sobre metadatos en diferentes tipos de archivos como imágenes, documentos, vídeos, música en línea. Esta herramienta se centra solo en pdf. Si eres nuevo en ese término, echa un vistazo aquí:

  • https://en.wikipedia.org/wiki/Metadata

Además, si te interesa un análisis de pdf real, esta herramienta solo hará lo básico por ti. No ha sido escrita para analizar archivos malos, malware o incluso interesantes. Su propósito es darte una idea de qué se utiliza en el objetivo xyz. Si buscas un análisis más profundo, te recomiendo las herramientas de Didier Stevens:

  • https://blog.didierstevens.com/programs/pdf-tools/

Descarga

root@kitploit:~
git clone https://github.com/c0decave/pdfgrab
cd pdfgrab
python3 pdfgrab.py -h

Uso

Esas son tus principales opciones:

  • obtener un pdf desde una url y analizarlo
  • buscar pdfs en un sitio mediante Google, obtenerlos y analizarlos
  • analizar un pdf local
  • analizar un directorio local con pdfs dentro

Modo URL Única

root@kitploit:~
# ./pdfgrab.py -u https://www.kernel.org/doc/mirror/ols2004v2.pdf

Resultado:

root@kitploit:~
[+] Grabbing https://www.kernel.org/doc/mirror/ols2004v2.pdf
[+] Written 3893173 bytes for File: pdfgrab/ols2004v2.pdf
[+] Opening pdfgrab/ols2004v2.pdf
--------------------------------------------------------------------------------
File: pdfgrab/ols2004v2.pdf
/Producer pdfTeX-0.14h
/Creator TeX
/CreationDate D:20040714015300
--------------------------------------------------------------------------------

Modo Archivo Único

root@kitploit:~
# ./pdfgrab.py -f pdfgrab/ols2004v2.pdf 

Resultado:

root@kitploit:~
[+] Parsing pdfgrab/ols2004v2.pdf
[+] Opening pdfgrab/ols2004v2.pdf
--------------------------------------------------------------------------------
File: pdfgrab/ols2004v2.pdf
/Producer pdfTeX-0.14h
/Creator TeX
/CreationDate D:20040714015300
--------------------------------------------------------------------------------

Modo Directorio

root@kitploit:~
./pdfgrab.py -F pdfgrab/

Analizará todos los pdfs de ese directorio

Modo Búsqueda en Google

root@kitploit:~
# ./pdfgrab.py -s kernel.org

Resultado:

root@kitploit:~
[+] Seek and analysing site:kernel.org
http://vger.kernel.org/lpc_bpf2018_talks/bpf_global_data_and_static_keys.pdf
http://vger.kernel.org/netconf2018_files/JiriPirko_netconf2018.pdf
http://vger.kernel.org/netconf2018_files/PaoloAbeni_netconf2018.pdf
http://vger.kernel.org/lpc_net2018_talks/LPC_XDP_Shirokov_paper_v1.pdf
http://vger.kernel.org/netconf2018_files/FlorianFainelli_netconf2018.pdf
http://vger.kernel.org/lpc_net2018_talks/tc_sw_paper.pdf
https://www.kernel.org/doc/mirror/ols2009.pdf
https://www.kernel.org/doc/mirror/ols2004v2.pdf
http://vger.kernel.org/lpc_net2018_talks/ktls_bpf.pdf
http://vger.kernel.org/lpc_net2018_talks/ktls_bpf_paper.pdf

[+] Written 211391 bytes for File: pdfgrab/bpf_global_data_and_static_keys.pdf
[+] Opening pdfgrab/bpf_global_data_and_static_keys.pdf
--------------------------------------------------------------------------------
File: pdfgrab/bpf_global_data_and_static_keys.pdf
/Author 
/Title 
/Subject 
/Creator LaTeX with Beamer class version 3.36
/Producer pdfTeX-1.40.17
/Keywords 
/CreationDate D:20181102231821+01'00'
/ModDate D:20181102231821+01'00'
/Trapped /False
/PTEX.Fullbanner This is pdfTeX, Version 3.14159265-2.6-1.40.17 (TeX Live 2016) kpathsea version 6.2.2

Modo Búsqueda en Google, varios dominios

root@kitploit:~
# ./pdfgrab.py -s example.com,example.us

Informes

pdfgrab muestra la información en diferentes formatos. Si no está deshabilitado por una de las banderas de informe (consulta -h), encontrarás en el directorio de salida:

  • informe html
  • informe de texto
  • lista de urls en texto
  • datos json
  • lista de urls json

Registro

pdfgrab crea un archivo de registro en el directorio de ejecución llamado "pdfgrab.log"

Google

  • Búsqueda: filetype:pdf site:com
  • Resultados: 264.000.000

Aviso legal

¡Diviértete!

Descargar herramienta