Skip to content
KitploitKITPLOIT
ИнструментыБлог
Отправить
ИнструментыБлог
Отправить

Инструменты для хакинга, пентеста и кибербезопасности — ваш арсенал защиты!

Kitploit — это каталог инструментов для хакинга, кибербезопасности и пентестинга. Находите последние обновления проектов для поиска уязвимостей, анализа систем, автоматизации тестирования и усиления вашей безопасности.

··Ленты·Контакты·Конфиденциальность·© 2026 Kitploit

Каталог инструментов

Категории

Все категории
Loading categories
pdfgrab — Инструмент для поиска PDF-файлов в Google и извлечения метаданных PDF. | Kitploit
Инструменты/GitHubGitHub/c0decave/pdfgrab
OSINT (Разведка открытых источников)РазведкаАнализ уязвимостейСбор информацииЦифровая криминалистика
GitHubc0decave/pdfgrab

pdfgrab

Инструмент для поиска PDF-файлов в Google и извлечения метаданных PDF.

Репозиторий
316 лет назадЕщё не проверено

Популярное

Смотреть все →

Откройте для себя самые используемые инструменты нашего сообщества.

Изучить все инструменты

Просмотрите нашу коллекцию инструментов

Смотреть все инструменты →
Поделиться

pdfgrab

  • Версия 0.4.9

Что это?

Это возрождённый инструмент, использовавшийся в эпоху, когда по земле бродили динозавры. По сути, он анализирует PDF-файлы на предмет метаданных. Вы можете указать ему файл или каталог с PDF-файлами. Можно указать URL PDF-файла или использовать встроенный поиск Google (спасибо классу Марио Виласа), чтобы найти PDF-файлы на целевом сайте, скачать и проанализировать их.

Что нового в 0.4.9?

  • методы формирования отчётов вынесены в libreport.py
  • добавлены опциональные аргументы для отключения различных методов отчётов
  • HTML-отчёт стал немного более презентабельным
  • добавлена функция генерации HTML-отчёта после анализа
  • запросы и сохранение данных вынесены в новую библиотеку
  • исправления кода и более понятная обработка ошибок
  • убран обязательный параметр site: у флага поиска -s
  • обновлён readme
  • флаг -s теперь принимает несколько доменов
  • более чистый вывод логов в консоль

Какую информацию можно получить?

Это зависит от программного обеспечения, использованного для создания PDF, а также от того, очищались ли метаданные. Однако чаще всего встречается следующее:

  • Производитель
  • Создатель
  • Дата создания
  • Дата изменения
  • Автор
  • Заголовок
  • Тема

и ещё кое-что :)

Для чего это вообще нужно?

Что ж, это можно использовать для разных целей. Однако я сосредоточусь только на части, касающейся безопасности. В зависимости от вашей цели вы получите информацию о:

  • используемом ПО в компании xyz
    • возможных номерах версий
      • это поможет вам выявить существующие уязвимости
    • иногда PDF-файлы рендерятся заново, например, при загрузке
      • теперь вы можете определить, какой движок рендеринга используется, и найти в нём ошибки
  • том, кто является автором документов
    • иногда имена пользователей совпадают с учётными записями ОС
      • поздравляю, вы только что нашли существующее имя пользователя в домене, проанализировав PDF-файл
      • объедините эту информацию с первой частью — вы узнаете, какой пользователь каким ПО пользуется
  • пароли ... нужно ли говорить больше?

Гарантирует ли он результат?

Вовсе нет. Имейте в виду, что метаданные, как и любые другие данные, просто записываются в файл. Поэтому их можно изменить перед загрузкой. При этом доля компаний, которые действительно меняют такие данные, составляет, пожалуй, около 20%. Кроме того, вы сможете заметить, если они пустые или что-то в этом роде.

Как это работает?

Каждый более сложный тип файлов, чем .txt и подобные, использует метаданные для удобства, поддержки пользователей или просто чтобы довести до сведения, что он был использован. В интернете много информации о метаданных в файлах разных типов: изображениях, документах, видео, музыке. Этот инструмент сосредоточен только на PDF. Если вам незнаком этот термин, загляните сюда:

  • https://en.wikipedia.org/wiki/Metadata

Кроме того, если вас интересует настоящий анализ PDF, этот инструмент сделает за вас только основы. Он не создавался для анализа вредоносных или даже интересных файлов. Его цель — дать вам представление о том, что используется у целевой организации xyz. Если вы ищете более глубокий анализ, рекомендую инструменты Дидье Стивенса:

  • https://blog.didierstevens.com/programs/pdf-tools/

Скачивание

root@kitploit:~
git clone https://github.com/c0decave/pdfgrab
cd pdfgrab
python3 pdfgrab.py -h

Использование

Вот основные возможности:

  • забрать PDF по URL и проанализировать
  • найти PDF-файлы на сайте через Google, скачать и проанализировать
  • проанализировать локальный PDF
  • проанализировать локальный каталог с PDF-файлами

Режим одиночного URL

root@kitploit:~
# ./pdfgrab.py -u https://www.kernel.org/doc/mirror/ols2004v2.pdf

Результат:

root@kitploit:~
[+] Grabbing https://www.kernel.org/doc/mirror/ols2004v2.pdf
[+] Written 3893173 bytes for File: pdfgrab/ols2004v2.pdf
[+] Opening pdfgrab/ols2004v2.pdf
--------------------------------------------------------------------------------
File: pdfgrab/ols2004v2.pdf
/Producer pdfTeX-0.14h
/Creator TeX
/CreationDate D:20040714015300
--------------------------------------------------------------------------------

Режим одиночного файла

root@kitploit:~
# ./pdfgrab.py -f pdfgrab/ols2004v2.pdf 

Результат:

root@kitploit:~
[+] Parsing pdfgrab/ols2004v2.pdf
[+] Opening pdfgrab/ols2004v2.pdf
--------------------------------------------------------------------------------
File: pdfgrab/ols2004v2.pdf
/Producer pdfTeX-0.14h
/Creator TeX
/CreationDate D:20040714015300
--------------------------------------------------------------------------------

Режим каталога

root@kitploit:~
./pdfgrab.py -F pdfgrab/

Проанализирует все PDF-файлы в этом каталоге

Режим поиска Google

root@kitploit:~
# ./pdfgrab.py -s kernel.org

Результат:

root@kitploit:~
[+] Seek and analysing site:kernel.org
http://vger.kernel.org/lpc_bpf2018_talks/bpf_global_data_and_static_keys.pdf
http://vger.kernel.org/netconf2018_files/JiriPirko_netconf2018.pdf
http://vger.kernel.org/netconf2018_files/PaoloAbeni_netconf2018.pdf
http://vger.kernel.org/lpc_net2018_talks/LPC_XDP_Shirokov_paper_v1.pdf
http://vger.kernel.org/netconf2018_files/FlorianFainelli_netconf2018.pdf
http://vger.kernel.org/lpc_net2018_talks/tc_sw_paper.pdf
https://www.kernel.org/doc/mirror/ols2009.pdf
https://www.kernel.org/doc/mirror/ols2004v2.pdf
http://vger.kernel.org/lpc_net2018_talks/ktls_bpf.pdf
http://vger.kernel.org/lpc_net2018_talks/ktls_bpf_paper.pdf

[+] Written 211391 bytes for File: pdfgrab/bpf_global_data_and_static_keys.pdf
[+] Opening pdfgrab/bpf_global_data_and_static_keys.pdf
--------------------------------------------------------------------------------
File: pdfgrab/bpf_global_data_and_static_keys.pdf
/Author 
/Title 
/Subject 
/Creator LaTeX with Beamer class version 3.36
/Producer pdfTeX-1.40.17
/Keywords 
/CreationDate D:20181102231821+01'00'
/ModDate D:20181102231821+01'00'
/Trapped /False
/PTEX.Fullbanner This is pdfTeX, Version 3.14159265-2.6-1.40.17 (TeX Live 2016) kpathsea version 6.2.2

Режим поиска Google, несколько доменов

root@kitploit:~
# ./pdfgrab.py -s example.com,example.us

Отчёты

pdfgrab выводит информацию в разных форматах. Если это не отключено одним из флагов отчётов (см. -h), в выходном каталоге вы найдёте:

  • HTML-отчёт
  • текстовый отчёт
  • список URL в текстовом виде
  • данные JSON
  • список URL в JSON

Журналирование

pdfgrab создаёт файл журнала «pdfgrab.log» в рабочем каталоге

Google

  • Поиск: filetype:pdf site:com
  • Результатов: 264.000.000

Отказ от ответственности

Удачи!

Скачать инструмент