
Инструмент для поиска PDF-файлов в Google и извлечения метаданных PDF.
Это возрождённый инструмент, использовавшийся в эпоху, когда по земле бродили динозавры. По сути, он анализирует PDF-файлы на предмет метаданных. Вы можете указать ему файл или каталог с PDF-файлами. Можно указать URL PDF-файла или использовать встроенный поиск Google (спасибо классу Марио Виласа), чтобы найти PDF-файлы на целевом сайте, скачать и проанализировать их.
Это зависит от программного обеспечения, использованного для создания PDF, а также от того, очищались ли метаданные. Однако чаще всего встречается следующее:
и ещё кое-что :)
Что ж, это можно использовать для разных целей. Однако я сосредоточусь только на части, касающейся безопасности. В зависимости от вашей цели вы получите информацию о:
Вовсе нет. Имейте в виду, что метаданные, как и любые другие данные, просто записываются в файл. Поэтому их можно изменить перед загрузкой. При этом доля компаний, которые действительно меняют такие данные, составляет, пожалуй, около 20%. Кроме того, вы сможете заметить, если они пустые или что-то в этом роде.
Каждый более сложный тип файлов, чем .txt и подобные, использует метаданные для удобства, поддержки пользователей или просто чтобы довести до сведения, что он был использован. В интернете много информации о метаданных в файлах разных типов: изображениях, документах, видео, музыке. Этот инструмент сосредоточен только на PDF. Если вам незнаком этот термин, загляните сюда:
Кроме того, если вас интересует настоящий анализ PDF, этот инструмент сделает за вас только основы. Он не создавался для анализа вредоносных или даже интересных файлов. Его цель — дать вам представление о том, что используется у целевой организации xyz. Если вы ищете более глубокий анализ, рекомендую инструменты Дидье Стивенса:
git clone https://github.com/c0decave/pdfgrab
cd pdfgrab
python3 pdfgrab.py -h
Вот основные возможности:
# ./pdfgrab.py -u https://www.kernel.org/doc/mirror/ols2004v2.pdf
Результат:
[+] Grabbing https://www.kernel.org/doc/mirror/ols2004v2.pdf
[+] Written 3893173 bytes for File: pdfgrab/ols2004v2.pdf
[+] Opening pdfgrab/ols2004v2.pdf
--------------------------------------------------------------------------------
File: pdfgrab/ols2004v2.pdf
/Producer pdfTeX-0.14h
/Creator TeX
/CreationDate D:20040714015300
--------------------------------------------------------------------------------
# ./pdfgrab.py -f pdfgrab/ols2004v2.pdf
Результат:
[+] Parsing pdfgrab/ols2004v2.pdf
[+] Opening pdfgrab/ols2004v2.pdf
--------------------------------------------------------------------------------
File: pdfgrab/ols2004v2.pdf
/Producer pdfTeX-0.14h
/Creator TeX
/CreationDate D:20040714015300
--------------------------------------------------------------------------------
./pdfgrab.py -F pdfgrab/
Проанализирует все PDF-файлы в этом каталоге
# ./pdfgrab.py -s kernel.org
Результат:
[+] Seek and analysing site:kernel.org
http://vger.kernel.org/lpc_bpf2018_talks/bpf_global_data_and_static_keys.pdf
http://vger.kernel.org/netconf2018_files/JiriPirko_netconf2018.pdf
http://vger.kernel.org/netconf2018_files/PaoloAbeni_netconf2018.pdf
http://vger.kernel.org/lpc_net2018_talks/LPC_XDP_Shirokov_paper_v1.pdf
http://vger.kernel.org/netconf2018_files/FlorianFainelli_netconf2018.pdf
http://vger.kernel.org/lpc_net2018_talks/tc_sw_paper.pdf
https://www.kernel.org/doc/mirror/ols2009.pdf
https://www.kernel.org/doc/mirror/ols2004v2.pdf
http://vger.kernel.org/lpc_net2018_talks/ktls_bpf.pdf
http://vger.kernel.org/lpc_net2018_talks/ktls_bpf_paper.pdf
[+] Written 211391 bytes for File: pdfgrab/bpf_global_data_and_static_keys.pdf
[+] Opening pdfgrab/bpf_global_data_and_static_keys.pdf
--------------------------------------------------------------------------------
File: pdfgrab/bpf_global_data_and_static_keys.pdf
/Author
/Title
/Subject
/Creator LaTeX with Beamer class version 3.36
/Producer pdfTeX-1.40.17
/Keywords
/CreationDate D:20181102231821+01'00'
/ModDate D:20181102231821+01'00'
/Trapped /False
/PTEX.Fullbanner This is pdfTeX, Version 3.14159265-2.6-1.40.17 (TeX Live 2016) kpathsea version 6.2.2
# ./pdfgrab.py -s example.com,example.us
pdfgrab выводит информацию в разных форматах. Если это не отключено одним из флагов отчётов (см. -h), в выходном каталоге вы найдёте:
pdfgrab создаёт файл журнала «pdfgrab.log» в рабочем каталоге
Удачи!