
Google에서 PDF를 검색하고 PDF 메타데이터를 추출하는 도구
이것은 공룡이 지구를 활보하던 시대에 사용되던 도구가 다시 태어난 것입니다. 기본적으로 PDF 파일의 메타데이터를 분석합니다. PDF가 있는 파일이나 디렉토리를 지정할 수 있습니다. PDF의 URL을 지정하거나 내장된 구글 검색(mario vilas 클래스 덕분에)을 사용하여 대상 사이트에서 PDF를 검색하고 다운로드하여 분석할 수 있습니다.
이는 PDF를 만드는 데 사용된 소프트웨어와 정리 여부에 따라 다릅니다. 그러나 일반적으로 다음과 같은 항목이 있습니다:
그리고 더 많은 것들이 있습니다 :)
음, 이것은 다양한 용도로 사용될 수 있습니다. 하지만 저는 보안 측면에만 초점을 맞추겠습니다. 대상에 따라 다음과 같은 정보를 얻을 수 있습니다:
전혀 그렇지 않습니다. 메타데이터는 다른 모든 데이터와 마찬가지로 해당 파일에 그저 기록될 뿐이라는 점에 유의하세요. 따라서 업로드되기 전에 변경될 수 있습니다. 그렇기는 해도 실제로 그런 종류의 데이터를 변경하는 회사의 비율은 아마 20% 정도입니다. 또한 데이터가 비어 있거나 비슷한 상태인지도 알아볼 수 있습니다.
.txt 이상의 더 복잡한 모든 파일 형식은 편의, 고객 지원 또는 단지 사용되었다는 것을 알리기 위해 메타데이터를 사용합니다. 사진, 문서, 비디오, 음악 등 다양한 종류의 파일에 있는 메타데이터에 대한 정보는 온라인에 많이 있습니다. 이 도구는 PDF에만 초점을 맞춥니다. 이 용어가 처음이라면 여기를 확인하세요:
또한 실제 PDF 분석에 관심이 있다면, 이 도구는 기본적인 작업만 수행해 줍니다. 이 도구는 악성 파일, 멀웨어 또는 흥미로운 파일을 분석하기 위해 작성된 것이 아닙니다. 그 목적은 대상 xyz에서 무엇이 사용되는지에 대한 아이디어를 제공하는 것입니다. 더 심층적인 분석을 원한다면 Didier Stevens의 도구를 추천합니다:
git clone https://github.com/c0decave/pdfgrab
cd pdfgrab
python3 pdfgrab.py -h
주요 옵션은 다음과 같습니다:
# ./pdfgrab.py -u https://www.kernel.org/doc/mirror/ols2004v2.pdf
결과:
[+] Grabbing https://www.kernel.org/doc/mirror/ols2004v2.pdf
[+] Written 3893173 bytes for File: pdfgrab/ols2004v2.pdf
[+] Opening pdfgrab/ols2004v2.pdf
--------------------------------------------------------------------------------
File: pdfgrab/ols2004v2.pdf
/Producer pdfTeX-0.14h
/Creator TeX
/CreationDate D:20040714015300
--------------------------------------------------------------------------------
# ./pdfgrab.py -f pdfgrab/ols2004v2.pdf
결과:
[+] Parsing pdfgrab/ols2004v2.pdf
[+] Opening pdfgrab/ols2004v2.pdf
--------------------------------------------------------------------------------
File: pdfgrab/ols2004v2.pdf
/Producer pdfTeX-0.14h
/Creator TeX
/CreationDate D:20040714015300
--------------------------------------------------------------------------------
./pdfgrab.py -F pdfgrab/
해당 디렉토리의 모든 PDF를 분석합니다
# ./pdfgrab.py -s kernel.org
결과:
[+] Seek and analysing site:kernel.org
http://vger.kernel.org/lpc_bpf2018_talks/bpf_global_data_and_static_keys.pdf
http://vger.kernel.org/netconf2018_files/JiriPirko_netconf2018.pdf
http://vger.kernel.org/netconf2018_files/PaoloAbeni_netconf2018.pdf
http://vger.kernel.org/lpc_net2018_talks/LPC_XDP_Shirokov_paper_v1.pdf
http://vger.kernel.org/netconf2018_files/FlorianFainelli_netconf2018.pdf
http://vger.kernel.org/lpc_net2018_talks/tc_sw_paper.pdf
https://www.kernel.org/doc/mirror/ols2009.pdf
https://www.kernel.org/doc/mirror/ols2004v2.pdf
http://vger.kernel.org/lpc_net2018_talks/ktls_bpf.pdf
http://vger.kernel.org/lpc_net2018_talks/ktls_bpf_paper.pdf
[+] Written 211391 bytes for File: pdfgrab/bpf_global_data_and_static_keys.pdf
[+] Opening pdfgrab/bpf_global_data_and_static_keys.pdf
--------------------------------------------------------------------------------
File: pdfgrab/bpf_global_data_and_static_keys.pdf
/Author
/Title
/Subject
/Creator LaTeX with Beamer class version 3.36
/Producer pdfTeX-1.40.17
/Keywords
/CreationDate D:20181102231821+01'00'
/ModDate D:20181102231821+01'00'
/Trapped /False
/PTEX.Fullbanner This is pdfTeX, Version 3.14159265-2.6-1.40.17 (TeX Live 2016) kpathsea version 6.2.2
# ./pdfgrab.py -s example.com,example.us
pdfgrab은 정보를 다양한 형식으로 출력합니다. 리포트 플래그 중 하나로 비활성화하지 않았다면(자세한 내용은 -h 참조) 출력 디렉토리에서 다음을 찾을 수 있습니다:
pdfgrab은 실행 디렉토리에 "pdfgrab.log"라는 로그 파일을 생성합니다.
즐기세요!