
أداة للبحث عن ملفات PDF داخل جوجل واستخراج البيانات الوصفية لملفات PDF
هذه أداة وُلدت من جديد، استُخدمت في حقبة كانت الديناصورات تجوب فيها الأرض. تقوم أساسًا بتحليل ملفات PDF لاستخراج البيانات الوصفية. يمكنك توجيهها إلى ملف أو مجلد يحتوي على ملفات PDF. يمكنك إعطاؤها رابط ملف PDF أو استخدام البحث في جوجل المدمج (بفضل mario vilas class) للبحث عن ملفات PDF في الموقع المستهدف، وتنزيلها وتحليلها.
يعتمد هذا على البرنامج المستخدم لإنشاء ملف PDF، وما إذا كان قد تم تنظيفه. ومع ذلك، فإن الأمور الشائعة هي التالية:
والمزيد أيضًا :)
حسنًا، يمكن استخدام هذا لمجموعة من الأمور. ومع ذلك، سأرتكّز فقط على الجزء المتعلق بالأمن. اعتمادًا على هدفك، ستحصل على معلومات حول:
لا على الإطلاق. يرجى ملاحظة أن البيانات الوصفية مثلها مثل أي بيانات أخرى هي مجرد بيانات مكتوبة في ذلك الملف. لذلك يمكن تغييرها قبل رفعها. ومع ذلك، فإن نسبة الشركات التي تغيّر هذا النوع من البيانات فعلًا ربما تبلغ 20%. كما ستلاحظ إذا كانت فارغة أو ما شابه ذلك.
كل نوع ملف أكثر تعقيدًا من .txt أو ما شابه يستخدم البيانات الوصفية لسهولة الاستخدام، أو لدعم العملاء، أو فقط لإظهار أنه قد تم استخدامه. توجد على الإنترنت معلومات كثيرة عن البيانات الوصفية في أنواع مختلفة من الملفات مثل الصور والمستندات ومقاطع الفيديو والموسيقى. تركز هذه الأداة على PDF فقط. إذا كنت جديدًا على هذا المصطلح، ألقِ نظرة هنا:
أيضًا، إذا كنت مهتمًا بتحليل PDF حقيقي، فإن هذه الأداة ستقوم لك بالأساسيات فقط. لم تُكتب لتحليل الملفات السيئة أو الخبيثة أو حتى المثيرة للاهتمام. الغرض منها هو إعطاؤك فكرة عما يُستخدم في الهدف xyz. إذا كنت تبحث عن تحليل أكثر تعمقًا، أنصحك بأدوات Didier Stevens:
git clone https://github.com/c0decave/pdfgrab
cd pdfgrab
python3 pdfgrab.py -h
هذه هي خياراتك الرئيسية:
# ./pdfgrab.py -u https://www.kernel.org/doc/mirror/ols2004v2.pdf
النتيجة:
[+] Grabbing https://www.kernel.org/doc/mirror/ols2004v2.pdf
[+] Written 3893173 bytes for File: pdfgrab/ols2004v2.pdf
[+] Opening pdfgrab/ols2004v2.pdf
--------------------------------------------------------------------------------
File: pdfgrab/ols2004v2.pdf
/Producer pdfTeX-0.14h
/Creator TeX
/CreationDate D:20040714015300
--------------------------------------------------------------------------------
# ./pdfgrab.py -f pdfgrab/ols2004v2.pdf
النتيجة:
[+] Parsing pdfgrab/ols2004v2.pdf
[+] Opening pdfgrab/ols2004v2.pdf
--------------------------------------------------------------------------------
File: pdfgrab/ols2004v2.pdf
/Producer pdfTeX-0.14h
/Creator TeX
/CreationDate D:20040714015300
--------------------------------------------------------------------------------
./pdfgrab.py -F pdfgrab/
سيقوم بتحليل جميع ملفات PDF في ذلك المجلد
# ./pdfgrab.py -s kernel.org
النتيجة:
[+] Seek and analysing site:kernel.org
http://vger.kernel.org/lpc_bpf2018_talks/bpf_global_data_and_static_keys.pdf
http://vger.kernel.org/netconf2018_files/JiriPirko_netconf2018.pdf
http://vger.kernel.org/netconf2018_files/PaoloAbeni_netconf2018.pdf
http://vger.kernel.org/lpc_net2018_talks/LPC_XDP_Shirokov_paper_v1.pdf
http://vger.kernel.org/netconf2018_files/FlorianFainelli_netconf2018.pdf
http://vger.kernel.org/lpc_net2018_talks/tc_sw_paper.pdf
https://www.kernel.org/doc/mirror/ols2009.pdf
https://www.kernel.org/doc/mirror/ols2004v2.pdf
http://vger.kernel.org/lpc_net2018_talks/ktls_bpf.pdf
http://vger.kernel.org/lpc_net2018_talks/ktls_bpf_paper.pdf
[+] Written 211391 bytes for File: pdfgrab/bpf_global_data_and_static_keys.pdf
[+] Opening pdfgrab/bpf_global_data_and_static_keys.pdf
--------------------------------------------------------------------------------
File: pdfgrab/bpf_global_data_and_static_keys.pdf
/Author
/Title
/Subject
/Creator LaTeX with Beamer class version 3.36
/Producer pdfTeX-1.40.17
/Keywords
/CreationDate D:20181102231821+01'00'
/ModDate D:20181102231821+01'00'
/Trapped /False
/PTEX.Fullbanner This is pdfTeX, Version 3.14159265-2.6-1.40.17 (TeX Live 2016) kpathsea version 6.2.2
# ./pdfgrab.py -s example.com,example.us
يقوم pdfgrab بإخراج المعلومات بتنسيقات مختلفة. إذا لم يتم تعطيلها بواسطة أحد أعلام الإبلاغ (انظر -h)، ستجد في مجلد الإخراج:
ينشئ pdfgrab ملف سجل في مجلد التشغيل باسم "pdfgrab.log"
استمتع!