
Inventus ist ein Spider, der dazu dient, Subdomains einer bestimmten Domain zu finden, indem er diese sowie alle entdeckten Subdomains durchsucht (crawlt).
Inventus ist eine Spider, die entwickelt wurde, um Subdomains einer bestimmten Domain zu finden, indem sie diese und alle gefundenen Subdomains crawlt. Es handelt sich um einen Scrapy-Spider, was bedeutet, dass er leicht an Ihre Bedürfnisse angepasst und erweitert werden kann.
Inventus erfordert, dass Scrapy installiert ist, bevor es ausgeführt werden kann. Klonen Sie zuerst das Repository und wechseln Sie in das Verzeichnis.
$ git clone https://github.com/nmalcolm/Inventus
$ cd Inventus
Installieren Sie nun die erforderlichen Abhängigkeiten mit pip.
$ pip install -r requirements.txt
Angenommen, die Installation war erfolgreich, sollte Inventus einsatzbereit sein.
Die grundlegendste Verwendung von Inventus ist wie folgt:
$ cd Inventus
$ scrapy crawl inventus -a domain=facebook.com
Dies teilt Scrapy mit, welcher Spider verwendet werden soll (in diesem Fall 'inventus'), und übergibt die Domain an den Spider. Gefundene Subdomains werden an STDOUT gesendet.
Der andere benutzerdefinierte Parameter ist subdomain_limit. Dieser setzt eine maximale Anzahl von zu entdeckenden Subdomains, bevor der Vorgang beendet wird. Der Standardwert ist 10000, ist jedoch keine harte Grenze.
$ scrapy crawl inventus -a domain=facebook.com -a subdomain_limit=100
Das Exportieren von Daten kann auf verschiedene Weisen erfolgen. Der einfachste Weg ist die Umleitung von STDOUT in eine Datei.
$ scrapy crawl inventus -a domain=facebook.com > facebook.txt
Scrapy verfügt über eine integrierte Funktion, mit der Sie Elemente in verschiedene Formate exportieren können, darunter CSV, JSON und XML. Derzeit werden nur Subdomains exportiert, dies könnte sich jedoch in Zukunft ändern.
$ scrapy crawl inventus -a domain=facebook.com -t csv -o Facebook.csv
Es können Konfigurationen zum Verhalten von Inventus vorgenommen werden. Standardmäßig ignoriert Inventus robots.txt, hat ein Timeout von 30 Sekunden, speichert Crawl-Daten für 24 Stunden zwischen, hat eine Crawl-Tiefe von 5 und verwendet die AutoThrottle-Erweiterung von Scrapy. Diese und weitere Einstellungen können durch Bearbeiten der Datei inventus_spider/settings.py geändert werden. Scrapy's Einstellungen sind ebenfalls gut dokumentiert.
Erstellen Sie gerne ein neues Issue für eines der oben genannten Anliegen. Inventus wurde in nur wenigen Stunden erstellt und wird wahrscheinlich Fehler enthalten. Sie können mich auch auf Twitter kontaktieren.
Veröffentlicht unter der MIT-Lizenz. Siehe LICENSE.