
Inventus è uno spider progettato per trovare sottodomini di un dominio specifico eseguendo un crawling su di esso e su qualsiasi sottodominio scopre.
Inventus è un spider progettato per trovare sottodomini di un dominio specifico scorrendo (crawling) il dominio stesso e tutti i sottodomini che scopre. È uno spider di Scrapy, il che significa che è facilmente modificabile ed estendibile alle tue esigenze.
Inventus richiede Scrapy per essere eseguito. Per prima cosa, clona il repository ed entraci.
$ git clone https://github.com/nmalcolm/Inventus
$ cd Inventus
Ora installa le dipendenze richieste usando pip.
$ pip install -r requirements.txt
Supponendo che l'installazione sia riuscita, Inventus dovrebbe essere pronto per l'uso.
L'utilizzo più base di Inventus è il seguente:
$ cd Inventus
$ scrapy crawl inventus -a domain=facebook.com
Questo dice a Scrapy quale spider usare ("inventus" in questo caso) e passa il dominio allo spider. Tutti i sottodomini trovati saranno inviati a STDOUT.
L'altro parametro personalizzato è subdomain_limit. Questo imposta un limite massimo di sottodomini da scoprire prima di terminare. Il valore predefinito è 10000, ma non è un limite rigido.
$ scrapy crawl inventus -a domain=facebook.com -a subdomain_limit=100
I dati possono essere esportati in diversi modi. Il modo più semplice è reindirizzare STDOUT su un file.
$ scrapy crawl inventus -a domain=facebook.com > facebook.txt
Scrapy ha una funzionalità integrata che permette di esportare elementi in vari formati, inclusi CSV, JSON e XML. Attualmente verranno esportati solo i sottodomini, ma questo potrebbe cambiare in futuro.
$ scrapy crawl inventus -a domain=facebook.com -t csv -o Facebook.csv
È possibile configurare il comportamento di Inventus. Per impostazione predefinita, Inventus ignora robots.txt, ha un timeout di 30 secondi, memorizza nella cache i dati di crawling per 24 ore, ha una profondità di crawling di 5 e utilizza l'estensione AutoThrottle di Scrapy. Queste e altre impostazioni possono essere modificate modificando il file inventus_spider/settings.py. Le impostazioni di Scrapy sono ben documentate.
Sentiti libero di aprire una nuova issue per qualsiasi dei precedenti. Inventus è stato costruito in poche ore e probabilmente conterrà bug. Puoi anche contattarmi su Twitter.
Rilasciato sotto licenza MIT. Vedi LICENSE.