Skip to content
KitploitKITPLOIT
StrumentiExploitsBlog
Log in
Invia
StrumentiExploitsBlog
Invia

Strumenti di Hacking, PenTest e Cybersecurity per il tuo Arsenale di Sicurezza!

Kitploit è una directory di strumenti di hacking, cybersecurity e pentesting. Scopri gli ultimi aggiornamenti dei progetti per trovare vulnerabilità, analizzare sistemi, automatizzare i test e rafforzare la tua sicurezza.

··Feed·Contatto·Privacy·© 2026 Kitploit

Directory degli strumenti

Categorie

Vedi tutte le categorie
Loading categories
spider — Ottieni dati web per agenti AI e LLM | Kitploit
Strumenti/GitHubGitHub/spider-rs/spider
Raccolta InformazioniSicurezza WebCrawlerAnti-BotSicurezza dell'IA
GitHubspider-rs/spider

spider

Ottieni dati web per agenti AI e LLM

Vedi Repository
2.6k2222613 giorni faRevisionato da Kitploit
Sito web

Più Popolari

Vedi tutti →

Scopri gli strumenti più utilizzati dalla nostra community.

Esplora tutti gli strumenti

Sfoglia la nostra collezione di strumenti

Vedi tutti gli strumenti →
Condividi

Spider

Spider

Il web crawler e scraper più veloce per Rust.

Crates.io Downloads Documentation Discord License

spider.cloud · Guide · Documentazione · Esempi · Discord


Spider è un motore di crawling progettato per la concorrenza, scritto in Rust. Trasmette le pagine nel momento in cui arrivano, esegue il rendering di JavaScript solo quando una pagina lo richiede e scala da un singolo script a una flotta distribuita senza modificare il tuo codice. Lo stesso motore alimenta Spider Cloud, così puoi creare prototipi in locale e passare a un'infrastruttura gestita con un solo cambio di configurazione.

Inizia nel cloud

La parte più difficile del crawling su larga scala non è il codice. Sono i proxy, i browser headless e la costante evoluzione delle difese anti-bot. Spider Cloud gestisce tutto questo per te dietro la stessa API.

Ottieni una chiave API gratuita → (nessuna carta richiesta)

[dependencies]
spider = { version = "2", features = ["spider_cloud"] }
use spider::configuration::{SpiderCloudConfig, SpiderCloudMode};
use spider::website::Website;

let cloud = SpiderCloudConfig::new("sk-...")
    .with_mode(SpiderCloudMode::Smart); // proxy by default, auto-unblock when blocked

let mut website = Website::new("https://example.com")
    .with_spider_cloud_config(cloud)
    .build()?;

La modalità Smart instrada prima attraverso i proxy e passa all'unblocker solo sulle pagine che oppongono resistenza, così paghi per il bypass esattamente quando serve e mai quando non serve.

Oppure eseguilo in locale

Nessuna chiave, nessun servizio. Solo il crawler.

[dependencies]
spider = "2"
use spider::{tokio, website::Website};

#[tokio::main]
async fn main() {
    let mut website = Website::new("https://example.com");
    let mut rx = website.subscribe(16);

    tokio::spawn(async move {
        while let Ok(page) = rx.recv().await {
            println!("{}  {}", page.status_code, page.get_url());
        }
    });

    website.crawl().await;
    website.unsubscribe();
}

Le pagine vengono trasmesse non appena vengono recuperate. Il crawler scopre i collegamenti, rispetta i confini e si ferma da solo.

Come funziona

Spider adotta un approccio HTTP-first e avvia Chrome headless solo quando una pagina ha davvero bisogno di JavaScript. Lo streaming è integrato sia nel percorso HTTP che in quello Chrome, quindi le pagine tornano indietro nel momento in cui vengono recuperate, invece di essere accumulate alla fine. Questo design offre una produttività di concorrenza ai massimi livelli, sostenendo volumi di richieste estremamente elevati che scalano da una singola attività asincrona a una flotta di worker distribuiti sulla stessa API. Proxy, retry, limitazione della frequenza e stealth sono integrati.

Installazione

Vuoi…Esegui
Libreria Rustcargo add spider
Strumento a riga di comandocargo install spider_cli
Pacchetto Node.jsnpm i @spider-rs/spider-rs
Pacchetto Pythonpip install spider_rs
Server MCP (Claude, Cursor, …)cargo install spider_mcp
Crawling gestitospider.cloud

Configurazione

Ogni opzione ha un valore predefinito sensato, quindi imposta solo ciò di cui hai bisogno.

let mut website = Website::new("https://example.com")
    .with_limit(50)                    // concurrent requests
    .with_depth(10)                    // how deep to follow links
    .with_delay(500)                   // pause between requests (ms)
    .with_respect_robots_txt(true)
    .with_subdomains(true)
    .with_user_agent(Some("MyBot/1.0"))
    .with_stealth(true)
    .build()
    .unwrap();

Riferimento completo nella documentazione di Configuration.

Per i siti che fanno un uso intensivo di JavaScript, abilita features = ["chrome"] e chiama crawl_smart(). Spider prova prima HTTP e avvia Chrome solo sulle pagine che ne hanno bisogno.

Casi d'uso

I team usano Spider per inserire il web aperto negli archivi vettoriali per pipeline LLM e RAG, monitorare i siti per SEO e variazioni di prezzo, esportare pagine come Markdown, JSON o WARC e guidare Chrome headless per agenti di navigazione AI. Ci sono 50+ esempi eseguibili da cui partire.

Per saperne di più

  • 📚 Guide: ricette e integrazioni
  • 📖 Documentazione API: ogni opzione e metodo
  • 💬 Discord: domande e idee
  • 🐛 Issue: bug e richieste di funzionalità

Contribuire

Le PR sono benvenute. Vedi CONTRIBUTING.md.

cargo test -p spider                  # unit tests
RUN_LIVE_TESTS=1 cargo test           # live network tests

Licenza

MIT.

Scarica lo strumento