Skip to content
KitploitKITPLOIT
FerramentasBlog
Enviar
FerramentasBlog
Enviar

Ferramentas de Hacking, PenTest e Cibersegurança para o seu Arsenal de Segurança!

Kitploit é um diretório de ferramentas de hacking, cibersegurança e pentesting. Descubra as últimas atualizações de projetos para encontrar vulnerabilidades, analisar sistemas, automatizar testes e fortalecer sua segurança.

··Feeds·Contato·Privacidade·© 2026 Kitploit

Diretório de Ferramentas

Categorias

Ver todas as categorias
Loading categories
spider — Get web data for AI agents and LLMs | Kitploit
Ferramentas/GitHubGitHub/spider-rs/spider
Information GatheringWeb SecurityCrawlerAnti-BotAI Security
GitHubspider-rs/spider

spider

Get web data for AI agents and LLMs

Ver Repositório
2.6k222há 14h 55mRevisado pelo Kitploit

Mais Populares

Ver todos →

Descubra as ferramentas mais usadas pela nossa comunidade.

Explore todas as ferramentas

Navegue pela nossa coleção de ferramentas

Ver todas as ferramentas →
Compartilhar
Site

Spider

Spider

O mais rápido crawler e scraper web para Rust.

Crates.io Downloads Documentation Discord License

spider.cloud · Guias · Documentação · Exemplos · Discord


Spider é um mecanismo de crawling focado em concorrência construído em Rust. Ele transmite páginas assim que chegam, renderiza JavaScript apenas quando uma página exige e escala de um único script a uma frota distribuída sem alterar seu código. O mesmo mecanismo alimenta o Spider Cloud, permitindo que você prototipe localmente e migre para infraestrutura gerenciada com uma única mudança de configuração.

Comece na nuvem

A parte mais difícil do crawling em escala não é o código. São os proxies, navegadores headless e a constante rotação anti-bot. O Spider Cloud executa tudo isso para você por trás da mesma API.

Obtenha uma chave de API gratuita → (sem necessidade de cartão)

root@kitploit:~
[dependencies]
spider = { version = "2", features = ["spider_cloud"] }
root@kitploit:~
use spider::configuration::{SpiderCloudConfig, SpiderCloudMode};
use spider::website::Website;

let cloud = SpiderCloudConfig::new("sk-...")
    .with_mode(SpiderCloudMode::Smart); // proxy by default, auto-unblock when blocked

let mut website = Website::new("https://example.com")
    .with_spider_cloud_config(cloud)
    .build()?;

O modo Smart roteia primeiro pelos proxies e escala para o desbloqueador apenas em páginas que reagem, para que você pague pelo bypass exatamente quando necessário e nunca quando não é.

Ou execute localmente

Sem chave, sem serviço. Apenas o crawler.

root@kitploit:~
[dependencies]
spider = "2"
root@kitploit:~
use spider::{tokio, website::Website};

#[tokio::main]
async fn main() {
    let mut website = Website::new("https://example.com");
    let mut rx = website.subscribe(16);

    tokio::spawn(async move {
        while let Ok(page) = rx.recv().await {
            println!("{}  {}", page.status_code, page.get_url());
        }
    });

    website.crawl().await;
    website.unsubscribe();
}

As páginas chegam em streaming conforme são buscadas. O crawler descobre links, respeita limites e para por conta própria.

Como funciona

O Spider executa primeiro via HTTP e só inicia o Chrome headless quando uma página realmente precisa de JavaScript. O streaming está integrado tanto nos caminhos HTTP quanto no Chrome, para que as páginas retornem no momento em que são buscadas, em vez de serem acumuladas no final. Esse design oferece a melhor taxa de transferência de concorrência da categoria, sustentando volumes extremamente altos de requisições que escalam de uma única tarefa assíncrona a uma frota distribuída de workers na mesma API. Proxies, repetições, limitação de taxa e stealth são embutidos.

Instalação

Configuração

Cada opção tem um padrão sensato, então defina apenas o que você precisa.

root@kitploit:~
let mut website = Website::new("https://example.com")
    .with_limit(50)                    // concurrent requests
    .with_depth(10)                    // how deep to follow links
    .with_delay(500)                   // pause between requests (ms)
    .with_respect_robots_txt(true)
    .with_subdomains(true)
    .with_user_agent(Some("MyBot/1.0"))
    .with_stealth(true)
    .build()
    .unwrap();

Referência completa na documentação do Configuration.

Para sites com muito JavaScript, ative features = ["chrome"] e chame crawl_smart(). O Spider tenta HTTP primeiro e só inicia Chrome em páginas que precisam.

Casos de uso

Equipes usam o Spider para alimentar a web aberta em armazenamentos vetoriais para pipelines de LLM e RAG, monitorar sites para SEO e mudanças de preços, exportar páginas como Markdown, JSON ou WARC, e dirigir Chrome headless para agentes de navegação de IA. Há 50+ exemplos executáveis para começar.

Saiba mais

  • 📚 Guias: receitas e integrações
  • 📖 Documentação da API: todas as opções e métodos
  • 💬 Discord: perguntas e ideias
  • 🐛 Issues: bugs e solicitações de funcionalidades

Contribuindo

PRs são bem-vindos. Veja CONTRIBUTING.md.

root@kitploit:~
cargo test -p spider                  # unit tests
RUN_LIVE_TESTS=1 cargo test           # live network tests

Licença

MIT.

Baixar ferramenta
Você quer…Execute
Biblioteca Rustcargo add spider
Ferramenta de linha de comandocargo install spider_cli
Pacote Node.jsnpm i @spider-rs/spider-rs
Pacote Pythonpip install spider_rs
Servidor MCP (Claude, Cursor, …)cargo install spider_mcp
Crawling gerenciadospider.cloud