Skip to content
KitploitKITPLOIT
ToolsBlog
Einreichen
ToolsBlog
Einreichen

Hacking-, PenTest- und Cybersicherheits-Tools für Ihr Sicherheitsarsenal!

Kitploit ist ein Verzeichnis von Hacking-, Cybersicherheits- und Pentesting-Tools. Entdecken Sie die neuesten Projekt-Updates, um Schwachstellen zu finden, Systeme zu analysieren, Tests zu automatisieren und Ihre Sicherheit zu stärken.

··Feeds·Kontakt·Datenschutz·© 2026 Kitploit

Tool-Verzeichnis

Kategorien

Alle Kategorien anzeigen
Loading categories
spider — Webdaten für KI-Agenten und LLMs abrufen | Kitploit
Tools/GitHubGitHub/spider-rs/spider
InformationsbeschaffungWebsicherheitCrawlerAnti-BotKI-Sicherheit
GitHubspider-rs/spider

spider

Webdaten für KI-Agenten und LLMs abrufen

Repository anzeigen
2.6k22211vor 3 TagenVon Kitploit geprüft
Webseite

Beliebteste

Alle anzeigen →

Entdecken Sie die meistgenutzten Tools unserer Community.

Alle Tools erkunden

Durchsuchen Sie unsere Tool-Sammlung

Alle Tools anzeigen →
Teilen

Spider

Spider

Der schnellste Webcrawler und Scraper für Rust.

Crates.io Downloads Documentation Discord License

· · · ·

Tool herunterladen
spider.cloud
Anleitungen
Dokumentation
Beispiele
Discord

Spider ist eine auf Nebenläufigkeit ausgelegte Crawling-Engine, die in Rust geschrieben ist. Sie streamt Seiten in dem Moment, in dem sie eintreffen, rendert JavaScript nur, wenn eine Seite es benötigt, und skaliert von einem einzelnen Skript zu einer verteilten Flotte, ohne dass du deinen Code ändern musst. Dieselbe Engine betreibt Spider Cloud, sodass du lokal prototypen und mit einer einzigen Konfigurationsänderung auf eine verwaltete Infrastruktur umsteigen kannst.

In der Cloud starten

Das Schwierigste am Crawlen in großem Maßstab ist nicht der Code. Es sind die Proxies, die headless Browser und die ständige Anti-Bot-Dynamik. Spider Cloud erledigt das alles für dich hinter derselben API.

Einen kostenlosen API-Schlüssel erhalten → (keine Kreditkarte erforderlich)

root@kitploit:~
[dependencies]
spider = { version = "2", features = ["spider_cloud"] }
root@kitploit:~
use spider::configuration::{SpiderCloudConfig, SpiderCloudMode};
use spider::website::Website;

let cloud = SpiderCloudConfig::new("sk-...")
    .with_mode(SpiderCloudMode::Smart); // proxy by default, auto-unblock when blocked

let mut website = Website::new("https://example.com")
    .with_spider_cloud_config(cloud)
    .build()?;

Der Smart-Modus leitet Anfragen zuerst über Proxies und schaltet nur auf den Unblocker um, wenn sich Seiten gegen das Crawlen wehren. So zahlst du genau dann für die Umgehung, wenn sie nötig ist, und nie, wenn sie es nicht ist.

Oder lokal ausführen

Kein Schlüssel, kein Dienst. Nur der Crawler.

root@kitploit:~
[dependencies]
spider = "2"
root@kitploit:~
use spider::{tokio, website::Website};

#[tokio::main]
async fn main() {
    let mut website = Website::new("https://example.com");
    let mut rx = website.subscribe(16);

    tokio::spawn(async move {
        while let Ok(page) = rx.recv().await {
            println!("{}  {}", page.status_code, page.get_url());
        }
    });

    website.crawl().await;
    website.unsubscribe();
}

Seiten werden gestreamt, sobald sie abgerufen werden. Der Crawler entdeckt Links, respektiert Grenzen und stoppt selbstständig.

So funktioniert es

Spider arbeitet zuerst mit HTTP und startet headless Chrome nur, wenn eine Seite tatsächlich JavaScript benötigt. Streaming ist sowohl in den HTTP- als auch in den Chrome-Pfad integriert, sodass Seiten sofort zurückfließen, sobald sie abgerufen werden, anstatt am Ende gebündelt zu werden. Dieses Design bietet einen branchenführenden Durchsatz bei gleichzeitigen Anfragen, der von einer einzelnen asynchronen Aufgabe bis zu einem verteilten Worker-Fleet mit derselben API skaliert. Proxies, Wiederholungen, Ratenbegrenzung und Tarnung sind integriert.

Installation

Du möchtest…Ausführen
Rust-Bibliothekcargo add spider
Befehlszeilentoolcargo install spider_cli
Node.js-Paketnpm i @spider-rs/spider-rs
Python-Paketpip install spider_rs
MCP-Server (Claude, Cursor, …)cargo install spider_mcp
Managed Crawlingspider.cloud

Konfiguration

Jede Option hat eine sinnvolle Voreinstellung; setze daher nur, was du brauchst.

root@kitploit:~
let mut website = Website::new("https://example.com")
    .with_limit(50)                    // concurrent requests
    .with_depth(10)                    // how deep to follow links
    .with_delay(500)                   // pause between requests (ms)
    .with_respect_robots_txt(true)
    .with_subdomains(true)
    .with_user_agent(Some("MyBot/1.0"))
    .with_stealth(true)
    .build()
    .unwrap();

Vollständige Referenz in der Configuration-Dokumentation.

Für stark JavaScript-lastige Seiten aktiviere features = ["chrome"] und rufe crawl_smart() auf. Spider versucht zuerst HTTP und startet Chrome nur auf Seiten, die es benötigen.

Anwendungsfälle

Teams nutzen Spider, um das offene Web in Vektor-Datenbanken für LLM- und RAG-Pipelines zu speisen, Websites auf SEO und Preisänderungen zu überwachen, Seiten als Markdown, JSON oder WARC zu exportieren und headless Chrome für KI-Browsing-Agenten zu steuern. Es gibt über 50 ausführbare Beispiele, um loszulegen.

Mehr erfahren

  • 📚 Anleitungen: Rezepte und Integrationen
  • 📖 API-Dokumentation: jede Option und Methode
  • 💬 Discord: Fragen und Ideen
  • 🐛 Issues: Fehler und Funktionswünsche

Mitwirken

PRs sind willkommen. Siehe CONTRIBUTING.md.

root@kitploit:~
cargo test -p spider                  # unit tests
RUN_LIVE_TESTS=1 cargo test           # live network tests

Lizenz

MIT.