Skip to content
KitploitKITPLOIT
StrumentiExploitsBlog
Log in
Invia
StrumentiExploitsBlog
Invia

Strumenti di Hacking, PenTest e Cybersecurity per il tuo Arsenale di Sicurezza!

Kitploit è una directory di strumenti di hacking, cybersecurity e pentesting. Scopri gli ultimi aggiornamenti dei progetti per trovare vulnerabilità, analizzare sistemi, automatizzare i test e rafforzare la tua sicurezza.

FeedContattoPrivacy© 2026 Kitploit

Directory degli strumenti

Categorie

Vedi tutte le categorie
Loading categories
crawlee — Libreria Node.js per web scraping e automazione del browser per creare crawler affidabili con supporto HTTP e browser headless, rotazione dei proxy e fingerprinting simile a quello umano. | Kitploit
Strumenti/GitHubGitHub/apify/crawlee
Utilità GenericheOSINT (Open Source Intelligence)RicognizioneProxy Web e IntercettazioneScripting e AutomazioneRaccolta InformazioniCrawlerAnti-BotSpoofing dell'Impronta Digitale
GitHubapify/crawlee

crawlee

Libreria Node.js per web scraping e automazione del browser per creare crawler affidabili con supporto HTTP e browser headless, rotazione dei proxy e fingerprinting simile a quello umano.

26.0k1.7k1h 23m faRevisionato da Kitploit
Vedi RepositorySito web

Più Popolari

Vedi tutti →

Scopri gli strumenti più utilizzati dalla nostra community.

Esplora tutti gli strumenti

Sfoglia la nostra collezione di strumenti

Vedi tutti gli strumenti →
Condividi

Crawlee
Una libreria per web scraping e automazione del browser

apify%2Fcrawlee | Trendshift

NPM latest version Downloads Chat on discord Build Status

Crawlee copre il tuo crawling e scraping end-to-end e ti aiuta a costruire scraper affidabili. Velocemente.

I tuoi crawler appariranno simili a esseri umani e voleranno sotto il radar delle moderne protezioni anti-bot anche con la configurazione predefinita. Crawlee ti fornisce gli strumenti per scansionare il web alla ricerca di link, estrarre dati e archiviarli su disco o nel cloud, rimanendo configurabile per adattarsi alle esigenze del tuo progetto.

Crawlee è disponibile come pacchetto NPM crawlee.

👉 Visualizza la documentazione completa, le guide e gli esempi sul sito del progetto Crawlee 👈

Preferisci 🐍 Python invece di JavaScript? 👉 Dai un'occhiata a Crawlee for Python 👈.

Installazione

Ti consigliamo di visitare il tutorial introduttivo nella documentazione di Crawlee per maggiori informazioni.

Crawlee richiede Node.js 22.13 o superiore.

Con la CLI di Crawlee

Il modo più rapido per provare Crawlee è utilizzare la CLI di Crawlee e scegliere l'esempio introduttivo. La CLI installerà tutte le dipendenze necessarie e aggiungerà il codice boilerplate con cui giocare.

npx crawlee create my-crawler
cd my-crawler
npm start

Installazione manuale

Se preferisci aggiungere Crawlee nel tuo progetto, prova l'esempio seguente. Poiché utilizza PlaywrightCrawler, dobbiamo anche installare Playwright. Non è incluso in Crawlee per ridurre le dimensioni dell'installazione.

npm install crawlee playwright
import { PlaywrightCrawler, Dataset } from 'crawlee';

// PlaywrightCrawler crawls the web using a headless
// browser controlled by the Playwright library.
const crawler = new PlaywrightCrawler({
    // Use the requestHandler to process each of the crawled pages.
    async requestHandler({ request, page, enqueueLinks, log }) {
        const title = await page.title();
        log.info(`Title of ${request.loadedUrl} is '${title}'`);

        // Save results as JSON to ./storage/datasets/default
        await Dataset.pushData({ title, url: request.loadedUrl });

        // Extract links from the current page
        // and add them to the crawling queue.
        await enqueueLinks();
    },
    // Uncomment this option to see the browser window.
    // headless: false,
});

// Add first URL to the queue and start the crawl.
await crawler.run(['https://crawlee.dev']);

Per impostazione predefinita, Crawlee memorizza i dati in ./storage nella directory di lavoro corrente. Puoi sovrascrivere questa directory tramite la configurazione di Crawlee. Per i dettagli, consulta la guida alla configurazione, Request storage e Result storage.

Installazione delle versioni pre-release

Forniamo build beta automatizzate per ogni modifica al codice unita in Crawlee. Puoi trovarle nella lista delle release su npm. Se desideri testare nuove funzionalità o correzioni di bug prima che le rilasciamo, sentiti libero di installare una build beta in questo modo:

npm install crawlee@next

Se utilizzi anche l'Apify SDK, devi specificare gli override delle dipendenze nel tuo file package.json in modo da non ritrovarti con più versioni di Crawlee installate:

{
    "overrides": {
       "apify": {
           "@crawlee/core": "$crawlee",
           "@crawlee/types": "$crawlee",
           "@crawlee/utils": "$crawlee"
       }
    }
}

🛠 Funzionalità

  • Interfaccia unica per il crawling HTTP e con browser headless
  • Coda persistente per gli URL da scansionare (breadth & depth first)
  • Storage collegabile sia per dati tabellari che per file
  • Scalabilità automatica con le risorse di sistema disponibili
  • Rotazione dei proxy e gestione delle sessioni integrata
  • Cicli di vita personalizzabili con hook
  • CLI per avviare i tuoi progetti
  • Routing, gestione degli errori e tentativi configurabili
  • Dockerfile pronti per il deploy
  • Scritto in TypeScript con generics

👾 Crawling HTTP

  • Supporto HTTP2 senza configurazione, anche per i proxy
  • Generazione automatica di header simili a quelli di un browser
  • Replica delle impronte TLS del browser
  • Parser HTML veloci integrati. Cheerio e JSDOM
  • Sì, puoi fare scraping anche di API JSON

💻 Crawling con browser reale

  • Rendering JavaScript e screenshot
  • Supporto headless e headful
  • Generazione senza configurazione di impronte simili a quelle umane
  • Gestione automatica del browser
  • Usa Playwright e Puppeteer con la stessa interfaccia
  • Chrome, Firefox, Webkit e molti altri

Utilizzo sulla piattaforma Apify

Crawlee è open-source e funziona ovunque, ma poiché è sviluppato da Apify, è facile configurarlo sulla piattaforma Apify ed eseguirlo nel cloud. Visita il sito dell'Apify SDK per saperne di più sul deploy di Crawlee sulla piattaforma Apify.

Supporto

Se trovi bug o problemi con Crawlee, invia una issue su GitHub. Per domande, puoi chiedere su Stack Overflow, nelle GitHub Discussions oppure puoi unirti al nostro server Discord.

Contribuire

I tuoi contributi al codice sono benvenuti, e sarai lodato in eterno! Se hai idee per miglioramenti, invia una issue o crea una pull request. Per le linee guida sui contributi e il codice di condotta, consulta CONTRIBUTING.md.

Licenza

Questo progetto è distribuito sotto la Licenza Apache 2.0 - consulta il file LICENSE.md per i dettagli.

Scarica lo strumento