Skip to content
KitploitKITPLOIT
HerramientasExploitsBlog
Log in
Enviar
HerramientasExploitsBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

FeedsContactoPrivacidad© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
crawlee — Biblioteca de web scraping y automatización de navegador para Node.js, diseñada para crear crawlers fiables con soporte HTTP y de navegador headless, rotación de proxies y fingerprinting similar al humano. | Kitploit
Herramientas/GitHubGitHub/apify/crawlee
Utilidades de Propósito GeneralOSINT (Inteligencia de Fuentes Abiertas)ReconocimientoProxies Web e InterceptaciónScripting y AutomatizaciónRecopilación de InformaciónCrawlerAnti-BotSuplantación de Huella Digital
GitHubapify/crawlee

crawlee

Biblioteca de web scraping y automatización de navegador para Node.js, diseñada para crear crawlers fiables con soporte HTTP y de navegador headless, rotación de proxies y fingerprinting similar al humano.

26.0k1.7khace 1h 23mRevisado por Kitploit
Ver RepositorioSitio web

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →
Compartir

Crawlee
Una biblioteca de web scraping y automatización de navegadores

apify%2Fcrawlee | Trendshift

NPM latest version Downloads Chat on discord Build Status

Crawlee cubre tu rastreo y scraping de principio a fin y te ayuda a construir scrapers confiables. Rápido.

Tus crawlers parecerán humanos y pasarán desapercibidos ante las protecciones modernas contra bots, incluso con la configuración predeterminada. Crawlee te brinda las herramientas para rastrear la web en busca de enlaces, extraer datos y almacenarlos en disco o en la nube, manteniéndose configurable para adaptarse a las necesidades de tu proyecto.

Crawlee está disponible como el paquete NPM crawlee.

👉 Consulta la documentación completa, guías y ejemplos en el sitio web del proyecto Crawlee 👈

¿Prefieres 🐍 Python en lugar de JavaScript? 👉 Echa un vistazo a Crawlee para Python 👈.

Instalación

Recomendamos visitar el tutorial de introducción en la documentación de Crawlee para obtener más información.

Crawlee requiere Node.js 22.13 o superior.

Con la CLI de Crawlee

La forma más rápida de probar Crawlee es usar la CLI de Crawlee y elegir el ejemplo de inicio. La CLI instalará todas las dependencias necesarias y añadirá código repetitivo para que puedas experimentar.

npx crawlee create my-crawler
cd my-crawler
npm start

Instalación manual

Si prefieres añadir Crawlee a tu propio proyecto, prueba el ejemplo a continuación. Como utiliza PlaywrightCrawler, también necesitamos instalar Playwright. No viene incluido con Crawlee para reducir el tamaño de la instalación.

npm install crawlee playwright
import { PlaywrightCrawler, Dataset } from 'crawlee';

// PlaywrightCrawler crawls the web using a headless
// browser controlled by the Playwright library.
const crawler = new PlaywrightCrawler({
    // Use the requestHandler to process each of the crawled pages.
    async requestHandler({ request, page, enqueueLinks, log }) {
        const title = await page.title();
        log.info(`Title of ${request.loadedUrl} is '${title}'`);

        // Save results as JSON to ./storage/datasets/default
        await Dataset.pushData({ title, url: request.loadedUrl });

        // Extract links from the current page
        // and add them to the crawling queue.
        await enqueueLinks();
    },
    // Uncomment this option to see the browser window.
    // headless: false,
});

// Add first URL to the queue and start the crawl.
await crawler.run(['https://crawlee.dev']);

De forma predeterminada, Crawlee almacena los datos en ./storage en el directorio de trabajo actual. Puedes sobrescribir este directorio mediante la configuración de Crawlee. Para más detalles, consulta la guía de configuración, el almacenamiento de solicitudes y el almacenamiento de resultados.

Instalación de versiones preliminares

Proporcionamos compilaciones beta automatizadas para cada cambio de código fusionado en Crawlee. Puedes encontrarlas en la npm lista de versiones. Si deseas probar nuevas funciones o correcciones de errores antes de que las publiquemos, no dudes en instalar una compilación beta así:

npm install crawlee@next

Si también usas el Apify SDK, necesitas especificar anulaciones de dependencias en tu archivo package.json para no terminar con múltiples versiones de Crawlee instaladas:

{
    "overrides": {
       "apify": {
           "@crawlee/core": "$crawlee",
           "@crawlee/types": "$crawlee",
           "@crawlee/utils": "$crawlee"
       }
    }
}

🛠 Características

  • Interfaz única para rastreo HTTP y con navegador headless
  • Cola persistente de URLs para rastrear (primero en amplitud y en profundidad)
  • Almacenamiento conectable tanto de datos tabulares como de archivos
  • Escalado automático con los recursos disponibles del sistema
  • Rotación de proxies y gestión de sesiones integradas
  • Ciclos de vida personalizables con hooks
  • CLI para iniciar tus proyectos
  • Enrutamiento, manejo de errores y reintentos configurables
  • Dockerfiles listos para desplegar
  • Escrito en TypeScript con genéricos

👾 Rastreo HTTP

  • Soporte HTTP2 sin configuración, incluso para proxies
  • Generación automática de cabeceras similares a las de un navegador
  • Replicación de huellas TLS de navegadores
  • Parsers HTML rápidos integrados. Cheerio y JSDOM
  • Sí, también puedes hacer scraping de APIs JSON

💻 Rastreo con navegador real

  • Renderizado JavaScript y capturas de pantalla
  • Soporte headless y headful
  • Generación sin configuración de huellas similares a las humanas
  • Gestión automática del navegador
  • Usa Playwright y Puppeteer con la misma interfaz
  • Chrome, Firefox, Webkit y muchos otros

Uso en la plataforma Apify

Crawlee es de código abierto y se ejecuta en cualquier lugar, pero como está desarrollado por Apify, es fácil configurarlo en la plataforma Apify y ejecutarlo en la nube. Visita el sitio web del Apify SDK para obtener más información sobre cómo desplegar Crawlee en la plataforma Apify.

Soporte

Si encuentras algún error o problema con Crawlee, por favor envía un issue en GitHub. Para preguntas, puedes consultar en Stack Overflow, en las Discusiones de GitHub o unirte a nuestro servidor de Discord.

Contribuir

¡Tus contribuciones de código son bienvenidas y serás alabado por la eternidad! Si tienes alguna idea de mejora, envía un issue o crea un pull request. Para las pautas de contribución y el código de conducta, consulta CONTRIBUTING.md.

Licencia

Descargar herramienta