Skip to content
KitploitKITPLOIT
ИнструментыЭксплойтыБлог
Log in
Отправить
ИнструментыЭксплойтыБлог
Отправить

Инструменты для хакинга, пентеста и кибербезопасности — ваш арсенал защиты!

Kitploit — это каталог инструментов для хакинга, кибербезопасности и пентестинга. Находите последние обновления проектов для поиска уязвимостей, анализа систем, автоматизации тестирования и усиления вашей безопасности.

ЛентыКонтактыКонфиденциальность© 2026 Kitploit

Каталог инструментов

Категории

Все категории
Loading categories
crawlee — Библиотека для веб-скрейпинга и автоматизации браузера на Node.js для создания надёжных краулеров с поддержкой HTTP и headless-браузеров, ротацией прокси и имитацией человеческого отпечатка. | Kitploit
Инструменты/GitHubGitHub/apify/crawlee
Утилиты общего назначенияOSINT (Разведка открытых источников)РазведкаВеб-прокси и перехватСкриптинг и автоматизацияСбор информацииКраулерАнти-БотПодмена Цифрового Отпечатка
GitHubapify/crawlee

crawlee

Библиотека для веб-скрейпинга и автоматизации браузера на Node.js для создания надёжных краулеров с поддержкой HTTP и headless-браузеров, ротацией прокси и имитацией человеческого отпечатка.

26.0k1.7k1 ч 31 мин назадПроверено Kitploit
РепозиторийСайт

Популярное

Смотреть все →

Откройте для себя самые используемые инструменты нашего сообщества.

Изучить все инструменты

Просмотрите нашу коллекцию инструментов

Смотреть все инструменты →
Поделиться

Crawlee
Библиотека для веб-скрапинга и автоматизации браузера

apify%2Fcrawlee | Trendshift

NPM latest version Downloads Chat on discord Build Status

Crawlee обеспечивает полный цикл краулинга и скрапинга и помогает создавать надёжные скраперы. Быстро.

Ваши краулеры будут выглядеть как люди и останутся незамеченными для современных систем защиты от ботов даже при конфигурации по умолчанию. Crawlee даёт вам инструменты для обхода веб-сайтов в поисках ссылок, извлечения данных и их сохранения на диск или в облако, оставаясь настраиваемым под нужды вашего проекта.

Crawlee доступен как NPM-пакет crawlee.

👉 Полная документация, руководства и примеры на сайте проекта Crawlee 👈

Предпочитаете 🐍 Python вместо JavaScript? 👉 Ознакомьтесь с Crawlee для Python 👈.

Установка

Рекомендуем посетить вводное руководство в документации Crawlee для получения дополнительной информации.

Crawlee требует Node.js 22.13 или выше.

С помощью Crawlee CLI

Самый быстрый способ попробовать Crawlee — использовать Crawlee CLI и выбрать пример для начала работы. CLI установит все необходимые зависимости и добавит шаблонный код для экспериментов.

npx crawlee create my-crawler
cd my-crawler
npm start

Ручная установка

Если вы предпочитаете добавить Crawlee в свой собственный проект, попробуйте пример ниже. Поскольку в нём используется PlaywrightCrawler, нам также нужно установить Playwright. Он не входит в состав Crawlee, чтобы уменьшить размер установки.

npm install crawlee playwright
import { PlaywrightCrawler, Dataset } from 'crawlee';

// PlaywrightCrawler crawls the web using a headless
// browser controlled by the Playwright library.
const crawler = new PlaywrightCrawler({
    // Use the requestHandler to process each of the crawled pages.
    async requestHandler({ request, page, enqueueLinks, log }) {
        const title = await page.title();
        log.info(`Title of ${request.loadedUrl} is '${title}'`);

        // Save results as JSON to ./storage/datasets/default
        await Dataset.pushData({ title, url: request.loadedUrl });

        // Extract links from the current page
        // and add them to the crawling queue.
        await enqueueLinks();
    },
    // Uncomment this option to see the browser window.
    // headless: false,
});

// Add first URL to the queue and start the crawl.
await crawler.run(['https://crawlee.dev']);

По умолчанию Crawlee сохраняет данные в ./storage в текущем рабочем каталоге. Вы можете переопределить этот каталог через конфигурацию Crawlee. Подробности см. в руководстве по конфигурации, хранилище запросов и хранилище результатов.

Установка предрелизных версий

Мы предоставляем автоматические бета-сборки для каждого изменения кода, влитого в Crawlee. Вы можете найти их в npm в списке релизов. Если вы хотите протестировать новые функции или исправления ошибок до их выпуска, не стесняйтесь установить бета-сборку следующим образом:

npm install crawlee@next

Если вы также используете Apify SDK, вам нужно указать переопределения зависимостей в файле package.json, чтобы не получить несколько установленных версий Crawlee:

{
    "overrides": {
       "apify": {
           "@crawlee/core": "$crawlee",
           "@crawlee/types": "$crawlee",
           "@crawlee/utils": "$crawlee"
       }
    }
}

🛠 Возможности

  • Единый интерфейс для краулинга через HTTP и headless-браузер
  • Постоянная очередь URL-адресов для обхода (в ширину и в глубину)
  • Подключаемое хранилище как табличных данных, так и файлов
  • Автоматическое масштабирование с учётом доступных системных ресурсов
  • Встроенная ротация прокси и управление сессиями
  • Настраиваемые жизненные циклы с помощью хуков
  • CLI для быстрого создания проектов
  • Настраиваемая маршрутизация, обработка ошибок и повторы
  • Готовые к развёртыванию Dockerfile
  • Написан на TypeScript с использованием дженериков

👾 HTTP-краулинг

  • Поддержка HTTP2 без конфигурации, даже для прокси
  • Автоматическая генерация заголовков, похожих на браузерные
  • Воспроизведение TLS-отпечатков браузера
  • Встроенные быстрые HTML-парсеры. Cheerio и JSDOM
  • Да, вы также можете скрапить JSON API

💻 Краулинг с реальным браузером

  • JavaScript рендеринг и скриншоты
  • Поддержка headless и headful режимов
  • Генерация человекоподобных отпечатков без конфигурации
  • Автоматическое управление браузером
  • Используйте Playwright и Puppeteer с одним и тем же интерфейсом
  • Chrome, Firefox, Webkit и многие другие

Использование на платформе Apify

Crawlee имеет открытый исходный код и работает где угодно, но поскольку он разработан компанией Apify, его легко настроить на платформе Apify и запустить в облаке. Посетите сайт Apify SDK, чтобы узнать больше о развёртывании Crawlee на платформе Apify.

Поддержка

Если вы обнаружите ошибку или проблему с Crawlee, пожалуйста, создайте issue на GitHub. По вопросам вы можете обратиться на Stack Overflow, в GitHub Discussions или присоединиться к нашему серверу Discord.

Участие в разработке

Мы приветствуем ваш вклад в код, и вы будете восхваляемы в веках! Если у вас есть идеи по улучшению, создайте issue или отправьте pull request. Руководство по участию и кодекс поведения см. в CONTRIBUTING.md.

Лицензия

Этот проект лицензирован под Apache License 2.0 — подробности см. в файле LICENSE.md.

Скачать инструмент