
Python-скрапер на основе ИИ
English | 中文 | 日本語 | 한국어 | Русский | Türkçe | Deutsch | Español | français | Português | Italiano
ScrapeGraphAI — это python-библиотека для веб-скрапинга, которая использует LLM и логику прямых графов для создания пайплайнов извлечения данных с веб-сайтов и локальных документов (XML, HTML, JSON, Markdown и т.д.).
Просто укажите, какую информацию вы хотите извлечь, и библиотека сделает всё за вас!
ScrapeGraphAI предлагает бесшовную интеграцию с популярными фреймворками и инструментами, чтобы расширить ваши возможности скрапинга. Создаёте ли вы проекты на Python или Node.js, используете LLM-фреймворки или работаете с no-code платформами — наши комплексные варианты интеграции вас полностью покрывают.
Вы можете найти более подробную информацию по следующей ссылке
Интеграции:
Справочная страница Scrapegraph-ai доступна на официальной странице PyPI: pypi.
pip install scrapegraphai
# IMPORTANT (for fetching websites content)
playwright install
Примечание: рекомендуется устанавливать библиотеку в виртуальном окружении, чтобы избежать конфликтов с другими библиотеками 🐱
Существует несколько стандартных пайплайнов скрапинга, которые можно использовать для извлечения информации с веб-сайта (или из локального файла).
Самый распространённый из них — SmartScraperGraph, который извлекает информацию с одной страницы по заданному пользовательскому промпту и исходному URL.
from scrapegraphai.graphs import SmartScraperGraph
# Define the configuration for the scraping pipeline
graph_config = {
"llm": {
"model": "ollama/llama3.2",
"model_tokens": 8192,
"format": "json",
},
"verbose": True,
"headless": False,
}
# Create the SmartScraperGraph instance
smart_scraper_graph = SmartScraperGraph(
prompt="Extract useful information from the webpage, including a description of what the company does, founders and social media links",
source="https://scrapegraphai.com/",
config=graph_config
)
# Run the pipeline
result = smart_scraper_graph.run()
import json
print(json.dumps(result, indent=4))
[!NOTE] Для OpenAI и других моделей достаточно просто изменить конфигурацию llm!
graph_config = { "llm": { "api_key": "YOUR_OPENAI_API_KEY", "model": "openai/gpt-4o-mini", }, "verbose": True, "headless": False, }
Результат будет представлять собой словарь следующего вида:
{
"description": "ScrapeGraphAI transforms websites into clean, organized data for AI agents and data analytics. It offers an AI-powered API for effortless and cost-effective data extraction.",
"founders": [
{
"name": "",
"role": "Founder & Technical Lead",
"linkedin": "https://www.linkedin.com/in/perinim/"
},
{
"name": "Marco Vinciguerra",
"role": "Founder & Software Engineer",
"linkedin": "https://www.linkedin.com/in/marco-vinciguerra-7ba365242/"
},
{
"name": "Lorenzo Padoan",
"role": "Founder & Product Engineer",
"linkedin": "https://www.linkedin.com/in/lorenzo-padoan-4521a2154/"
}
],
"social_media_links": {
"linkedin": "https://www.linkedin.com/company/101881123",
"twitter": "https://x.com/scrapegraphai",
"github": "https://github.com/ScrapeGraphAI/Scrapegraph-ai"
}
}
Существуют и другие пайплайны, которые можно использовать для извлечения информации с нескольких страниц, генерации Python-скриптов или даже создания аудиофайлов.
Для каждого из этих графов существует мульти-версия. Она позволяет выполнять параллельные вызовы LLM.
Можно использовать различные LLM через API, такие как OpenAI, Groq, Azure, Gemini, MiniMax и другие, а также локальные модели с помощью Ollama.
Если вы хотите использовать локальные модели, не забудьте установить Ollama и загрузить модели с помощью команды ollama pull.
Документация по ScrapeGraphAI доступна здесь.
ScrapeGraphAI доступен в двух вариантах: эта библиотека с открытым исходным кодом, которую вы запускаете самостоятельно, и управляемый облачный API (используется через Python и JS/TS SDK). В этой таблице объясняется разница, чтобы вы могли выбрать подходящий вариант.
Выбирайте библиотеку с открытым исходным кодом, если вам нужен полный контроль, данные on-prem/self-hosted, локальные LLM (Ollama) или тонкая настройка затрат — и вы готовы самостоятельно управлять браузерами, прокси и масштабированием.
Выбирайте управляемый API, если вам нужна нулевая инфраструктура, управляемый JS-рендеринг и защита от ботов, встроенные задачи Crawl и планируемые задания Monitor, а также самый быстрый путь к продакшену — оплата за кредиты.
Не стесняйтесь вносить свой вклад и присоединяйтесь к нашему Discord-серверу, чтобы обсудить улучшения и предложить свои идеи!
Пожалуйста, ознакомьтесь с правилами участия в разработке.
Если вы ищете быстрое решение для интеграции ScrapeGraph в свою систему, ознакомьтесь с нашим мощным API здесь!
Мы предлагаем SDK как для Python, так и для Node.js, что упрощает интеграцию в ваши проекты. Ознакомьтесь с ними ниже:
| SDK | Язык | Ссылка на GitHub |
|---|---|---|
| Python SDK | Python | scrapegraph-py |
| Node.js SDK | Node.js | scrapegraph-js |
Официальную документацию API можно найти здесь.
Мы собираем анонимные метрики использования, чтобы улучшать качество нашего пакета и удобство работы пользователей. Эти данные помогают нам расставлять приоритеты в улучшениях и обеспечивать совместимость. Если вы хотите отказаться от сбора данных, установите переменную окружения SCRAPEGRAPHAI_TELEMETRY_ENABLED=false. Дополнительную информацию см. в документации здесь.
Если вы использовали нашу библиотеку в исследовательских целях, пожалуйста, процитируйте нас, используя следующую ссылку:
@misc{scrapegraph-ai,
author = {Lorenzo Padoan, Marco Vinciguerra},
title = {Scrapegraph-ai},
year = {2024},
url = {https://github.com/ScrapeGraphAI/Scrapegraph-ai},
note = {A Python library for scraping leveraging large language models}
}
ScrapeGraphAI распространяется по лицензии MIT. Дополнительную информацию см. в файле LICENSE.
Сделано с ❤️ компанией ScrapeGraph AI
| Название пайплайна | Описание |
|---|
| SmartScraperGraph | Одностраничный скрапер, которому нужны только пользовательский промпт и исходный источник. |
| SearchGraph | Многостраничный скрапер, извлекающий информацию из первых n результатов поисковой выдачи. |
| SpeechGraph | Одностраничный скрапер, который извлекает информацию с веб-сайта и генерирует аудиофайл. |
| ScriptCreatorGraph | Одностраничный скрапер, который извлекает информацию с веб-сайта и генерирует Python-скрипт. |
| SmartScraperMultiGraph | Многостраничный скрапер, извлекающий информацию с нескольких страниц по одному промпту и списку источников. |
| ScriptCreatorMultiGraph | Многостраничный скрапер, генерирующий Python-скрипт для извлечения информации с нескольких страниц и источников. |
Open Source (scrapegraphai) | Managed API (scrapegraph-py / scrapegraph-js) |
|---|
| Что это | Python-библиотека, которую вы запускаете самостоятельно | Размещённый облачный сервис, к которому вы обращаетесь через SDK |
| Где запускается | Ваша собственная инфраструктура (self-hosted) | Облако ScrapeGraphAI |
| LLM | Своя модель (OpenAI, Groq, Gemini, Azure, локально через Ollama) | Управляется за вас |
| Рендеринг браузера / JS | Настраиваете сами (Playwright) | Управляемый (stealth, режимы auto/fast/js) |
| Прокси и анти-бот | Ваша ответственность | Включены |
| Масштабирование и обслуживание | Ваша ответственность | Полностью управляемые |
| Модель оплаты | Токены LLM + собственная инфраструктура | Кредиты по мере использования |
| Аутентификация | Собственные ключи LLM | SGAI_API_KEY |
| Возможности | Графовые пайплайны (SmartScraper, Search, Speech, ScriptCreator…) | Scrape, Extract, Search, Crawl, Monitor, History |
| Сложность настройки | Больше конфигурации | Минимальная — ключ API + один вызов |
| Лицензия | MIT | SDK — MIT; API-сервис платный |