
Scraper de Python basado en IA
English | 中文 | 日本語 | 한국어 | Русский | Türkçe | Deutsch | Español | français | Português | Italiano
ScrapeGraphAI es una librería de web scraping en Python que utiliza LLM y lógica de grafos directa para crear pipelines de scraping para sitios web y documentos locales (XML, HTML, JSON, Markdown, etc.).
¡Solo di qué información quieres extraer y la librería lo hará por ti!
ScrapeGraphAI ofrece una integración fluida con frameworks y herramientas populares para mejorar tus capacidades de scraping. Ya sea que estés construyendo con Python o Node.js, usando frameworks LLM, o trabajando con plataformas sin código, tenemos todo cubierto con nuestras opciones de integración integrales.
Puedes encontrar más información en el siguiente enlace
Integraciones:
La página de referencia de Scrapegraph-ai está disponible en la página oficial de PyPI: pypi.
pip install scrapegraphai
# IMPORTANT (for fetching websites content)
playwright install
Nota: se recomienda instalar la librería en un entorno virtual para evitar conflictos con otras librerías 🐱
Hay múltiples pipelines de scraping estándar que se pueden usar para extraer información de un sitio web (o archivo local).
El más común es SmartScraperGraph, que extrae información de una sola página dado un prompt de usuario y una URL de origen.
from scrapegraphai.graphs import SmartScraperGraph
# Define the configuration for the scraping pipeline
graph_config = {
"llm": {
"model": "ollama/llama3.2",
"model_tokens": 8192,
"format": "json",
},
"verbose": True,
"headless": False,
}
# Create the SmartScraperGraph instance
smart_scraper_graph = SmartScraperGraph(
prompt="Extract useful information from the webpage, including a description of what the company does, founders and social media links",
source="https://scrapegraphai.com/",
config=graph_config
)
# Run the pipeline
result = smart_scraper_graph.run()
import json
print(json.dumps(result, indent=4))
[!NOTE] Para OpenAI y otros modelos solo necesitas cambiar la configuración del LLM!
graph_config = { "llm": { "api_key": "YOUR_OPENAI_API_KEY", "model": "openai/gpt-4o-mini", }, "verbose": True, "headless": False, }
La salida será un diccionario como el siguiente:
{
"description": "ScrapeGraphAI transforms websites into clean, organized data for AI agents and data analytics. It offers an AI-powered API for effortless and cost-effective data extraction.",
"founders": [
{
"name": "",
"role": "Founder & Technical Lead",
"linkedin": "https://www.linkedin.com/in/perinim/"
},
{
"name": "Marco Vinciguerra",
"role": "Founder & Software Engineer",
"linkedin": "https://www.linkedin.com/in/marco-vinciguerra-7ba365242/"
},
{
"name": "Lorenzo Padoan",
"role": "Founder & Product Engineer",
"linkedin": "https://www.linkedin.com/in/lorenzo-padoan-4521a2154/"
}
],
"social_media_links": {
"linkedin": "https://www.linkedin.com/company/101881123",
"twitter": "https://x.com/scrapegraphai",
"github": "https://github.com/ScrapeGraphAI/Scrapegraph-ai"
}
}
Hay otros pipelines que se pueden usar para extraer información de múltiples páginas, generar scripts de Python, o incluso generar archivos de audio.
Para cada uno de estos grafos existe la versión multi. Permite hacer llamadas al LLM en paralelo.
Es posible usar diferentes LLM a través de APIs, como OpenAI, Groq, Azure, Gemini, MiniMax y más, o modelos locales usando Ollama.
Recuerda tener Ollama instalado y descargar los modelos usando el comando ollama pull, si quieres usar modelos locales.
La documentación de ScrapeGraphAI se puede encontrar aquí.
ScrapeGraphAI viene en dos sabores: esta librería de código abierto, que ejecutas tú mismo, y la API gestionada en la nube (usada a través de los SDKs de Python y JS/TS). Esta tabla explica la diferencia para que puedas elegir la correcta.
Elige la librería de código abierto si quieres control total, datos on-premise/auto-alojados, LLMs locales (Ollama), o ajuste de costes detallado — y estás dispuesto a gestionar navegadores, proxies y escalado tú mismo.
Elige la API gestionada si quieres infraestructura cero, renderizado JS y anti-bot gestionados, trabajos integrados de Crawl y Monitor programados, y el camino más rápido a producción — facturado por crédito.
¡Siéntete libre de contribuir y únete a nuestro servidor de Discord para discutir con nosotros mejoras y darnos sugerencias!
Por favor, consulta las guías de contribución.
Si buscas una solución rápida para integrar ScrapeGraph en tu sistema, ¡echa un vistazo a nuestra potente API aquí!
Ofrecemos SDKs tanto en Python como en Node.js, facilitando la integración en tus proyectos. Míralos a continuación:
| SDK | Lenguaje | Enlace de GitHub |
|---|---|---|
| Python SDK | Python | scrapegraph-py |
| Node.js SDK | Node.js | scrapegraph-js |
La Documentación Oficial de la API se puede encontrar aquí.
Recopilamos métricas de uso anónimas para mejorar la calidad y experiencia de usuario de nuestro paquete. Los datos nos ayudan a priorizar mejoras y garantizar la compatibilidad. Si deseas optar por no participar, establece la variable de entorno SCRAPEGRAPHAI_TELEMETRY_ENABLED=false. Para más información, consulta la documentación aquí.
Si has usado nuestra librería con fines de investigación, por favor cítanos con la siguiente referencia:
@misc{scrapegraph-ai,
author = {Lorenzo Padoan, Marco Vinciguerra},
title = {Scrapegraph-ai},
year = {2024},
url = {https://github.com/ScrapeGraphAI/Scrapegraph-ai},
note = {A Python library for scraping leveraging large language models}
}
ScrapeGraphAI está licenciado bajo la Licencia MIT. Consulta el archivo LICENSE para más información.
Hecho con ❤️ por ScrapeGraph AI
| Nombre del Pipeline | Descripción |
|---|
| SmartScraperGraph | Scraper de una sola página que solo necesita un prompt de usuario y una fuente de entrada. |
| SearchGraph | Scraper de múltiples páginas que extrae información de los primeros n resultados de búsqueda de un motor de búsqueda. |
| SpeechGraph | Scraper de una sola página que extrae información de un sitio web y genera un archivo de audio. |
| ScriptCreatorGraph | Scraper de una sola página que extrae información de un sitio web y genera un script de Python. |
| SmartScraperMultiGraph | Scraper de múltiples páginas que extrae información de varias páginas dado un solo prompt y una lista de fuentes. |
| ScriptCreatorMultiGraph | Scraper de múltiples páginas que genera un script de Python para extraer información de varias páginas y fuentes. |
Código Abierto (scrapegraphai) | API Gestionada (scrapegraph-py / scrapegraph-js) |
|---|
| Qué es | Una librería de Python que ejecutas tú mismo | Un servicio cloud alojado al que llamas vía SDK |
| Dónde se ejecuta | Tu propia infraestructura (auto-alojado) | Nube de ScrapeGraphAI |
| LLM | Trae el tuyo propio (OpenAI, Groq, Gemini, Azure, local vía Ollama) | Gestionado por nosotros |
| Renderizado de navegador/JS | Tú lo configuras (Playwright) | Gestionado (modos stealth, auto/fast/js) |
| Proxies y anti-bot | Tu responsabilidad | Incluido |
| Escalado y mantenimiento | Tu responsabilidad | Totalmente gestionado |
| Modelo de coste | Tokens LLM + tu propia infra | Créditos de pago por uso |
| Autenticación | Tus propias claves LLM | SGAI_API_KEY |
| Capacidades | Pipelines de grafo (SmartScraper, Search, Speech, ScriptCreator…) | Scrape, Extract, Search, Crawl, Monitor, History |
| Esfuerzo de configuración | Más configuración | Mínimo — clave API + una llamada |
| Licencia | MIT | El SDK es MIT; el servicio API es de pago |