
Scrapegraph-ai v2.1.7
Scraper de Python basado en IA
🚀 ¿Buscas una forma aún más rápida y sencilla de hacer scraping a escala (solo 5 líneas de código)? ¡Echa un vistazo a nuestra versión mejorada en ScrapeGraphAI.com! 🚀
🕷️ ScrapeGraphAI: Solo Scrapeas Una Vez
English | 中文 | 日本語 | 한국어 | Русский | Türkçe | Deutsch | Español | français | Português | Italiano
ScrapeGraphAI es una librería de web scraping en Python que utiliza LLM y lógica de grafos directa para crear pipelines de scraping para sitios web y documentos locales (XML, HTML, JSON, Markdown, etc.).
¡Solo di qué información quieres extraer y la librería lo hará por ti!
🚀 Integraciones
ScrapeGraphAI ofrece una integración fluida con frameworks y herramientas populares para mejorar tus capacidades de scraping. Ya sea que estés construyendo con Python o Node.js, usando frameworks LLM, o trabajando con plataformas sin código, tenemos todo cubierto con nuestras opciones de integración integrales.
Puedes encontrar más información en el siguiente enlace
Integraciones:
- API: Documentación
- SDKs: Python, Node
- Frameworks LLM: Langchain, Llama Index, Crew.ai, Agno, CamelAI
- Frameworks Low-code: Pipedream, Bubble, Zapier, n8n, Dify, Toolhouse
- Servidor MCP: Enlace
🚀 Instalación rápida
La página de referencia de Scrapegraph-ai está disponible en la página oficial de PyPI: pypi.
pip install scrapegraphai
# IMPORTANT (for fetching websites content)
playwright install
Nota: se recomienda instalar la librería en un entorno virtual para evitar conflictos con otras librerías 🐱
💻 Uso
Hay múltiples pipelines de scraping estándar que se pueden usar para extraer información de un sitio web (o archivo local).
El más común es SmartScraperGraph, que extrae información de una sola página dado un prompt de usuario y una URL de origen.
from scrapegraphai.graphs import SmartScraperGraph
# Define the configuration for the scraping pipeline
graph_config = {
"llm": {
"model": "ollama/llama3.2",
"model_tokens": 8192,
"format": "json",
},
"verbose": True,
"headless": False,
}
# Create the SmartScraperGraph instance
smart_scraper_graph = SmartScraperGraph(
prompt="Extract useful information from the webpage, including a description of what the company does, founders and social media links",
source="https://scrapegraphai.com/",
config=graph_config
)
# Run the pipeline
result = smart_scraper_graph.run()
import json
print(json.dumps(result, indent=4))
[!NOTE] Para OpenAI y otros modelos solo necesitas cambiar la configuración del LLM!
graph_config = { "llm": { "api_key": "YOUR_OPENAI_API_KEY", "model": "openai/gpt-4o-mini", }, "verbose": True, "headless": False, }
La salida será un diccionario como el siguiente:
{
"description": "ScrapeGraphAI transforms websites into clean, organized data for AI agents and data analytics. It offers an AI-powered API for effortless and cost-effective data extraction.",
"founders": [
{
"name": "",
"role": "Founder & Technical Lead",
"linkedin": "https://www.linkedin.com/in/perinim/"
},
{
"name": "Marco Vinciguerra",
"role": "Founder & Software Engineer",
"linkedin": "https://www.linkedin.com/in/marco-vinciguerra-7ba365242/"
},
{
"name": "Lorenzo Padoan",
"role": "Founder & Product Engineer",
"linkedin": "https://www.linkedin.com/in/lorenzo-padoan-4521a2154/"
}
],
"social_media_links": {
"linkedin": "https://www.linkedin.com/company/101881123",
"twitter": "https://x.com/scrapegraphai",
"github": "https://github.com/ScrapeGraphAI/Scrapegraph-ai"
}
}
Hay otros pipelines que se pueden usar para extraer información de múltiples páginas, generar scripts de Python, o incluso generar archivos de audio.