Volver a actualizaciones
Nuevo releaseAug 19, 2026

Scrapegraph-ai v2.1.7

Scraper de Python basado en IA

Compartir

🚀 ¿Buscas una forma aún más rápida y sencilla de hacer scraping a escala (solo 5 líneas de código)? ¡Echa un vistazo a nuestra versión mejorada en ScrapeGraphAI.com! 🚀


🕷️ ScrapeGraphAI: Solo Scrapeas Una Vez

ScrapeGraphAI

English | 中文 | 日本語 | 한국어 | Русский | Türkçe | Deutsch | Español | français | Português | Italiano

PyPI Downloads

License: MIT

ScrapeGraphAI%2FScrapegraph-ai | Trendshift

ScrapeGraphAI es una librería de web scraping en Python que utiliza LLM y lógica de grafos directa para crear pipelines de scraping para sitios web y documentos locales (XML, HTML, JSON, Markdown, etc.).

¡Solo di qué información quieres extraer y la librería lo hará por ti!

🚀 Integraciones

ScrapeGraphAI ofrece una integración fluida con frameworks y herramientas populares para mejorar tus capacidades de scraping. Ya sea que estés construyendo con Python o Node.js, usando frameworks LLM, o trabajando con plataformas sin código, tenemos todo cubierto con nuestras opciones de integración integrales.

Web data extraction at scale? Try ScrapeGraphAI cloud

Puedes encontrar más información en el siguiente enlace

Integraciones:

🚀 Instalación rápida

La página de referencia de Scrapegraph-ai está disponible en la página oficial de PyPI: pypi.

pip install scrapegraphai

# IMPORTANT (for fetching websites content)
playwright install

Nota: se recomienda instalar la librería en un entorno virtual para evitar conflictos con otras librerías 🐱

💻 Uso

Hay múltiples pipelines de scraping estándar que se pueden usar para extraer información de un sitio web (o archivo local).

El más común es SmartScraperGraph, que extrae información de una sola página dado un prompt de usuario y una URL de origen.

from scrapegraphai.graphs import SmartScraperGraph

# Define the configuration for the scraping pipeline
graph_config = {
    "llm": {
        "model": "ollama/llama3.2",
        "model_tokens": 8192,
        "format": "json",
    },
    "verbose": True,
    "headless": False,
}

# Create the SmartScraperGraph instance
smart_scraper_graph = SmartScraperGraph(
    prompt="Extract useful information from the webpage, including a description of what the company does, founders and social media links",
    source="https://scrapegraphai.com/",
    config=graph_config
)

# Run the pipeline
result = smart_scraper_graph.run()

import json
print(json.dumps(result, indent=4))

[!NOTE] Para OpenAI y otros modelos solo necesitas cambiar la configuración del LLM!

graph_config = {
   "llm": {
       "api_key": "YOUR_OPENAI_API_KEY",
       "model": "openai/gpt-4o-mini",
   },
   "verbose": True,
   "headless": False,
}

La salida será un diccionario como el siguiente:

{
    "description": "ScrapeGraphAI transforms websites into clean, organized data for AI agents and data analytics. It offers an AI-powered API for effortless and cost-effective data extraction.",
    "founders": [
        {
            "name": "",
            "role": "Founder & Technical Lead",
            "linkedin": "https://www.linkedin.com/in/perinim/"
        },
        {
            "name": "Marco Vinciguerra",
            "role": "Founder & Software Engineer",
            "linkedin": "https://www.linkedin.com/in/marco-vinciguerra-7ba365242/"
        },
        {
            "name": "Lorenzo Padoan",
            "role": "Founder & Product Engineer",
            "linkedin": "https://www.linkedin.com/in/lorenzo-padoan-4521a2154/"
        }
    ],
    "social_media_links": {
        "linkedin": "https://www.linkedin.com/company/101881123",
        "twitter": "https://x.com/scrapegraphai",
        "github": "https://github.com/ScrapeGraphAI/Scrapegraph-ai"
    }
}

Hay otros pipelines que se pueden usar para extraer información de múltiples páginas, generar scripts de Python, o incluso generar archivos de audio.

Categorías