Skip to content
KitploitKITPLOIT
HerramientasBlog
Enviar
HerramientasBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

··Feeds·Contacto·Privacidad·© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
Scrapegraph-ai — Scraper de Python basado en IA | Kitploit
Herramientas/GitHubGitHub/scrapegraphai/scrapegraph-ai
OSINT (Inteligencia de Fuentes Abiertas)Recopilación de InformaciónUtilidades y FrameworksAprendizaje AutomáticoAprendizaje y EducaciónCrawlerSeguridad de IA
GitHubscrapegraphai/scrapegraph-ai

Scrapegraph-ai

Scraper de Python basado en IA

Ver Repositorio
29.4k2.9khace 10h 38mRevisado por Kitploit

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →
Compartir
Sitio web

🚀 ¿Buscas una forma aún más rápida y sencilla de hacer scraping a escala (solo 5 líneas de código)? ¡Echa un vistazo a nuestra versión mejorada en ScrapeGraphAI.com! 🚀


🕷️ ScrapeGraphAI: Solo Scrapeas Una Vez

ScrapeGraphAI

English | 中文 | 日本語 | 한국어 | Русский | Türkçe | Deutsch | Español | français | Português | Italiano

PyPI Downloads

License: MIT

ScrapeGraphAI%2FScrapegraph-ai | Trendshift

ScrapeGraphAI es una librería de web scraping en Python que utiliza LLM y lógica de grafos directa para crear pipelines de scraping para sitios web y documentos locales (XML, HTML, JSON, Markdown, etc.).

¡Solo di qué información quieres extraer y la librería lo hará por ti!

🚀 Integraciones

ScrapeGraphAI ofrece una integración fluida con frameworks y herramientas populares para mejorar tus capacidades de scraping. Ya sea que estés construyendo con Python o Node.js, usando frameworks LLM, o trabajando con plataformas sin código, tenemos todo cubierto con nuestras opciones de integración integrales.

Web data extraction at scale? Try ScrapeGraphAI cloud

Puedes encontrar más información en el siguiente enlace

Integraciones:

  • API: Documentación
  • SDKs: Python, Node
  • Frameworks LLM: Langchain, Llama Index, Crew.ai, Agno, CamelAI
  • Frameworks Low-code: Pipedream, Bubble, Zapier, n8n, Dify, Toolhouse
  • Servidor MCP: Enlace

🚀 Instalación rápida

La página de referencia de Scrapegraph-ai está disponible en la página oficial de PyPI: pypi.

root@kitploit:~
pip install scrapegraphai

# IMPORTANT (for fetching websites content)
playwright install

Nota: se recomienda instalar la librería en un entorno virtual para evitar conflictos con otras librerías 🐱

💻 Uso

Hay múltiples pipelines de scraping estándar que se pueden usar para extraer información de un sitio web (o archivo local).

El más común es SmartScraperGraph, que extrae información de una sola página dado un prompt de usuario y una URL de origen.

root@kitploit:~
from scrapegraphai.graphs import SmartScraperGraph

# Define the configuration for the scraping pipeline
graph_config = {
    "llm": {
        "model": "ollama/llama3.2",
        "model_tokens": 8192,
        "format": "json",
    },
    "verbose": True,
    "headless": False,
}

# Create the SmartScraperGraph instance
smart_scraper_graph = SmartScraperGraph(
    prompt="Extract useful information from the webpage, including a description of what the company does, founders and social media links",
    source="https://scrapegraphai.com/",
    config=graph_config
)

# Run the pipeline
result = smart_scraper_graph.run()

import json
print(json.dumps(result, indent=4))

[!NOTE] Para OpenAI y otros modelos solo necesitas cambiar la configuración del LLM!

root@kitploit:~
graph_config = {
   "llm": {
       "api_key": "YOUR_OPENAI_API_KEY",
       "model": "openai/gpt-4o-mini",
   },
   "verbose": True,
   "headless": False,
}

La salida será un diccionario como el siguiente:

root@kitploit:~
{
    "description": "ScrapeGraphAI transforms websites into clean, organized data for AI agents and data analytics. It offers an AI-powered API for effortless and cost-effective data extraction.",
    "founders": [
        {
            "name": "",
            "role": "Founder & Technical Lead",
            "linkedin": "https://www.linkedin.com/in/perinim/"
        },
        {
            "name": "Marco Vinciguerra",
            "role": "Founder & Software Engineer",
            "linkedin": "https://www.linkedin.com/in/marco-vinciguerra-7ba365242/"
        },
        {
            "name": "Lorenzo Padoan",
            "role": "Founder & Product Engineer",
            "linkedin": "https://www.linkedin.com/in/lorenzo-padoan-4521a2154/"
        }
    ],
    "social_media_links": {
        "linkedin": "https://www.linkedin.com/company/101881123",
        "twitter": "https://x.com/scrapegraphai",
        "github": "https://github.com/ScrapeGraphAI/Scrapegraph-ai"
    }
}

Hay otros pipelines que se pueden usar para extraer información de múltiples páginas, generar scripts de Python, o incluso generar archivos de audio.

Para cada uno de estos grafos existe la versión multi. Permite hacer llamadas al LLM en paralelo.

Es posible usar diferentes LLM a través de APIs, como OpenAI, Groq, Azure, Gemini, MiniMax y más, o modelos locales usando Ollama.

Recuerda tener Ollama instalado y descargar los modelos usando el comando ollama pull, si quieres usar modelos locales.

📖 Documentación

Open In Colab

La documentación de ScrapeGraphAI se puede encontrar aquí.

🆚 Código Abierto vs API Gestionada

ScrapeGraphAI viene en dos sabores: esta librería de código abierto, que ejecutas tú mismo, y la API gestionada en la nube (usada a través de los SDKs de Python y JS/TS). Esta tabla explica la diferencia para que puedas elegir la correcta.

Elige la librería de código abierto si quieres control total, datos on-premise/auto-alojados, LLMs locales (Ollama), o ajuste de costes detallado — y estás dispuesto a gestionar navegadores, proxies y escalado tú mismo.

Elige la API gestionada si quieres infraestructura cero, renderizado JS y anti-bot gestionados, trabajos integrados de Crawl y Monitor programados, y el camino más rápido a producción — facturado por crédito.

  • Librería de código abierto: https://github.com/ScrapeGraphAI/Scrapegraph-ai
  • SDK Python: https://github.com/ScrapeGraphAI/scrapegraph-py
  • SDK JS/TS: https://github.com/ScrapeGraphAI/scrapegraph-js
  • Documentación de la API: https://docs.scrapegraphai.com/introduction

🤝 Contribuciones

¡Siéntete libre de contribuir y únete a nuestro servidor de Discord para discutir con nosotros mejoras y darnos sugerencias!

Por favor, consulta las guías de contribución.

My Skills My Skills My Skills

🔗 API y SDKs de ScrapeGraph

Si buscas una solución rápida para integrar ScrapeGraph en tu sistema, ¡echa un vistazo a nuestra potente API aquí!

API Banner

Ofrecemos SDKs tanto en Python como en Node.js, facilitando la integración en tus proyectos. Míralos a continuación:

SDKLenguajeEnlace de GitHub
Python SDKPythonscrapegraph-py
Node.js SDKNode.jsscrapegraph-js

La Documentación Oficial de la API se puede encontrar aquí.

📈 Telemetría

Recopilamos métricas de uso anónimas para mejorar la calidad y experiencia de usuario de nuestro paquete. Los datos nos ayudan a priorizar mejoras y garantizar la compatibilidad. Si deseas optar por no participar, establece la variable de entorno SCRAPEGRAPHAI_TELEMETRY_ENABLED=false. Para más información, consulta la documentación aquí.

❤️ Contribuyentes

Contributors

🎓 Citas

Si has usado nuestra librería con fines de investigación, por favor cítanos con la siguiente referencia:

root@kitploit:~
  @misc{scrapegraph-ai,
    author = {Lorenzo Padoan, Marco Vinciguerra},
    title = {Scrapegraph-ai},
    year = {2024},
    url = {https://github.com/ScrapeGraphAI/Scrapegraph-ai},
    note = {A Python library for scraping leveraging large language models}
  }

Autores

Información de Contacto
Marco VinciguerraLinkedin Badge
Lorenzo PadoanLinkedin Badge

📜 Licencia

ScrapeGraphAI está licenciado bajo la Licencia MIT. Consulta el archivo LICENSE para más información.

Agradecimientos

  • Nos gustaría agradecer a todos los contribuyentes del proyecto y a la comunidad de código abierto por su apoyo.
  • ScrapeGraphAI está destinado a ser usado solo para fines de exploración de datos e investigación. No somos responsables de ningún uso indebido de la librería.

Hecho con ❤️ por ScrapeGraph AI

Scarf tracking

Descargar herramienta
Nombre del PipelineDescripción
SmartScraperGraphScraper de una sola página que solo necesita un prompt de usuario y una fuente de entrada.
SearchGraphScraper de múltiples páginas que extrae información de los primeros n resultados de búsqueda de un motor de búsqueda.
SpeechGraphScraper de una sola página que extrae información de un sitio web y genera un archivo de audio.
ScriptCreatorGraphScraper de una sola página que extrae información de un sitio web y genera un script de Python.
SmartScraperMultiGraphScraper de múltiples páginas que extrae información de varias páginas dado un solo prompt y una lista de fuentes.
ScriptCreatorMultiGraphScraper de múltiples páginas que genera un script de Python para extraer información de varias páginas y fuentes.
Código Abierto (scrapegraphai)API Gestionada (scrapegraph-py / scrapegraph-js)
Qué esUna librería de Python que ejecutas tú mismoUn servicio cloud alojado al que llamas vía SDK
Dónde se ejecutaTu propia infraestructura (auto-alojado)Nube de ScrapeGraphAI
LLMTrae el tuyo propio (OpenAI, Groq, Gemini, Azure, local vía Ollama)Gestionado por nosotros
Renderizado de navegador/JSTú lo configuras (Playwright)Gestionado (modos stealth, auto/fast/js)
Proxies y anti-botTu responsabilidadIncluido
Escalado y mantenimientoTu responsabilidadTotalmente gestionado
Modelo de costeTokens LLM + tu propia infraCréditos de pago por uso
AutenticaciónTus propias claves LLMSGAI_API_KEY
CapacidadesPipelines de grafo (SmartScraper, Search, Speech, ScriptCreator…)Scrape, Extract, Search, Crawl, Monitor, History
Esfuerzo de configuraciónMás configuraciónMínimo — clave API + una llamada
LicenciaMITEl SDK es MIT; el servicio API es de pago