Skip to content
KitploitKITPLOIT
FerramentasBlog
Enviar
FerramentasBlog
Enviar

Ferramentas de Hacking, PenTest e Cibersegurança para o seu Arsenal de Segurança!

Kitploit é um diretório de ferramentas de hacking, cibersegurança e pentesting. Descubra as últimas atualizações de projetos para encontrar vulnerabilidades, analisar sistemas, automatizar testes e fortalecer sua segurança.

··Feeds·Contato·Privacidade·© 2026 Kitploit

Diretório de Ferramentas

Categorias

Ver todas as categorias
Loading categories
Scrapegraph-ai — Scraper em Python baseado em IA | Kitploit
Ferramentas/GitHubGitHub/scrapegraphai/scrapegraph-ai
OSINT (Inteligência de Fontes Abertas)Coleta de InformaçõesUtilitários e FrameworksAprendizado de MáquinaAprendizado e EducaçãoRastreadorSegurança de IA
GitHubscrapegraphai/scrapegraph-ai

Scrapegraph-ai

Scraper em Python baseado em IA

Ver Repositório
29.4k2.9khá 10h 38mRevisado pelo Kitploit

Mais Populares

Ver todos →

Descubra as ferramentas mais usadas pela nossa comunidade.

Explore todas as ferramentas

Navegue pela nossa coleção de ferramentas

Ver todas as ferramentas →
Compartilhar
Site

🚀 Procurando uma forma ainda mais rápida e simples de fazer scraping em escala (com apenas 5 linhas de código)? Confira nossa versão aprimorada em ScrapeGraphAI.com! 🚀


🕷️ ScrapeGraphAI: Você Só Faz Scraping Uma Vez

ScrapeGraphAI

English | 中文 | 日本語 | 한국어 | Русский | Türkçe | Deutsch | Español | français | Português | Italiano

PyPI Downloads

License: MIT

ScrapeGraphAI%2FScrapegraph-ai | Trendshift

ScrapeGraphAI é uma biblioteca Python de web scraping que usa LLM e lógica direta de grafos para criar pipelines de scraping para sites e documentos locais (XML, HTML, JSON, Markdown, etc.).

Basta dizer quais informações você deseja extrair e a biblioteca fará isso por você!

🚀 Integrações

O ScrapeGraphAI oferece integração perfeita com frameworks e ferramentas populares para aprimorar suas capacidades de scraping. Esteja você desenvolvendo com Python ou Node.js, usando frameworks de LLM ou trabalhando com plataformas no-code, temos tudo o que você precisa com nossas opções abrangentes de integração..

Extração de dados web em escala? Experimente a nuvem do ScrapeGraphAI

Você pode encontrar mais informações no seguinte link

Integrações:

  • API: Documentação
  • SDKs: Python, Node
  • Frameworks de LLM: Langchain, Llama Index, Crew.ai, Agno, CamelAI
  • Frameworks Low-code: Pipedream, Bubble, Zapier, n8n, Dify, Toolhouse
  • Servidor MCP: Link

🚀 Instalação rápida

A página de referência do Scrapegraph-ai está disponível na página oficial do PyPI: pypi.

root@kitploit:~
pip install scrapegraphai

# IMPORTANT (for fetching websites content)
playwright install

Nota: é recomendado instalar a biblioteca em um ambiente virtual para evitar conflitos com outras bibliotecas 🐱

💻 Uso

Existem vários pipelines de scraping padrão que podem ser usados para extrair informações de um site (ou arquivo local).

O mais comum é o SmartScraperGraph, que extrai informações de uma única página com base em um prompt do usuário e uma URL de origem.

root@kitploit:~
from scrapegraphai.graphs import SmartScraperGraph

# Define the configuration for the scraping pipeline
graph_config = {
    "llm": {
        "model": "ollama/llama3.2",
        "model_tokens": 8192,
        "format": "json",
    },
    "verbose": True,
    "headless": False,
}

# Create the SmartScraperGraph instance
smart_scraper_graph = SmartScraperGraph(
    prompt="Extract useful information from the webpage, including a description of what the company does, founders and social media links",
    source="https://scrapegraphai.com/",
    config=graph_config
)

# Run the pipeline
result = smart_scraper_graph.run()

import json
print(json.dumps(result, indent=4))

[!NOTE] Para modelos OpenAI e outros, basta alterar a configuração do LLM!

root@kitploit:~
graph_config = {
   "llm": {
       "api_key": "YOUR_OPENAI_API_KEY",
       "model": "openai/gpt-4o-mini",
   },
   "verbose": True,
   "headless": False,
}

A saída será um dicionário como o seguinte:

root@kitploit:~
{
    "description": "ScrapeGraphAI transforms websites into clean, organized data for AI agents and data analytics. It offers an AI-powered API for effortless and cost-effective data extraction.",
    "founders": [
        {
            "name": "",
            "role": "Founder & Technical Lead",
            "linkedin": "https://www.linkedin.com/in/perinim/"
        },
        {
            "name": "Marco Vinciguerra",
            "role": "Founder & Software Engineer",
            "linkedin": "https://www.linkedin.com/in/marco-vinciguerra-7ba365242/"
        },
        {
            "name": "Lorenzo Padoan",
            "role": "Founder & Product Engineer",
            "linkedin": "https://www.linkedin.com/in/lorenzo-padoan-4521a2154/"
        }
    ],
    "social_media_links": {
        "linkedin": "https://www.linkedin.com/company/101881123",
        "twitter": "https://x.com/scrapegraphai",
        "github": "https://github.com/ScrapeGraphAI/Scrapegraph-ai"
    }
}

Existem outros pipelines que podem ser usados para extrair informações de múltiplas páginas, gerar scripts Python ou até mesmo gerar arquivos de áudio.

Para cada um desses grafos existe a versão multi. Ela permite fazer chamadas do LLM em paralelo.

É possível usar diferentes LLMs por meio de APIs, como OpenAI, Groq, Azure, Gemini, MiniMax e outras, ou modelos locais usando Ollama.

Lembre-se de ter o Ollama instalado e baixar os modelos usando o comando ollama pull, se quiser usar modelos locais.

📖 Documentação

Open In Colab

A documentação do ScrapeGraphAI pode ser encontrada aqui.

🆚 Open Source vs API Gerenciada

O ScrapeGraphAI vem em duas versões: esta biblioteca de código aberto, que você mesmo executa, e a API de nuvem gerenciada (usada por meio dos SDKs Python e JS/TS). Esta tabela explica a diferença para que você possa escolher a opção certa.

Escolha a biblioteca de código aberto se você quiser controle total, dados on-premise/self-hosted, LLMs locais (Ollama) ou ajuste fino de custos — e estiver disposto a gerenciar navegadores, proxies e escala por conta própria.

Escolha a API gerenciada se você quiser infraestrutura zero, renderização de JS gerenciada e anti-bot, tarefas integradas de Crawl e Monitor agendadas, e o caminho mais rápido para produção — cobrado por crédito.

  • Biblioteca de código aberto: https://github.com/ScrapeGraphAI/Scrapegraph-ai
  • SDK Python: https://github.com/ScrapeGraphAI/scrapegraph-py
  • SDK JS/TS: https://github.com/ScrapeGraphAI/scrapegraph-js
  • Documentação da API: https://docs.scrapegraphai.com/introduction

🤝 Contribuindo

Sinta-se à vontade para contribuir e entre no nosso servidor do Discord para discutir melhorias conosco e nos dar sugestões!

Por favor, consulte as diretrizes de contribuição.

My Skills My Skills My Skills

🔗 API e SDKs do ScrapeGraph

Se você procura uma solução rápida para integrar o ScrapeGraph ao seu sistema, confira nossa poderosa API aqui!

Banner da API

Oferecemos SDKs em Python e Node.js, facilitando a integração em seus projetos. Confira abaixo:

SDKLinguagemLink do GitHub
SDK PythonPythonscrapegraph-py
SDK Node.jsNode.jsscrapegraph-js

A Documentação Oficial da API pode ser encontrada aqui.

📈 Telemetria

Coletamos métricas de uso anônimas para melhorar a qualidade e a experiência do usuário do nosso pacote. Os dados nos ajudam a priorizar melhorias e garantir compatibilidade. Se desejar não participar, defina a variável de ambiente SCRAPEGRAPHAI_TELEMETRY_ENABLED=false. Para mais informações, consulte a documentação aqui.

❤️ Contribuidores

Contributors

🎓 Citações

Se você usou nossa biblioteca para fins de pesquisa, por favor cite-nos com a seguinte referência:

root@kitploit:~
  @misc{scrapegraph-ai,
    author = {Lorenzo Padoan, Marco Vinciguerra},
    title = {Scrapegraph-ai},
    year = {2024},
    url = {https://github.com/ScrapeGraphAI/Scrapegraph-ai},
    note = {A Python library for scraping leveraging large language models}
  }

Autores

Informações de Contato
Marco VinciguerraLinkedin Badge
Lorenzo PadoanLinkedin Badge

📜 Licença

O ScrapeGraphAI é licenciado sob a Licença MIT. Consulte o arquivo LICENSE para mais informações.

Agradecimentos

  • Gostaríamos de agradecer a todos os contribuidores do projeto e à comunidade de código aberto pelo apoio.
  • O ScrapeGraphAI destina-se apenas a fins de exploração de dados e pesquisa. Não somos responsáveis por qualquer uso indevido da biblioteca.

Feito com ❤️ por ScrapeGraph AI

Scarf tracking

Baixar ferramenta
Pipeline NameDescription
SmartScraperGraphScraper de página única que precisa apenas de um prompt do usuário e uma fonte de entrada.
SearchGraphScraper de várias páginas que extrai informações dos primeiros n resultados de busca de um mecanismo de pesquisa.
SpeechGraphScraper de página única que extrai informações de um site e gera um arquivo de áudio.
ScriptCreatorGraphScraper de página única que extrai informações de um site e gera um script Python.
SmartScraperMultiGraphScraper de várias páginas que extrai informações de múltiplas páginas a partir de um único prompt e uma lista de fontes.
ScriptCreatorMultiGraphScraper de várias páginas que gera um script Python para extrair informações de múltiplas páginas e fontes.
Open Source (scrapegraphai)API Gerenciada (scrapegraph-py / scrapegraph-js)
O que éUma biblioteca Python que você mesmo executaUm serviço de nuvem hospedado que você chama via SDK
Onde é executadoSua própria infraestrutura (self-hosted)Nuvem do ScrapeGraphAI
LLMTraga o seu (OpenAI, Groq, Gemini, Azure, local via Ollama)Gerenciado para você
Renderização de Browser / JSVocê configura (Playwright)Gerenciada (modos stealth, auto/fast/js)
Proxies e anti-botSua responsabilidadeIncluídos
Escala e manutençãoSua responsabilidadeTotalmente gerenciadas
Modelo de custoTokens de LLM + sua própria infraestruturaCréditos pagos conforme o uso
AutenticaçãoSuas próprias chaves de LLMSGAI_API_KEY
RecursosPipelines de grafo (SmartScraper, Search, Speech, ScriptCreator…)Scrape, Extract, Search, Crawl, Monitor, History
Esforço de configuraçãoMais configuraçãoMínimo — chave de API + uma chamada
LicençaMITO SDK é MIT; o serviço de API é pago