Voltar às atualizações
New releaseAug 19, 2026

Scrapegraph-ai v2.1.7

Scraper em Python baseado em IA

Compartilhar

🚀 Procurando uma forma ainda mais rápida e simples de fazer scraping em escala (com apenas 5 linhas de código)? Confira nossa versão aprimorada em ScrapeGraphAI.com! 🚀


🕷️ ScrapeGraphAI: Você Só Faz Scraping Uma Vez

ScrapeGraphAI

English | 中文 | 日本語 | 한국어 | Русский | Türkçe | Deutsch | Español | français | Português | Italiano

PyPI Downloads

License: MIT

ScrapeGraphAI%2FScrapegraph-ai | Trendshift

ScrapeGraphAI é uma biblioteca Python de web scraping que usa LLM e lógica direta de grafos para criar pipelines de scraping para sites e documentos locais (XML, HTML, JSON, Markdown, etc.).

Basta dizer quais informações você deseja extrair e a biblioteca fará isso por você!

🚀 Integrações

O ScrapeGraphAI oferece integração perfeita com frameworks e ferramentas populares para aprimorar suas capacidades de scraping. Esteja você desenvolvendo com Python ou Node.js, usando frameworks de LLM ou trabalhando com plataformas no-code, temos tudo o que você precisa com nossas opções abrangentes de integração..

Extração de dados web em escala? Experimente a nuvem do ScrapeGraphAI

Você pode encontrar mais informações no seguinte link

Integrações:

🚀 Instalação rápida

A página de referência do Scrapegraph-ai está disponível na página oficial do PyPI: pypi.

pip install scrapegraphai

# IMPORTANT (for fetching websites content)
playwright install

Nota: é recomendado instalar a biblioteca em um ambiente virtual para evitar conflitos com outras bibliotecas 🐱

💻 Uso

Existem vários pipelines de scraping padrão que podem ser usados para extrair informações de um site (ou arquivo local).

O mais comum é o SmartScraperGraph, que extrai informações de uma única página com base em um prompt do usuário e uma URL de origem.

from scrapegraphai.graphs import SmartScraperGraph

# Define the configuration for the scraping pipeline
graph_config = {
    "llm": {
        "model": "ollama/llama3.2",
        "model_tokens": 8192,
        "format": "json",
    },
    "verbose": True,
    "headless": False,
}

# Create the SmartScraperGraph instance
smart_scraper_graph = SmartScraperGraph(
    prompt="Extract useful information from the webpage, including a description of what the company does, founders and social media links",
    source="https://scrapegraphai.com/",
    config=graph_config
)

# Run the pipeline
result = smart_scraper_graph.run()

import json
print(json.dumps(result, indent=4))

[!NOTE] Para modelos OpenAI e outros, basta alterar a configuração do LLM!

graph_config = {
   "llm": {
       "api_key": "YOUR_OPENAI_API_KEY",
       "model": "openai/gpt-4o-mini",
   },
   "verbose": True,
   "headless": False,
}

A saída será um dicionário como o seguinte:

{
    "description": "ScrapeGraphAI transforms websites into clean, organized data for AI agents and data analytics. It offers an AI-powered API for effortless and cost-effective data extraction.",
    "founders": [
        {
            "name": "",
            "role": "Founder & Technical Lead",
            "linkedin": "https://www.linkedin.com/in/perinim/"
        },
        {
            "name": "Marco Vinciguerra",
            "role": "Founder & Software Engineer",
            "linkedin": "https://www.linkedin.com/in/marco-vinciguerra-7ba365242/"
        },
        {
            "name": "Lorenzo Padoan",
            "role": "Founder & Product Engineer",
            "linkedin": "https://www.linkedin.com/in/lorenzo-padoan-4521a2154/"
        }
    ],
    "social_media_links": {
        "linkedin": "https://www.linkedin.com/company/101881123",
        "twitter": "https://x.com/scrapegraphai",
        "github": "https://github.com/ScrapeGraphAI/Scrapegraph-ai"
    }
}

Existem outros pipelines que podem ser usados para extrair informações de múltiplas páginas, gerar scripts Python ou até mesmo gerar arquivos de áudio.

Pipeline NameDescription
SmartScraperGraphScraper de página única que precisa apenas de um prompt do usuário e uma fonte de entrada.
SearchGraphScraper de várias páginas que extrai informações dos primeiros n resultados de busca de um mecanismo de pesquisa.
SpeechGraphScraper de página única que extrai informações de um site e gera um arquivo de áudio.
ScriptCreatorGraphScraper de página única que extrai informações de um site e gera um script Python.
SmartScraperMultiGraphScraper de várias páginas que extrai informações de múltiplas páginas a partir de um único prompt e uma lista de fontes.
ScriptCreatorMultiGraphScraper de várias páginas que gera um script Python para extrair informações de múltiplas páginas e fontes.

Para cada um desses grafos existe a versão multi. Ela permite fazer chamadas do LLM em paralelo.

É possível usar diferentes LLMs por meio de APIs, como OpenAI, Groq, Azure, Gemini, MiniMax e outras, ou modelos locais usando Ollama.

Lembre-se de ter o Ollama instalado e baixar os modelos usando o comando ollama pull, se quiser usar modelos locais.

📖 Documentação

Open In Colab

A documentação do ScrapeGraphAI pode ser encontrada aqui.

🆚 Open Source vs API Gerenciada

O ScrapeGraphAI vem em duas versões: esta biblioteca de código aberto, que você mesmo executa, e a API de nuvem gerenciada (usada por meio dos SDKs Python e JS/TS). Esta tabela explica a diferença para que você possa escolher a opção certa.

Open Source (scrapegraphai)API Gerenciada (scrapegraph-py / scrapegraph-js)
O que éUma biblioteca Python que você mesmo executaUm serviço de nuvem hospedado que você chama via SDK
Onde é executadoSua própria infraestrutura (self-hosted)Nuvem do ScrapeGraphAI
LLMTraga o seu (OpenAI, Groq, Gemini, Azure, local via Ollama)Gerenciado para você
Renderização de Browser / JSVocê configura (Playwright)Gerenciada (modos stealth, auto/fast/js)
Proxies e anti-botSua responsabilidadeIncluídos
Escala e manutençãoSua responsabilidadeTotalmente gerenciadas
Modelo de custoTokens de LLM + sua própria infraestruturaCréditos pagos conforme o uso
AutenticaçãoSuas próprias chaves de LLMSGAI_API_KEY
RecursosPipelines de grafo (SmartScraper, Search, Speech, ScriptCreator…)Scrape, Extract, Search, Crawl, Monitor, History
Esforço de configuraçãoMais configuraçãoMínimo — chave de API + uma chamada
LicençaMITO SDK é MIT; o serviço de API é pago

Escolha a biblioteca de código aberto se você quiser controle total, dados on-premise/self-hosted, LLMs locais (Ollama) ou ajuste fino de custos — e estiver disposto a gerenciar navegadores, proxies e escala por conta própria.

Escolha a API gerenciada se você quiser infraestrutura zero, renderização de JS gerenciada e anti-bot, tarefas integradas de Crawl e Monitor agendadas, e o caminho mais rápido para produção — cobrado por crédito.

🤝 Contribuindo

Sinta-se à vontade para contribuir e entre no nosso servidor do Discord para discutir melhorias conosco e nos dar sugestões!

Por favor, consulte as diretrizes de contribuição.

My Skills My Skills My Skills

🔗 API e SDKs do ScrapeGraph

Se você procura uma solução rápida para integrar o ScrapeGraph ao seu sistema, confira nossa poderosa API aqui!

Banner da API

Oferecemos SDKs em Python e Node.js, facilitando a integração em seus projetos. Confira abaixo:

SDKLinguagemLink do GitHub
SDK PythonPythonscrapegraph-py
SDK Node.jsNode.jsscrapegraph-js

A Documentação Oficial da API pode ser encontrada aqui.

📈 Telemetria

Coletamos métricas de uso anônimas para melhorar a qualidade e a experiência do usuário do nosso pacote. Os dados nos ajudam a priorizar melhorias e garantir compatibilidade. Se desejar não participar, defina a variável de ambiente SCRAPEGRAPHAI_TELEMETRY_ENABLED=false. Para mais informações, consulte a documentação aqui.

❤️ Contribuidores

Contributors

🎓 Citações

Se você usou nossa biblioteca para fins de pesquisa, por favor cite-nos com a seguinte referência:

  @misc{scrapegraph-ai,
    author = {Lorenzo Padoan, Marco Vinciguerra},
    title = {Scrapegraph-ai},
    year = {2024},
    url = {https://github.com/ScrapeGraphAI/Scrapegraph-ai},
    note = {A Python library for scraping leveraging large language models}
  }

Autores

Informações de Contato
Marco VinciguerraLinkedin Badge
Lorenzo PadoanLinkedin Badge

📜 Licença

O ScrapeGraphAI é licenciado sob a Licença MIT. Consulte o arquivo LICENSE para mais informações.

Agradecimentos

  • Gostaríamos de agradecer a todos os contribuidores do projeto e à comunidade de código aberto pelo apoio.
  • O ScrapeGraphAI destina-se apenas a fins de exploração de dados e pesquisa. Não somos responsáveis por qualquer uso indevido da biblioteca.

Feito com ❤️ por ScrapeGraph AI

Scarf tracking

Categorias