
Scraper Python basato sull'AI
English | 中文 | 日本語 | 한국어 | Русский | Türkçe | Deutsch | Español | français | Português | Italiano
ScrapeGraphAI è una libreria Python per il web scraping che utilizza LLM e logica a grafi diretti per creare pipeline di scraping per siti web e documenti locali (XML, HTML, JSON, Markdown, ecc.).
Dì semplicemente quali informazioni vuoi estrarre e la libreria lo farà per te!
ScrapeGraphAI offre un'integrazione perfetta con framework e strumenti popolari per potenziare le tue capacità di scraping. Che tu stia sviluppando con Python o Node.js, utilizzando framework LLM o lavorando con piattaforme no-code, abbiamo ciò che fa per te con le nostre opzioni di integrazione complete.
Puoi trovare maggiori informazioni al seguente link
Integrazioni:
La pagina di riferimento per Scrapegraph-ai è disponibile sulla pagina ufficiale di PyPI: pypi.
pip install scrapegraphai
# IMPORTANT (for fetching websites content)
playwright install
Nota: si consiglia di installare la libreria in un ambiente virtuale per evitare conflitti con altre librerie 🐱
Esistono diverse pipeline di scraping standard che possono essere utilizzate per estrarre informazioni da un sito web (o da un file locale).
La più comune è SmartScraperGraph, che estrae informazioni da una singola pagina a partire da un prompt dell'utente e da un URL di origine.
from scrapegraphai.graphs import SmartScraperGraph
# Define the configuration for the scraping pipeline
graph_config = {
"llm": {
"model": "ollama/llama3.2",
"model_tokens": 8192,
"format": "json",
},
"verbose": True,
"headless": False,
}
# Create the SmartScraperGraph instance
smart_scraper_graph = SmartScraperGraph(
prompt="Extract useful information from the webpage, including a description of what the company does, founders and social media links",
source="https://scrapegraphai.com/",
config=graph_config
)
# Run the pipeline
result = smart_scraper_graph.run()
import json
print(json.dumps(result, indent=4))
[!NOTE] Per i modelli OpenAI e altri ti basta modificare la configurazione dell'LLM!
graph_config = { "llm": { "api_key": "YOUR_OPENAI_API_KEY", "model": "openai/gpt-4o-mini", }, "verbose": True, "headless": False, }
L'output sarà un dizionario come il seguente:
{
"description": "ScrapeGraphAI transforms websites into clean, organized data for AI agents and data analytics. It offers an AI-powered API for effortless and cost-effective data extraction.",
"founders": [
{
"name": "",
"role": "Founder & Technical Lead",
"linkedin": "https://www.linkedin.com/in/perinim/"
},
{
"name": "Marco Vinciguerra",
"role": "Founder & Software Engineer",
"linkedin": "https://www.linkedin.com/in/marco-vinciguerra-7ba365242/"
},
{
"name": "Lorenzo Padoan",
"role": "Founder & Product Engineer",
"linkedin": "https://www.linkedin.com/in/lorenzo-padoan-4521a2154/"
}
],
"social_media_links": {
"linkedin": "https://www.linkedin.com/company/101881123",
"twitter": "https://x.com/scrapegraphai",
"github": "https://github.com/ScrapeGraphAI/Scrapegraph-ai"
}
}
Esistono altre pipeline che possono essere utilizzate per estrarre informazioni da più pagine, generare script Python o persino generare file audio.
Per ciascuno di questi grafi esiste la versione multi. Consente di effettuare chiamate all'LLM in parallelo.
È possibile utilizzare diversi LLM tramite API, come OpenAI, Groq, Azure, Gemini, MiniMax e altri, oppure modelli locali usando Ollama.
Ricorda di avere Ollama installato e di scaricare i modelli usando il comando ollama pull, se vuoi utilizzare modelli locali.
La documentazione per ScrapeGraphAI può essere trovata qui.
ScrapeGraphAI è disponibile in due versioni: questa libreria open-source, che esegui tu stesso, e l'API cloud gestita (utilizzata tramite gli SDK Python e JS/TS). Questa tabella spiega la differenza così puoi scegliere quella giusta.
Scegli la libreria open-source se vuoi il pieno controllo, dati on-prem/self-hosted, LLM locali (Ollama) o un'ottimizzazione granulare dei costi — e sei disposto a gestire browser, proxy e scalabilità da solo.
Scegli l'API gestita se vuoi zero infrastruttura, rendering JS gestito e anti-bot, job Crawl e Monitor programmati integrati e il percorso più rapido verso la produzione — fatturata a crediti.
Sentiti libero di contribuire e unisciti al nostro server Discord per discutere con noi miglioramenti e darci suggerimenti!
Consulta le linee guida per contribuire.
Se stai cercando una soluzione rapida per integrare ScrapeGraph nel tuo sistema, dai un'occhiata alla nostra potente API qui!
Offriamo SDK sia in Python che in Node.js, per facilitare l'integrazione nei tuoi progetti. Dai un'occhiata qui sotto:
| SDK | Linguaggio | Collegamento GitHub |
|---|---|---|
| SDK Python | Python | scrapegraph-py |
| SDK Node.js | Node.js | scrapegraph-js |
La documentazione API ufficiale può essere trovata qui.
Raccogliamo metriche di utilizzo anonime per migliorare la qualità del nostro pacchetto e l'esperienza utente. I dati ci aiutano a dare priorità ai miglioramenti e a garantire la compatibilità. Se desideri disattivare la raccolta, imposta la variabile d'ambiente SCRAPEGRAPHAI_TELEMETRY_ENABLED=false. Per maggiori informazioni, consulta la documentazione qui.
Se hai utilizzato la nostra libreria per scopi di ricerca, citaci con il seguente riferimento:
@misc{scrapegraph-ai,
author = {Lorenzo Padoan, Marco Vinciguerra},
title = {Scrapegraph-ai},
year = {2024},
url = {https://github.com/ScrapeGraphAI/Scrapegraph-ai},
note = {A Python library for scraping leveraging large language models}
}
ScrapeGraphAI è distribuita sotto la licenza MIT. Consulta il file LICENSE per maggiori informazioni.
Fatto con ❤️ da ScrapeGraph AI
| Nome pipeline | Descrizione |
|---|
| SmartScraperGraph | Scraper a pagina singola che richiede solo un prompt dell'utente e una sorgente di input. |
| SearchGraph | Scraper multipagina che estrae informazioni dai primi n risultati di ricerca di un motore di ricerca. |
| SpeechGraph | Scraper a pagina singola che estrae informazioni da un sito web e genera un file audio. |
| ScriptCreatorGraph | Scraper a pagina singola che estrae informazioni da un sito web e genera uno script Python. |
| SmartScraperMultiGraph | Scraper multipagina che estrae informazioni da più pagine a partire da un singolo prompt e un elenco di sorgenti. |
| ScriptCreatorMultiGraph | Scraper multipagina che genera uno script Python per estrarre informazioni da più pagine e sorgenti. |
Open Source (scrapegraphai) | API gestita (scrapegraph-py / scrapegraph-js) |
|---|
| Cos'è | Una libreria Python che esegui tu stesso | Un servizio cloud ospitato che chiami tramite SDK |
| Dove viene eseguito | La tua infrastruttura (self-hosted) | Cloud di ScrapeGraphAI |
| LLM | Porta il tuo (OpenAI, Groq, Gemini, Azure, locale tramite Ollama) | Gestito per te |
| Rendering browser / JS | Lo configuri tu (Playwright) | Gestito (stealth, modalità auto/fast/js) |
| Proxy e anti-bot | A tuo carico | Inclusi |
| Scalabilità e manutenzione | A tuo carico | Completamente gestite |
| Modello di costo | Token LLM + la tua infrastruttura | Crediti a consumo |
| Autenticazione | Le tue chiavi LLM | SGAI_API_KEY |
| Funzionalità | Pipeline a grafo (SmartScraper, Search, Speech, ScriptCreator…) | Scrape, Extract, Search, Crawl, Monitor, History |
| Sforzo di configurazione | Più configurazione | Minimo — chiave API + una chiamata |
| Licenza | MIT | L'SDK è MIT; il servizio API è a pagamento |