
Scrapegraph-ai v2.1.7
Scraper Python basato sull'AI
🚀 Cerchi un modo ancora più veloce e semplice per fare scraping su larga scala (con solo 5 righe di codice)? Dai un'occhiata alla nostra versione avanzata su ScrapeGraphAI.com! 🚀
🕷️ ScrapeGraphAI: fai scraping una sola volta
English | 中文 | 日本語 | 한국어 | Русский | Türkçe | Deutsch | Español | français | Português | Italiano
ScrapeGraphAI è una libreria Python per il web scraping che utilizza LLM e logica a grafi diretti per creare pipeline di scraping per siti web e documenti locali (XML, HTML, JSON, Markdown, ecc.).
Dì semplicemente quali informazioni vuoi estrarre e la libreria lo farà per te!
🚀 Integrazioni
ScrapeGraphAI offre un'integrazione perfetta con framework e strumenti popolari per potenziare le tue capacità di scraping. Che tu stia sviluppando con Python o Node.js, utilizzando framework LLM o lavorando con piattaforme no-code, abbiamo ciò che fa per te con le nostre opzioni di integrazione complete.
Puoi trovare maggiori informazioni al seguente link
Integrazioni:
- API: Documentazione
- SDK: Python, Node
- Framework LLM: Langchain, Llama Index, Crew.ai, Agno, CamelAI
- Framework Low-code: Pipedream, Bubble, Zapier, n8n, Dify, Toolhouse
- Server MCP: Collegamento
🚀 Installazione rapida
La pagina di riferimento per Scrapegraph-ai è disponibile sulla pagina ufficiale di PyPI: pypi.
pip install scrapegraphai
# IMPORTANT (for fetching websites content)
playwright install
Nota: si consiglia di installare la libreria in un ambiente virtuale per evitare conflitti con altre librerie 🐱
💻 Utilizzo
Esistono diverse pipeline di scraping standard che possono essere utilizzate per estrarre informazioni da un sito web (o da un file locale).
La più comune è SmartScraperGraph, che estrae informazioni da una singola pagina a partire da un prompt dell'utente e da un URL di origine.
from scrapegraphai.graphs import SmartScraperGraph
# Define the configuration for the scraping pipeline
graph_config = {
"llm": {
"model": "ollama/llama3.2",
"model_tokens": 8192,
"format": "json",
},
"verbose": True,
"headless": False,
}
# Create the SmartScraperGraph instance
smart_scraper_graph = SmartScraperGraph(
prompt="Extract useful information from the webpage, including a description of what the company does, founders and social media links",
source="https://scrapegraphai.com/",
config=graph_config
)
# Run the pipeline
result = smart_scraper_graph.run()
import json
print(json.dumps(result, indent=4))
[!NOTE] Per i modelli OpenAI e altri ti basta modificare la configurazione dell'LLM!
graph_config = { "llm": { "api_key": "YOUR_OPENAI_API_KEY", "model": "openai/gpt-4o-mini", }, "verbose": True, "headless": False, }
L'output sarà un dizionario come il seguente:
{
"description": "ScrapeGraphAI transforms websites into clean, organized data for AI agents and data analytics. It offers an AI-powered API for effortless and cost-effective data extraction.",
"founders": [
{
"name": "",
"role": "Founder & Technical Lead",
"linkedin": "https://www.linkedin.com/in/perinim/"
},
{
"name": "Marco Vinciguerra",
"role": "Founder & Software Engineer",
"linkedin": "https://www.linkedin.com/in/marco-vinciguerra-7ba365242/"
},
{
"name": "Lorenzo Padoan",
"role": "Founder & Product Engineer",
"linkedin": "https://www.linkedin.com/in/lorenzo-padoan-4521a2154/"
}
],
"social_media_links": {
"linkedin": "https://www.linkedin.com/company/101881123",
"twitter": "https://x.com/scrapegraphai",
"github": "https://github.com/ScrapeGraphAI/Scrapegraph-ai"
}
}
Esistono altre pipeline che possono essere utilizzate per estrarre informazioni da più pagine, generare script Python o persino generare file audio.