
Python scraper based on AI
English | 中文 | 日本語 | 한국어 | Русский | Türkçe | Deutsch | Español | français | Português | Italiano
ScrapeGraphAI est une bibliothèque Python de web scraping qui utilise des LLM et une logique de graphe directe pour créer des pipelines de scraping pour les sites web et les documents locaux (XML, HTML, JSON, Markdown, etc.).
Il vous suffit de dire quelles informations vous souhaitez extraire et la bibliothèque le fera pour vous !
ScrapeGraphAI offre une intégration transparente avec les frameworks et outils populaires pour améliorer vos capacités de scraping. Que vous construisiez avec Python ou Node.js, utilisiez des frameworks LLM, ou travailliez avec des plateformes sans code, nous avons ce qu'il vous faut grâce à nos options d'intégration complètes.
Vous pouvez trouver plus d'informations sur le lien suivant
Intégrations:
La page de référence pour Scrapegraph-ai est disponible sur la page officielle de PyPI : pypi.
pip install scrapegraphai
# IMPORTANT (for fetching websites content)
playwright install
Note : il est recommandé d'installer la bibliothèque dans un environnement virtuel pour éviter les conflits avec d'autres bibliothèques 🐱
Il existe plusieurs pipelines de scraping standard qui peuvent être utilisés pour extraire des informations d'un site web (ou d'un fichier local).
Le plus courant est le SmartScraperGraph, qui extrait des informations d'une seule page à partir d'une invite utilisateur et d'une URL source.
from scrapegraphai.graphs import SmartScraperGraph
# Define the configuration for the scraping pipeline
graph_config = {
"llm": {
"model": "ollama/llama3.2",
"model_tokens": 8192,
"format": "json",
},
"verbose": True,
"headless": False,
}
# Create the SmartScraperGraph instance
smart_scraper_graph = SmartScraperGraph(
prompt="Extract useful information from the webpage, including a description of what the company does, founders and social media links",
source="https://scrapegraphai.com/",
config=graph_config
)
# Run the pipeline
result = smart_scraper_graph.run()
import json
print(json.dumps(result, indent=4))
[!NOTE] For OpenAI and other models you just need to change the llm config!
graph_config = { "llm": { "api_key": "YOUR_OPENAI_API_KEY", "model": "openai/gpt-4o-mini", }, "verbose": True, "headless": False, }
La sortie sera un dictionnaire comme celui-ci :
{
"description": "ScrapeGraphAI transforms websites into clean, organized data for AI agents and data analytics. It offers an AI-powered API for effortless and cost-effective data extraction.",
"founders": [
{
"name": "",
"role": "Founder & Technical Lead",
"linkedin": "https://www.linkedin.com/in/perinim/"
},
{
"name": "Marco Vinciguerra",
"role": "Founder & Software Engineer",
"linkedin": "https://www.linkedin.com/in/marco-vinciguerra-7ba365242/"
},
{
"name": "Lorenzo Padoan",
"role": "Founder & Product Engineer",
"linkedin": "https://www.linkedin.com/in/lorenzo-padoan-4521a2154/"
}
],
"social_media_links": {
"linkedin": "https://www.linkedin.com/company/101881123",
"twitter": "https://x.com/scrapegraphai",
"github": "https://github.com/ScrapeGraphAI/Scrapegraph-ai"
}
}
Il existe d'autres pipelines qui peuvent être utilisés pour extraire des informations de plusieurs pages, générer des scripts Python, ou même générer des fichiers audio.
Pour chacun de ces graphes, il existe une version multi. Elle permet d'effectuer des appels du LLM en parallèle.
Il est possible d'utiliser différents LLM via des API, comme OpenAI, Groq, Azure, Gemini, MiniMax et plus, ou des modèles locaux en utilisant Ollama.
N'oubliez pas d'installer Ollama et de télécharger les modèles en utilisant la commande ollama pull, si vous souhaitez utiliser des modèles locaux.
La documentation de ScrapeGraphAI peut être trouvée ici.
ScrapeGraphAI se décline en deux versions : cette bibliothèque open source, que vous exécutez vous-même, et l'API cloud gérée (utilisée via les SDK Python et JS/TS). Ce tableau explique la différence pour que vous puissiez choisir celle qui vous convient.
Choisissez la bibliothèque open source si vous voulez un contrôle total, des données sur site/auto-hébergées, des LLM locaux (Ollama), ou un réglage fin des coûts — et que vous êtes prêt à gérer vous-même les navigateurs, les proxies et la mise à l'échelle.
Choisissez l'API gérée si vous voulez zéro infrastructure, rendu JS et anti-bot gérés, des tâches Crawl et Monitor planifiées intégrées, et le chemin le plus rapide vers la production — facturé par crédit.
N'hésitez pas à contribuer et à rejoindre notre serveur Discord pour discuter des améliorations avec nous et nous faire part de vos suggestions !
Veuillez consulter les directives de contribution.
Si vous cherchez une solution rapide pour intégrer ScrapeGraph dans votre système, découvrez notre puissante API ici !
Nous proposons des SDK en Python et Node.js, ce qui facilite l'intégration dans vos projets. Découvrez-les ci-dessous :
| SDK | Langage | Lien GitHub |
|---|---|---|
| Python SDK | Python | scrapegraph-py |
| Node.js SDK | Node.js | scrapegraph-js |
La documentation officielle de l'API peut être trouvée ici.
Nous collectons des métriques d'utilisation anonymes pour améliorer la qualité de notre package et l'expérience utilisateur. Les données nous aident à prioriser les améliorations et à assurer la compatibilité. Si vous souhaitez vous désinscrire, définissez la variable d'environnement SCRAPEGRAPHAI_TELEMETRY_ENABLED=false. Pour plus d'informations, veuillez consulter la documentation ici.
Si vous avez utilisé notre bibliothèque à des fins de recherche, veuillez nous citer avec la référence suivante :
@misc{scrapegraph-ai,
author = {Lorenzo Padoan, Marco Vinciguerra},
title = {Scrapegraph-ai},
year = {2024},
url = {https://github.com/ScrapeGraphAI/Scrapegraph-ai},
note = {A Python library for scraping leveraging large language models}
}
ScrapeGraphAI est sous licence MIT. Voir le fichier LICENSE pour plus d'informations.
Fait avec ❤️ par ScrapeGraph AI
| Nom du pipeline | Description |
|---|
| SmartScraperGraph | Scraper mono-page qui nécessite seulement une invite utilisateur et une source d'entrée. |
| SearchGraph | Scraper multi-page qui extrait des informations des n premiers résultats de recherche d'un moteur de recherche. |
| SpeechGraph | Scraper mono-page qui extrait des informations d'un site web et génère un fichier audio. |
| ScriptCreatorGraph | Scraper mono-page qui extrait des informations d'un site web et génère un script Python. |
| SmartScraperMultiGraph | Scraper multi-page qui extrait des informations de plusieurs pages à partir d'une seule invite et d'une liste de sources. |
| ScriptCreatorMultiGraph | Scraper multi-page qui génère un script Python pour extraire des informations de plusieurs pages et sources. |
Open Source (scrapegraphai) | API gérée (scrapegraph-py / scrapegraph-js) |
|---|
| Ce que c'est | Une bibliothèque Python que vous exécutez vous-même | Un service cloud hébergé que vous appelez via SDK |
| Où ça s'exécute | Votre propre infrastructure (auto-hébergée) | Cloud ScrapeGraphAI |
| LLM | Apportez le vôtre (OpenAI, Groq, Gemini, Azure, local via Ollama) | Géré pour vous |
| Rendu navigateur / JS | Vous le configurez (Playwright) | Géré (furtif, modes auto/fast/js) |
| Proxy et anti-bot | Votre responsabilité | Inclus |
| Mise à l'échelle et maintenance | Votre responsabilité | Entièrement géré |
| Modèle de coût | Jetons LLM + votre propre infrastructure | Crédits à l'utilisation |
| Authentification | Vos propres clés LLM | SGAI_API_KEY |
| Capacités | Pipelines de graphe (SmartScraper, Search, Speech, ScriptCreator…) | Scrape, Extract, Search, Crawl, Monitor, History |
| Effort de configuration | Plus de configuration | Minimal — clé API + un appel |
| Licence | MIT | Le SDK est MIT ; le service API est payant |