Skip to content
KitploitKITPLOIT
OutilsBlog
Soumettre
OutilsBlog
Soumettre

Outils de Hacking, PenTest et Cybersécurité pour votre Arsenal de Sécurité !

Kitploit est un répertoire d'outils de hacking, de cybersécurité et de pentesting. Découvrez les dernières mises à jour des projets pour trouver des vulnérabilités, analyser des systèmes, automatiser les tests et renforcer votre sécurité.

··Flux·Contact·Confidentialité·© 2026 Kitploit

Répertoire d'outils

Catégories

Voir toutes les catégories
Loading categories
Scrapegraph-ai — Python scraper based on AI | Kitploit
Outils/GitHubGitHub/scrapegraphai/scrapegraph-ai
OSINT (Open Source Intelligence)Information GatheringUtilities & FrameworksMachine LearningLearning & EducationCrawlerAI Security
GitHubscrapegraphai/scrapegraph-ai

Scrapegraph-ai

Python scraper based on AI

Voir le dépôt
29.4k2.9kil y a 1 jourVérifié par Kitploit

Populaires

Voir tout →

Découvrez les outils les plus utilisés par notre communauté.

Explorer tous les outils

Parcourez notre collection d'outils

Voir tous les outils →
Partager
Site web

🚀 Vous cherchez un moyen encore plus rapide et plus simple de scraper à grande échelle (seulement 5 lignes de code) ? Découvrez notre version améliorée sur ScrapeGraphAI.com! 🚀


🕷️ ScrapeGraphAI : Vous ne scrapez qu'une fois

ScrapeGraphAI

English | 中文 | 日本語 | 한국어 | Русский | Türkçe | Deutsch | Español | français | Português | Italiano

PyPI Downloads

License: MIT

ScrapeGraphAI%2FScrapegraph-ai | Trendshift

ScrapeGraphAI est une bibliothèque Python de web scraping qui utilise des LLM et une logique de graphe directe pour créer des pipelines de scraping pour les sites web et les documents locaux (XML, HTML, JSON, Markdown, etc.).

Il vous suffit de dire quelles informations vous souhaitez extraire et la bibliothèque le fera pour vous !

🚀 Intégrations

ScrapeGraphAI offre une intégration transparente avec les frameworks et outils populaires pour améliorer vos capacités de scraping. Que vous construisiez avec Python ou Node.js, utilisiez des frameworks LLM, ou travailliez avec des plateformes sans code, nous avons ce qu'il vous faut grâce à nos options d'intégration complètes.

Web data extraction at scale? Try ScrapeGraphAI cloud

Vous pouvez trouver plus d'informations sur le lien suivant

Intégrations:

  • API: Documentation
  • SDKs: Python, Node
  • Frameworks LLM: Langchain, Llama Index, Crew.ai, Agno, CamelAI
  • Frameworks Low-code: Pipedream, Bubble, Zapier, n8n, Dify, Toolhouse
  • Serveur MCP: Lien

🚀 Installation rapide

La page de référence pour Scrapegraph-ai est disponible sur la page officielle de PyPI : pypi.

root@kitploit:~
pip install scrapegraphai

# IMPORTANT (for fetching websites content)
playwright install

Note : il est recommandé d'installer la bibliothèque dans un environnement virtuel pour éviter les conflits avec d'autres bibliothèques 🐱

💻 Utilisation

Il existe plusieurs pipelines de scraping standard qui peuvent être utilisés pour extraire des informations d'un site web (ou d'un fichier local).

Le plus courant est le SmartScraperGraph, qui extrait des informations d'une seule page à partir d'une invite utilisateur et d'une URL source.

root@kitploit:~
from scrapegraphai.graphs import SmartScraperGraph

# Define the configuration for the scraping pipeline
graph_config = {
    "llm": {
        "model": "ollama/llama3.2",
        "model_tokens": 8192,
        "format": "json",
    },
    "verbose": True,
    "headless": False,
}

# Create the SmartScraperGraph instance
smart_scraper_graph = SmartScraperGraph(
    prompt="Extract useful information from the webpage, including a description of what the company does, founders and social media links",
    source="https://scrapegraphai.com/",
    config=graph_config
)

# Run the pipeline
result = smart_scraper_graph.run()

import json
print(json.dumps(result, indent=4))

[!NOTE] For OpenAI and other models you just need to change the llm config!

root@kitploit:~
graph_config = {
   "llm": {
       "api_key": "YOUR_OPENAI_API_KEY",
       "model": "openai/gpt-4o-mini",
   },
   "verbose": True,
   "headless": False,
}

La sortie sera un dictionnaire comme celui-ci :

root@kitploit:~
{
    "description": "ScrapeGraphAI transforms websites into clean, organized data for AI agents and data analytics. It offers an AI-powered API for effortless and cost-effective data extraction.",
    "founders": [
        {
            "name": "",
            "role": "Founder & Technical Lead",
            "linkedin": "https://www.linkedin.com/in/perinim/"
        },
        {
            "name": "Marco Vinciguerra",
            "role": "Founder & Software Engineer",
            "linkedin": "https://www.linkedin.com/in/marco-vinciguerra-7ba365242/"
        },
        {
            "name": "Lorenzo Padoan",
            "role": "Founder & Product Engineer",
            "linkedin": "https://www.linkedin.com/in/lorenzo-padoan-4521a2154/"
        }
    ],
    "social_media_links": {
        "linkedin": "https://www.linkedin.com/company/101881123",
        "twitter": "https://x.com/scrapegraphai",
        "github": "https://github.com/ScrapeGraphAI/Scrapegraph-ai"
    }
}

Il existe d'autres pipelines qui peuvent être utilisés pour extraire des informations de plusieurs pages, générer des scripts Python, ou même générer des fichiers audio.

Pour chacun de ces graphes, il existe une version multi. Elle permet d'effectuer des appels du LLM en parallèle.

Il est possible d'utiliser différents LLM via des API, comme OpenAI, Groq, Azure, Gemini, MiniMax et plus, ou des modèles locaux en utilisant Ollama.

N'oubliez pas d'installer Ollama et de télécharger les modèles en utilisant la commande ollama pull, si vous souhaitez utiliser des modèles locaux.

📖 Documentation

Open In Colab

La documentation de ScrapeGraphAI peut être trouvée ici.

🆚 Open Source vs API gérée

ScrapeGraphAI se décline en deux versions : cette bibliothèque open source, que vous exécutez vous-même, et l'API cloud gérée (utilisée via les SDK Python et JS/TS). Ce tableau explique la différence pour que vous puissiez choisir celle qui vous convient.

Choisissez la bibliothèque open source si vous voulez un contrôle total, des données sur site/auto-hébergées, des LLM locaux (Ollama), ou un réglage fin des coûts — et que vous êtes prêt à gérer vous-même les navigateurs, les proxies et la mise à l'échelle.

Choisissez l'API gérée si vous voulez zéro infrastructure, rendu JS et anti-bot gérés, des tâches Crawl et Monitor planifiées intégrées, et le chemin le plus rapide vers la production — facturé par crédit.

  • Open-source library: https://github.com/ScrapeGraphAI/Scrapegraph-ai
  • Python SDK: https://github.com/ScrapeGraphAI/scrapegraph-py
  • JS/TS SDK: https://github.com/ScrapeGraphAI/scrapegraph-js
  • API docs: https://docs.scrapegraphai.com/introduction

🤝 Contribuer

N'hésitez pas à contribuer et à rejoindre notre serveur Discord pour discuter des améliorations avec nous et nous faire part de vos suggestions !

Veuillez consulter les directives de contribution.

My Skills My Skills My Skills

🔗 API ScrapeGraph et SDK

Si vous cherchez une solution rapide pour intégrer ScrapeGraph dans votre système, découvrez notre puissante API ici !

API Banner

Nous proposons des SDK en Python et Node.js, ce qui facilite l'intégration dans vos projets. Découvrez-les ci-dessous :

SDKLangageLien GitHub
Python SDKPythonscrapegraph-py
Node.js SDKNode.jsscrapegraph-js

La documentation officielle de l'API peut être trouvée ici.

📈 Télémétrie

Nous collectons des métriques d'utilisation anonymes pour améliorer la qualité de notre package et l'expérience utilisateur. Les données nous aident à prioriser les améliorations et à assurer la compatibilité. Si vous souhaitez vous désinscrire, définissez la variable d'environnement SCRAPEGRAPHAI_TELEMETRY_ENABLED=false. Pour plus d'informations, veuillez consulter la documentation ici.

❤️ Contributeurs

Contributors

🎓 Citations

Si vous avez utilisé notre bibliothèque à des fins de recherche, veuillez nous citer avec la référence suivante :

root@kitploit:~
  @misc{scrapegraph-ai,
    author = {Lorenzo Padoan, Marco Vinciguerra},
    title = {Scrapegraph-ai},
    year = {2024},
    url = {https://github.com/ScrapeGraphAI/Scrapegraph-ai},
    note = {A Python library for scraping leveraging large language models}
  }

Auteurs

Coordonnées
Marco VinciguerraLinkedin Badge
Lorenzo PadoanLinkedin Badge

📜 Licence

ScrapeGraphAI est sous licence MIT. Voir le fichier LICENSE pour plus d'informations.

Remerciements

  • Nous tenons à remercier tous les contributeurs du projet et la communauté open source pour leur soutien.
  • ScrapeGraphAI est destiné à être utilisé uniquement à des fins d'exploration de données et de recherche. Nous ne sommes pas responsables de toute utilisation abusive de la bibliothèque.

Fait avec ❤️ par ScrapeGraph AI

Scarf tracking

Télécharger l’outil
Nom du pipelineDescription
SmartScraperGraphScraper mono-page qui nécessite seulement une invite utilisateur et une source d'entrée.
SearchGraphScraper multi-page qui extrait des informations des n premiers résultats de recherche d'un moteur de recherche.
SpeechGraphScraper mono-page qui extrait des informations d'un site web et génère un fichier audio.
ScriptCreatorGraphScraper mono-page qui extrait des informations d'un site web et génère un script Python.
SmartScraperMultiGraphScraper multi-page qui extrait des informations de plusieurs pages à partir d'une seule invite et d'une liste de sources.
ScriptCreatorMultiGraphScraper multi-page qui génère un script Python pour extraire des informations de plusieurs pages et sources.
Open Source (scrapegraphai)API gérée (scrapegraph-py / scrapegraph-js)
Ce que c'estUne bibliothèque Python que vous exécutez vous-mêmeUn service cloud hébergé que vous appelez via SDK
Où ça s'exécuteVotre propre infrastructure (auto-hébergée)Cloud ScrapeGraphAI
LLMApportez le vôtre (OpenAI, Groq, Gemini, Azure, local via Ollama)Géré pour vous
Rendu navigateur / JSVous le configurez (Playwright)Géré (furtif, modes auto/fast/js)
Proxy et anti-botVotre responsabilitéInclus
Mise à l'échelle et maintenanceVotre responsabilitéEntièrement géré
Modèle de coûtJetons LLM + votre propre infrastructureCrédits à l'utilisation
AuthentificationVos propres clés LLMSGAI_API_KEY
CapacitésPipelines de graphe (SmartScraper, Search, Speech, ScriptCreator…)Scrape, Extract, Search, Crawl, Monitor, History
Effort de configurationPlus de configurationMinimal — clé API + un appel
LicenceMITLe SDK est MIT ; le service API est payant