
Python scraper based on AI
English | 中文 | 日本語 | 한국어 | Русский | Türkçe | Deutsch | Español | français | Português | Italiano
ScrapeGraphAI ist eine Web-Scraping-Python-Bibliothek, die LLM und direkte Graphlogik verwendet, um Scraping-Pipelines für Websites und lokale Dokumente (XML, HTML, JSON, Markdown usw.) zu erstellen. Sage einfach, welche Informationen du extrahieren möchtest, und die Bibliothek erledigt das für dich!
ScrapeGraphAI bietet eine nahtlose Integration mit gängigen Frameworks und Tools, um deine Scraping-Fähigkeiten zu erweitern. Egal, ob du mit Python oder Node.js entwickelst, LLM-Frameworks verwendest oder mit No-Code-Plattformen arbeitest – wir haben mit unseren umfassenden Integrationsmöglichkeiten alles für dich abgedeckt.
Du findest weitere Informationen unter folgendem Link
Integrationen:
Die Referenzseite für Scrapegraph-ai ist auf der offiziellen PyPI-Seite verfügbar: pypi.
pip install scrapegraphai
# IMPORTANT (for fetching websites content)
playwright install
Hinweis: Es wird empfohlen, die Bibliothek in einer virtuellen Umgebung zu installieren, um Konflikte mit anderen Bibliotheken zu vermeiden 🐱
Es gibt mehrere standardmäßige Scraping-Pipelines, die zum Extrahieren von Informationen aus einer Website (oder einer lokalen Datei) verwendet werden können. Die häufigste ist SmartScraperGraph, die Informationen von einer einzelnen Seite extrahiert, basierend auf einem Benutzer-Prompt und einer Quell-URL.
from scrapegraphai.graphs import SmartScraperGraph
# Define the configuration for the scraping pipeline
graph_config = {
"llm": {
"model": "ollama/llama3.2",
"model_tokens": 8192,
"format": "json",
},
"verbose": True,
"headless": False,
}
# Create the SmartScraperGraph instance
smart_scraper_graph = SmartScraperGraph(
prompt="Extract useful information from the webpage, including a description of what the company does, founders and social media links",
source="https://scrapegraphai.com/",
config=graph_config
)
# Run the pipeline
result = smart_scraper_graph.run()
import json
print(json.dumps(result, indent=4))
[!NOTE] Für OpenAI und andere Modelle musst du nur die llm-Konfiguration ändern!
graph_config = { "llm": { "api_key": "YOUR_OPENAI_API_KEY", "model": "openai/gpt-4o-mini", }, "verbose": True, "headless": False, }
Die Ausgabe wird ein Dictionary wie das folgende sein:
{
"description": "ScrapeGraphAI transforms websites into clean, organized data for AI agents and data analytics. It offers an AI-powered API for effortless and cost-effective data extraction.",
"founders": [
{
"name": "",
"role": "Founder & Technical Lead",
"linkedin": "https://www.linkedin.com/in/perinim/"
},
{
"name": "Marco Vinciguerra",
"role": "Founder & Software Engineer",
"linkedin": "https://www.linkedin.com/in/marco-vinciguerra-7ba365242/"
},
{
"name": "Lorenzo Padoan",
"role": "Founder & Product Engineer",
"linkedin": "https://www.linkedin.com/in/lorenzo-padoan-4521a2154/"
}
],
"social_media_links": {
"linkedin": "https://www.linkedin.com/company/101881123",
"twitter": "https://x.com/scrapegraphai",
"github": "https://github.com/ScrapeGraphAI/Scrapegraph-ai"
}
}
Es gibt weitere Pipelines, die verwendet werden können, um Informationen von mehreren Seiten zu extrahieren, Python-Skripte zu generieren oder sogar Audiodateien zu erzeugen.
Für jeden dieser Graphen gibt es die Multi-Version. Sie ermöglicht parallele Aufrufe des LLM.
Es ist möglich, verschiedene LLMs über APIs zu verwenden, wie OpenAI, Groq, Azure, Gemini, MiniMax und weitere, oder lokale Modelle mit Ollama.
Denke daran, Ollama installiert zu haben und die Modelle mit dem Befehl ollama pull herunterzuladen, wenn du lokale Modelle verwenden möchtest.
Die Dokumentation für ScrapeGraphAI findest du hier.
ScrapeGraphAI gibt es in zwei Varianten: diese Open-Source-Bibliothek, die du selbst betreibst, und die verwaltete Cloud-API (die über die Python- und JS/TS-SDKs verwendet wird). Diese Tabelle erklärt den Unterschied, damit du die richtige auswählen kannst.
Wähle die Open-Source-Bibliothek, wenn du die volle Kontrolle haben möchtest, Daten vor Ort/selbst gehostet, lokale LLMs (Ollama) oder detaillierte Kostensteuerung – und du bereit bist, Browser, Proxys und Skalierung selbst zu verwalten.
Wähle die verwaltete API, wenn du null Infrastruktur, verwaltetes JS-Rendering & Anti-Bot, integrierte Crawl- und geplante Monitor-Aufträge sowie den schnellsten Weg in die Produktion haben möchtest – abgerechnet pro Guthaben.
Fühle dich frei, einen Beitrag zu leisten und unserem Discord-Server beizutreten, um Verbesserungen mit uns zu besprechen und Vorschläge zu machen!
Bitte lies die Beitragsrichtlinien.
Wenn du nach einer schnellen Lösung suchst, um ScrapeGraph in dein System zu integrieren, schau dir unsere leistungsstarke API hier! an
Wir bieten SDKs sowohl in Python als auch in Node.js, die die Integration in deine Projekte erleichtern. Sieh sie dir unten an:
| SDK | Sprache | GitHub-Link |
|---|---|---|
| Python SDK | Python | scrapegraph-py |
| Node.js SDK | Node.js | scrapegraph-js |
Die offizielle API-Dokumentation findest du hier.
Wir sammeln anonyme Nutzungsmetriken, um die Qualität und Benutzererfahrung unseres Pakets zu verbessern. Die Daten helfen uns, Verbesserungen zu priorisieren und Kompatibilität sicherzustellen. Wenn du dich abmelden möchtest, setze die Umgebungsvariable SCRAPEGRAPHAI_TELEMETRY_ENABLED=false. Weitere Informationen findest du in der Dokumentation hier.
Wenn du unsere Bibliothek für Forschungszwecke verwendet hast, zitiere uns bitte mit der folgenden Referenz:
@misc{scrapegraph-ai,
author = {Lorenzo Padoan, Marco Vinciguerra},
title = {Scrapegraph-ai},
year = {2024},
url = {https://github.com/ScrapeGraphAI/Scrapegraph-ai},
note = {A Python library for scraping leveraging large language models}
}
ScrapeGraphAI ist unter der MIT-Lizenz lizenziert. Weitere Informationen findest du in der LICENSE-Datei.
Mit ❤️ gemacht von ScrapeGraph AI
| Pipeline-Name | Beschreibung |
|---|
| SmartScraperGraph | Einseitiger Scraper, der nur einen Benutzer-Prompt und eine Eingabequelle benötigt. |
| SearchGraph | Mehrseitiger Scraper, der Informationen aus den ersten n Suchergebnissen einer Suchmaschine extrahiert. |
| SpeechGraph | Einseitiger Scraper, der Informationen von einer Website extrahiert und eine Audiodatei generiert. |
| ScriptCreatorGraph | Einseitiger Scraper, der Informationen von einer Website extrahiert und ein Python-Skript generiert. |
| SmartScraperMultiGraph | Mehrseitiger Scraper, der Informationen von mehreren Seiten extrahiert, basierend auf einem einzelnen Prompt und einer Liste von Quellen. |
| ScriptCreatorMultiGraph | Mehrseitiger Scraper, der ein Python-Skript zum Extrahieren von Informationen von mehreren Seiten und Quellen generiert. |
Open Source (scrapegraphai) | Managed API (scrapegraph-py / scrapegraph-js) |
|---|
| Was es ist | Eine Python-Bibliothek, die du selbst betreibst | Ein gehosteter Cloud-Dienst, den du über das SDK aufrufst |
| Wo es läuft | Deine eigene Infrastruktur (selbst gehostet) | ScrapeGraphAI-Cloud |
| LLM | Bring dein eigenes mit (OpenAI, Groq, Gemini, Azure, lokal über Ollama) | Für dich verwaltet |
| Browser-/JS-Rendering | Du konfigurierst es (Playwright) | Verwaltet (Stealth-, auto/fast/js-Modi) |
| Proxys & Anti-Bot | Deine Verantwortung | Inbegriffen |
| Skalierung & Wartung | Deine Verantwortung | Vollständig verwaltet |
| Kostenmodell | LLM-Tokens + eigene Infrastruktur | Pay-as-you-go-Guthaben |
| Authentifizierung | Deine eigenen LLM-Schlüssel | SGAI_API_KEY |
| Funktionen | Graph-Pipelines (SmartScraper, Search, Speech, ScriptCreator…) | Scrape, Extract, Search, Crawl, Monitor, History |
| Einrichtungsaufwand | Mehr Konfiguration | Minimal — API-Schlüssel + ein Aufruf |
| Lizenz | MIT | SDK ist MIT; der API-Dienst ist kostenpflichtig |