
AI पर आधारित Python स्क्रैपर
English | 中文 | 日本語 | 한국어 | Русский | Türkçe | Deutsch | Español | français | Português | Italiano
ScrapeGraphAI एक वेब स्क्रेपिंग पायथन लाइब्रेरी है जो वेबसाइटों और स्थानीय दस्तावेज़ों (XML, HTML, JSON, Markdown, आदि) के लिए स्क्रेपिंग पाइपलाइन बनाने के लिए LLM और प्रत्यक्ष ग्राफ़ लॉजिक का उपयोग करती है।
आप बस यह बताइए कि आप कौन-सी जानकारी निकालना चाहते हैं और लाइब्रेरी वह आपके लिए कर देगी!
ScrapeGraphAI लोकप्रिय फ्रेमवर्क और टूल्स के साथ सहज एकीकरण प्रदान करता है ताकि आपकी स्क्रेपिंग क्षमताएँ बढ़ें। चाहे आप Python या Node.js के साथ विकास कर रहे हों, LLM फ्रेमवर्क का उपयोग कर रहे हों, या नो-कोड प्लेटफ़ॉर्म पर काम कर रहे हों, हमारे व्यापक एकीकरण विकल्पों की बदौलत हम आपके लिए सब कुछ संभाल लेते हैं।
अधिक जानकारी आप निम्नलिखित लिंक पर पा सकते हैं
एकीकरण:
Scrapegraph-ai के लिए संदर्भ पृष्ठ PyPI के आधिकारिक पृष्ठ पर उपलब्ध है: pypi।
pip install scrapegraphai
# IMPORTANT (for fetching websites content)
playwright install
नोट: अन्य लाइब्रेरीज़ के साथ टकराव से बचने के लिए लाइब्रेरी को वर्चुअल एनवायरनमेंट में इंस्टॉल करने की अनुशंसा की जाती है 🐱
किसी वेबसाइट (या स्थानीय फ़ाइल) से जानकारी निकालने के लिए कई मानक स्क्रेपिंग पाइपलाइनों का उपयोग किया जा सकता है।
सबसे आम है SmartScraperGraph, जो उपयोगकर्ता प्रॉम्प्ट और स्रोत URL दिए जाने पर एक ही पेज से जानकारी निकालता है।
from scrapegraphai.graphs import SmartScraperGraph
# Define the configuration for the scraping pipeline
graph_config = {
"llm": {
"model": "ollama/llama3.2",
"model_tokens": 8192,
"format": "json",
},
"verbose": True,
"headless": False,
}
# Create the SmartScraperGraph instance
smart_scraper_graph = SmartScraperGraph(
prompt="Extract useful information from the webpage, including a description of what the company does, founders and social media links",
source="https://scrapegraphai.com/",
config=graph_config
)
# Run the pipeline
result = smart_scraper_graph.run()
import json
print(json.dumps(result, indent=4))
[!NOTE] OpenAI और अन्य मॉडलों के लिए आपको केवल llm कॉन्फ़िग बदलने की आवश्यकता है!
graph_config = { "llm": { "api_key": "YOUR_OPENAI_API_KEY", "model": "openai/gpt-4o-mini", }, "verbose": True, "headless": False, }
आउटपुट निम्नलिखित जैसा एक डिक्शनरी होगा:
{
"description": "ScrapeGraphAI transforms websites into clean, organized data for AI agents and data analytics. It offers an AI-powered API for effortless and cost-effective data extraction.",
"founders": [
{
"name": "",
"role": "Founder & Technical Lead",
"linkedin": "https://www.linkedin.com/in/perinim/"
},
{
"name": "Marco Vinciguerra",
"role": "Founder & Software Engineer",
"linkedin": "https://www.linkedin.com/in/marco-vinciguerra-7ba365242/"
},
{
"name": "Lorenzo Padoan",
"role": "Founder & Product Engineer",
"linkedin": "https://www.linkedin.com/in/lorenzo-padoan-4521a2154/"
}
],
"social_media_links": {
"linkedin": "https://www.linkedin.com/company/101881123",
"twitter": "https://x.com/scrapegraphai",
"github": "https://github.com/ScrapeGraphAI/Scrapegraph-ai"
}
}
कई पेजों से जानकारी निकालने, Python स्क्रिप्ट बनाने, या यहाँ तक कि ऑडियो फ़ाइलें बनाने के लिए अन्य पाइपलाइनें भी उपलब्ध हैं।
इनमें से प्रत्येक ग्राफ़ का मल्टी संस्करण भी उपलब्ध है। यह LLM को समानांतर रूप से कॉल करने की सुविधा देता है।
विभिन्न LLM का उपयोग APIs के माध्यम से संभव है, जैसे OpenAI, Groq, Azure, Gemini, MiniMax और अन्य, या Ollama का उपयोग करके स्थानीय मॉडल।
यदि आप स्थानीय मॉडल का उपयोग करना चाहते हैं, तो Ollama इंस्टॉल होना याद रखें और ollama pull कमांड का उपयोग करके मॉडल डाउनलोड करें।
ScrapeGraphAI के लिए दस्तावेज़ीकरण यहाँ पाया जा सकता है।
ScrapeGraphAI दो रूपों में आता है: यह ओपन-सोर्स लाइब्रेरी, जिसे आप स्वयं चलाते हैं, और मैनेज्ड क्लाउड API (Python और JS/TS SDKs के माध्यम से उपयोग किया जाता है)। यह तालिका अंतर स्पष्ट करती है ताकि आप सही विकल्प चुन सकें।
ओपन-सोर्स लाइब्रेरी चुनें यदि आप पूर्ण नियंत्रण, ऑन-प्रिम/सेल्फ-होस्टेड डेटा, स्थानीय LLMs (Ollama), या सूक्ष्म स्तर पर लागत समायोजन चाहते हैं — और आप ब्राउज़र, प्रॉक्सी और स्केलिंग को स्वयं प्रबंधित करने में सहज हैं।
मैनेज्ड API चुनें यदि आप शून्य इंफ्रास्ट्रक्चर, मैनेज्ड JS रेंडरिंग और एंटी-बॉट, बिल्ट-इन Crawl और शेड्यूल्ड Monitor जॉब्स, और प्रोडक्शन तक सबसे तेज़ रास्ता चाहते हैं — क्रेडिट के अनुसार बिलिंग होती है।
बेझिझक योगदान करें और सुधारों पर हमारे साथ चर्चा करने तथा सुझाव देने के लिए हमारे Discord सर्वर से जुड़ें!
कृपया योगदान दिशानिर्देश देखें।
यदि आप अपने सिस्टम में ScrapeGraph को एकीकृत करने का त्वरित समाधान खोज रहे हैं, तो हमारी शक्तिशाली API यहाँ! देखें।
हम Python और Node.js दोनों में SDKs प्रदान करते हैं, जिससे आपके प्रोजेक्ट्स में एकीकरण आसान हो जाता है। इन्हें नीचे देखें:
| SDK | भाषा | GitHub लिंक |
|---|---|---|
| Python SDK | Python | scrapegraph-py |
| Node.js SDK | Node.js | scrapegraph-js |
आधिकारिक API दस्तावेज़ीकरण यहाँ पाया जा सकता है।
हम अपने पैकेज की गुणवत्ता और उपयोगकर्ता अनुभव को बेहतर बनाने के लिए अनाम उपयोग मेट्रिक्स एकत्र करते हैं। यह डेटा हमें सुधारों को प्राथमिकता देने और अनुकूलता सुनिश्चित करने में मदद करता है। यदि आप ऑप्ट-आउट करना चाहते हैं, तो SCRAPEGRAPHAI_TELEMETRY_ENABLED=false एनवायरनमेंट वेरिएबल सेट करें। अधिक जानकारी के लिए, कृपया दस्तावेज़ीकरण यहाँ देखें।
यदि आपने शोध उद्देश्यों के लिए हमारी लाइब्रेरी का उपयोग किया है, तो कृपया निम्नलिखित संदर्भ के साथ हमें उद्धृत करें:
@misc{scrapegraph-ai,
author = {Lorenzo Padoan, Marco Vinciguerra},
title = {Scrapegraph-ai},
year = {2024},
url = {https://github.com/ScrapeGraphAI/Scrapegraph-ai},
note = {A Python library for scraping leveraging large language models}
}
ScrapeGraphAI MIT लाइसेंस के अंतर्गत लाइसेंस प्राप्त है। अधिक जानकारी के लिए LICENSE फ़ाइल देखें।
❤️ के साथ बनाया गया ScrapeGraph AI द्वारा
| पाइपलाइन नाम | विवरण |
|---|
| SmartScraperGraph | एकल-पेज स्क्रेपर जिसे केवल उपयोगकर्ता प्रॉम्प्ट और इनपुट स्रोत की आवश्यकता होती है। |
| SearchGraph | मल्टी-पेज स्क्रेपर जो सर्च इंजन के शीर्ष n खोज परिणामों से जानकारी निकालता है। |
| SpeechGraph | एकल-पेज स्क्रेपर जो वेबसाइट से जानकारी निकालता है और एक ऑडियो फ़ाइल बनाता है। |
| ScriptCreatorGraph | एकल-पेज स्क्रेपर जो वेबसाइट से जानकारी निकालता है और एक Python स्क्रिप्ट बनाता है। |
| SmartScraperMultiGraph | मल्टी-पेज स्क्रेपर जो एक ही प्रॉम्प्ट और स्रोतों की सूची के साथ कई पेजों से जानकारी निकालता है। |
| ScriptCreatorMultiGraph | मल्टी-पेज स्क्रेपर जो कई पेजों और स्रोतों से जानकारी निकालने के लिए Python स्क्रिप्ट बनाता है। |
ओपन सोर्स (scrapegraphai) | मैनेज्ड API (scrapegraph-py / scrapegraph-js) |
|---|
| यह क्या है | एक Python लाइब्रेरी जिसे आप स्वयं चलाते हैं | एक होस्टेड क्लाउड सेवा जिसे आप SDK के माध्यम से कॉल करते हैं |
| यह कहाँ चलता है | आपका अपना इंफ्रास्ट्रक्चर (सेल्फ-होस्टेड) | ScrapeGraphAI क्लाउड |
| LLM | अपना स्वयं का लाएँ (OpenAI, Groq, Gemini, Azure, Ollama के माध्यम से स्थानीय) | आपके लिए मैनेज्ड |
| ब्राउज़र / JS रेंडरिंग | आप इसे कॉन्फ़िगर करते हैं (Playwright) | मैनेज्ड (स्टील्थ, auto/fast/js मोड) |
| प्रॉक्सी और एंटी-बॉट | आपकी ज़िम्मेदारी | शामिल |
| स्केलिंग और मेंटेनेंस | आपकी ज़िम्मेदारी | पूरी तरह मैनेज्ड |
| लागत मॉडल | LLM टोकन + आपका अपना इंफ्रा | पे-एज़-यू-गो क्रेडिट |
| प्रमाणीकरण (Auth) | आपकी अपनी LLM कुंजियाँ | SGAI_API_KEY |
| क्षमताएँ | ग्राफ़ पाइपलाइन (SmartScraper, Search, Speech, ScriptCreator…) | Scrape, Extract, Search, Crawl, Monitor, History |
| सेटअप प्रयास | अधिक कॉन्फ़िगरेशन | न्यूनतम — API कुंजी + एक कॉल |
| लाइसेंस | MIT | SDK MIT है; API सेवा सशुल्क है |