
Scrapegraph-ai v2.2.4
AI पर आधारित Python स्क्रैपर
🚀 बड़े पैमाने पर स्क्रेप करने का और भी तेज़ और सरल तरीका खोज रहे हैं (सिर्फ 5 लाइन कोड)? तो हमारा उन्नत संस्करण ScrapeGraphAI.com पर देखें! 🚀
🕷️ ScrapeGraphAI: आप केवल एक बार स्क्रेप करते हैं
English | 中文 | 日本語 | 한국어 | Русский | Türkçe | Deutsch | Español | français | Português | Italiano
ScrapeGraphAI एक वेब स्क्रेपिंग पायथन लाइब्रेरी है जो वेबसाइटों और स्थानीय दस्तावेज़ों (XML, HTML, JSON, Markdown, आदि) के लिए स्क्रेपिंग पाइपलाइन बनाने के लिए LLM और प्रत्यक्ष ग्राफ़ लॉजिक का उपयोग करती है।
आप बस यह बताइए कि आप कौन-सी जानकारी निकालना चाहते हैं और लाइब्रेरी वह आपके लिए कर देगी!
🚀 एकीकरण
ScrapeGraphAI लोकप्रिय फ्रेमवर्क और टूल्स के साथ सहज एकीकरण प्रदान करता है ताकि आपकी स्क्रेपिंग क्षमताएँ बढ़ें। चाहे आप Python या Node.js के साथ विकास कर रहे हों, LLM फ्रेमवर्क का उपयोग कर रहे हों, या नो-कोड प्लेटफ़ॉर्म पर काम कर रहे हों, हमारे व्यापक एकीकरण विकल्पों की बदौलत हम आपके लिए सब कुछ संभाल लेते हैं।
अधिक जानकारी आप निम्नलिखित लिंक पर पा सकते हैं
एकीकरण:
- API: दस्तावेज़ीकरण
- SDKs: Python, Node
- LLM फ्रेमवर्क: Langchain, Llama Index, Crew.ai, Agno, CamelAI
- लो-कोड फ्रेमवर्क: Pipedream, Bubble, Zapier, n8n, Dify, Toolhouse
- MCP सर्वर: लिंक
🚀 त्वरित इंस्टॉल
Scrapegraph-ai के लिए संदर्भ पृष्ठ PyPI के आधिकारिक पृष्ठ पर उपलब्ध है: pypi।
pip install scrapegraphai
# IMPORTANT (for fetching websites content)
playwright install
नोट: अन्य लाइब्रेरीज़ के साथ टकराव से बचने के लिए लाइब्रेरी को वर्चुअल एनवायरनमेंट में इंस्टॉल करने की अनुशंसा की जाती है 🐱
💻 उपयोग
किसी वेबसाइट (या स्थानीय फ़ाइल) से जानकारी निकालने के लिए कई मानक स्क्रेपिंग पाइपलाइनों का उपयोग किया जा सकता है।
सबसे आम है SmartScraperGraph, जो उपयोगकर्ता प्रॉम्प्ट और स्रोत URL दिए जाने पर एक ही पेज से जानकारी निकालता है।
from scrapegraphai.graphs import SmartScraperGraph
# Define the configuration for the scraping pipeline
graph_config = {
"llm": {
"model": "ollama/llama3.2",
"model_tokens": 8192,
"format": "json",
},
"verbose": True,
"headless": False,
}
# Create the SmartScraperGraph instance
smart_scraper_graph = SmartScraperGraph(
prompt="Extract useful information from the webpage, including a description of what the company does, founders and social media links",
source="https://scrapegraphai.com/",
config=graph_config
)
# Run the pipeline
result = smart_scraper_graph.run()
import json
print(json.dumps(result, indent=4))
[!NOTE] OpenAI और अन्य मॉडलों के लिए आपको केवल llm कॉन्फ़िग बदलने की आवश्यकता है!
graph_config = { "llm": { "api_key": "YOUR_OPENAI_API_KEY", "model": "openai/gpt-4o-mini", }, "verbose": True, "headless": False, }
आउटपुट निम्नलिखित जैसा एक डिक्शनरी होगा:
{
"description": "ScrapeGraphAI transforms websites into clean, organized data for AI agents and data analytics. It offers an AI-powered API for effortless and cost-effective data extraction.",
"founders": [
{
"name": "",
"role": "Founder & Technical Lead",
"linkedin": "https://www.linkedin.com/in/perinim/"
},
{
"name": "Marco Vinciguerra",
"role": "Founder & Software Engineer",
"linkedin": "https://www.linkedin.com/in/marco-vinciguerra-7ba365242/"
},
{
"name": "Lorenzo Padoan",
"role": "Founder & Product Engineer",
"linkedin": "https://www.linkedin.com/in/lorenzo-padoan-4521a2154/"
}
],
"social_media_links": {
"linkedin": "https://www.linkedin.com/company/101881123",
"twitter": "https://x.com/scrapegraphai",
"github": "https://github.com/ScrapeGraphAI/Scrapegraph-ai"
}
}
कई पेजों से जानकारी निकालने, Python स्क्रिप्ट बनाने, या यहाँ तक कि ऑडियो फ़ाइलें बनाने के लिए अन्य पाइपलाइनें भी उपलब्ध हैं।
| पाइपलाइन नाम | विवरण |
|---|---|
| SmartScraperGraph | एकल-पेज स्क्रेपर जिसे केवल उपयोगकर्ता प्रॉम्प्ट और इनपुट स्रोत की आवश्यकता होती है। |
| SearchGraph | मल्टी-पेज स्क्रेपर जो सर्च इंजन के शीर्ष n खोज परिणामों से जानकारी निकालता है। |
| SpeechGraph | एकल-पेज स्क्रेपर जो वेबसाइट से जानकारी निकालता है और एक ऑडियो फ़ाइल बनाता है। |
| ScriptCreatorGraph | एकल-पेज स्क्रेपर जो वेबसाइट से जानकारी निकालता है और एक Python स्क्रिप्ट बनाता है। |
| SmartScraperMultiGraph | मल्टी-पेज स्क्रेपर जो एक ही प्रॉम्प्ट और स्रोतों की सूची के साथ कई पेजों से जानकारी निकालता है। |
| ScriptCreatorMultiGraph | मल्टी-पेज स्क्रेपर जो कई पेजों और स्रोतों से जानकारी निकालने के लिए Python स्क्रिप्ट बनाता है। |
इनमें से प्रत्येक ग्राफ़ का मल्टी संस्करण भी उपलब्ध है। यह LLM को समानांतर रूप से कॉल करने की सुविधा देता है।
विभिन्न LLM का उपयोग APIs के माध्यम से संभव है, जैसे OpenAI, Groq, Azure, Gemini, MiniMax और अन्य, या Ollama का उपयोग करके स्थानीय मॉडल।
यदि आप स्थानीय मॉडल का उपयोग करना चाहते हैं, तो Ollama इंस्टॉल होना याद रखें और ollama pull कमांड का उपयोग करके मॉडल डाउनलोड करें।
📖 दस्तावेज़ीकरण
ScrapeGraphAI के लिए दस्तावेज़ीकरण यहाँ पाया जा सकता है।
🆚 ओपन सोर्स बनाम मैनेज्ड API
ScrapeGraphAI दो रूपों में आता है: यह ओपन-सोर्स लाइब्रेरी, जिसे आप स्वयं चलाते हैं, और मैनेज्ड क्लाउड API (Python और JS/TS SDKs के माध्यम से उपयोग किया जाता है)। यह तालिका अंतर स्पष्ट करती है ताकि आप सही विकल्प चुन सकें।
ओपन सोर्स (scrapegraphai) | मैनेज्ड API (scrapegraph-py / scrapegraph-js) | |
|---|---|---|
| यह क्या है | एक Python लाइब्रेरी जिसे आप स्वयं चलाते हैं | एक होस्टेड क्लाउड सेवा जिसे आप SDK के माध्यम से कॉल करते हैं |
| यह कहाँ चलता है | आपका अपना इंफ्रास्ट्रक्चर (सेल्फ-होस्टेड) | ScrapeGraphAI क्लाउड |
| LLM | अपना स्वयं का लाएँ (OpenAI, Groq, Gemini, Azure, Ollama के माध्यम से स्थानीय) | आपके लिए मैनेज्ड |
| ब्राउज़र / JS रेंडरिंग | आप इसे कॉन्फ़िगर करते हैं (Playwright) | मैनेज्ड (स्टील्थ, auto/fast/js मोड) |
| प्रॉक्सी और एंटी-बॉट | आपकी ज़िम्मेदारी | शामिल |
| स्केलिंग और मेंटेनेंस | आपकी ज़िम्मेदारी | पूरी तरह मैनेज्ड |
| लागत मॉडल | LLM टोकन + आपका अपना इंफ्रा | पे-एज़-यू-गो क्रेडिट |
| प्रमाणीकरण (Auth) | आपकी अपनी LLM कुंजियाँ | SGAI_API_KEY |
| क्षमताएँ | ग्राफ़ पाइपलाइन (SmartScraper, Search, Speech, ScriptCreator…) | Scrape, Extract, Search, Crawl, Monitor, History |
| सेटअप प्रयास | अधिक कॉन्फ़िगरेशन | न्यूनतम — API कुंजी + एक कॉल |
| लाइसेंस | MIT | SDK MIT है; API सेवा सशुल्क है |
ओपन-सोर्स लाइब्रेरी चुनें यदि आप पूर्ण नियंत्रण, ऑन-प्रिम/सेल्फ-होस्टेड डेटा, स्थानीय LLMs (Ollama), या सूक्ष्म स्तर पर लागत समायोजन चाहते हैं — और आप ब्राउज़र, प्रॉक्सी और स्केलिंग को स्वयं प्रबंधित करने में सहज हैं।
मैनेज्ड API चुनें यदि आप शून्य इंफ्रास्ट्रक्चर, मैनेज्ड JS रेंडरिंग और एंटी-बॉट, बिल्ट-इन Crawl और शेड्यूल्ड Monitor जॉब्स, और प्रोडक्शन तक सबसे तेज़ रास्ता चाहते हैं — क्रेडिट के अनुसार बिलिंग होती है।
- ओपन-सोर्स लाइब्रेरी: https://github.com/ScrapeGraphAI/Scrapegraph-ai
- Python SDK: https://github.com/ScrapeGraphAI/scrapegraph-py
- JS/TS SDK: https://github.com/ScrapeGraphAI/scrapegraph-js
- API दस्तावेज़: https://docs.scrapegraphai.com/introduction
🤝 योगदान
बेझिझक योगदान करें और सुधारों पर हमारे साथ चर्चा करने तथा सुझाव देने के लिए हमारे Discord सर्वर से जुड़ें!
कृपया योगदान दिशानिर्देश देखें।
🔗 ScrapeGraph API और SDKs
यदि आप अपने सिस्टम में ScrapeGraph को एकीकृत करने का त्वरित समाधान खोज रहे हैं, तो हमारी शक्तिशाली API यहाँ! देखें।
हम Python और Node.js दोनों में SDKs प्रदान करते हैं, जिससे आपके प्रोजेक्ट्स में एकीकरण आसान हो जाता है। इन्हें नीचे देखें:
| SDK | भाषा | GitHub लिंक |
|---|---|---|
| Python SDK | Python | scrapegraph-py |
| Node.js SDK | Node.js | scrapegraph-js |
आधिकारिक API दस्तावेज़ीकरण यहाँ पाया जा सकता है।
📈 टेलीमेट्री
हम अपने पैकेज की गुणवत्ता और उपयोगकर्ता अनुभव को बेहतर बनाने के लिए अनाम उपयोग मेट्रिक्स एकत्र करते हैं। यह डेटा हमें सुधारों को प्राथमिकता देने और अनुकूलता सुनिश्चित करने में मदद करता है। यदि आप ऑप्ट-आउट करना चाहते हैं, तो SCRAPEGRAPHAI_TELEMETRY_ENABLED=false एनवायरनमेंट वेरिएबल सेट करें। अधिक जानकारी के लिए, कृपया दस्तावेज़ीकरण यहाँ देखें।
❤️ योगदानकर्ता
🎓 उद्धरण
यदि आपने शोध उद्देश्यों के लिए हमारी लाइब्रेरी का उपयोग किया है, तो कृपया निम्नलिखित संदर्भ के साथ हमें उद्धृत करें:
@misc{scrapegraph-ai,
author = {Lorenzo Padoan, Marco Vinciguerra},
title = {Scrapegraph-ai},
year = {2024},
url = {https://github.com/ScrapeGraphAI/Scrapegraph-ai},
note = {A Python library for scraping leveraging large language models}
}
लेखक
📜 लाइसेंस
ScrapeGraphAI MIT लाइसेंस के अंतर्गत लाइसेंस प्राप्त है। अधिक जानकारी के लिए LICENSE फ़ाइल देखें।
आभार
- हम परियोजना के सभी योगदानकर्ताओं और उनके समर्थन के लिए ओपन-सोर्स समुदाय को धन्यवाद देना चाहते हैं।
- ScrapeGraphAI का उद्देश्य केवल डेटा अन्वेषण और शोध प्रयोजनों के लिए उपयोग है। लाइब्रेरी के किसी भी दुरुपयोग के लिए हम ज़िम्मेदार नहीं हैं।
❤️ के साथ बनाया गया ScrapeGraph AI द्वारा
