
Scrapegraph-ai v2.1.7
AI पर आधारित Python स्क्रैपर
🚀 बड़े पैमाने पर स्क्रेप करने का और भी तेज़ और सरल तरीका खोज रहे हैं (सिर्फ 5 लाइन कोड)? तो हमारा उन्नत संस्करण ScrapeGraphAI.com पर देखें! 🚀
🕷️ ScrapeGraphAI: आप केवल एक बार स्क्रेप करते हैं
English | 中文 | 日本語 | 한국어 | Русский | Türkçe | Deutsch | Español | français | Português | Italiano
ScrapeGraphAI एक वेब स्क्रेपिंग पायथन लाइब्रेरी है जो वेबसाइटों और स्थानीय दस्तावेज़ों (XML, HTML, JSON, Markdown, आदि) के लिए स्क्रेपिंग पाइपलाइन बनाने के लिए LLM और प्रत्यक्ष ग्राफ़ लॉजिक का उपयोग करती है।
आप बस यह बताइए कि आप कौन-सी जानकारी निकालना चाहते हैं और लाइब्रेरी वह आपके लिए कर देगी!
🚀 एकीकरण
ScrapeGraphAI लोकप्रिय फ्रेमवर्क और टूल्स के साथ सहज एकीकरण प्रदान करता है ताकि आपकी स्क्रेपिंग क्षमताएँ बढ़ें। चाहे आप Python या Node.js के साथ विकास कर रहे हों, LLM फ्रेमवर्क का उपयोग कर रहे हों, या नो-कोड प्लेटफ़ॉर्म पर काम कर रहे हों, हमारे व्यापक एकीकरण विकल्पों की बदौलत हम आपके लिए सब कुछ संभाल लेते हैं।
अधिक जानकारी आप निम्नलिखित लिंक पर पा सकते हैं
एकीकरण:
- API: दस्तावेज़ीकरण
- SDKs: Python, Node
- LLM फ्रेमवर्क: Langchain, Llama Index, Crew.ai, Agno, CamelAI
- लो-कोड फ्रेमवर्क: Pipedream, Bubble, Zapier, n8n, Dify, Toolhouse
- MCP सर्वर: लिंक
🚀 त्वरित इंस्टॉल
Scrapegraph-ai के लिए संदर्भ पृष्ठ PyPI के आधिकारिक पृष्ठ पर उपलब्ध है: pypi।
pip install scrapegraphai
# IMPORTANT (for fetching websites content)
playwright install
नोट: अन्य लाइब्रेरीज़ के साथ टकराव से बचने के लिए लाइब्रेरी को वर्चुअल एनवायरनमेंट में इंस्टॉल करने की अनुशंसा की जाती है 🐱
💻 उपयोग
किसी वेबसाइट (या स्थानीय फ़ाइल) से जानकारी निकालने के लिए कई मानक स्क्रेपिंग पाइपलाइनों का उपयोग किया जा सकता है।
सबसे आम है SmartScraperGraph, जो उपयोगकर्ता प्रॉम्प्ट और स्रोत URL दिए जाने पर एक ही पेज से जानकारी निकालता है।
from scrapegraphai.graphs import SmartScraperGraph
# Define the configuration for the scraping pipeline
graph_config = {
"llm": {
"model": "ollama/llama3.2",
"model_tokens": 8192,
"format": "json",
},
"verbose": True,
"headless": False,
}
# Create the SmartScraperGraph instance
smart_scraper_graph = SmartScraperGraph(
prompt="Extract useful information from the webpage, including a description of what the company does, founders and social media links",
source="https://scrapegraphai.com/",
config=graph_config
)
# Run the pipeline
result = smart_scraper_graph.run()
import json
print(json.dumps(result, indent=4))
[!NOTE] OpenAI और अन्य मॉडलों के लिए आपको केवल llm कॉन्फ़िग बदलने की आवश्यकता है!
graph_config = { "llm": { "api_key": "YOUR_OPENAI_API_KEY", "model": "openai/gpt-4o-mini", }, "verbose": True, "headless": False, }
आउटपुट निम्नलिखित जैसा एक डिक्शनरी होगा:
{
"description": "ScrapeGraphAI transforms websites into clean, organized data for AI agents and data analytics. It offers an AI-powered API for effortless and cost-effective data extraction.",
"founders": [
{
"name": "",
"role": "Founder & Technical Lead",
"linkedin": "https://www.linkedin.com/in/perinim/"
},
{
"name": "Marco Vinciguerra",
"role": "Founder & Software Engineer",
"linkedin": "https://www.linkedin.com/in/marco-vinciguerra-7ba365242/"
},
{
"name": "Lorenzo Padoan",
"role": "Founder & Product Engineer",
"linkedin": "https://www.linkedin.com/in/lorenzo-padoan-4521a2154/"
}
],
"social_media_links": {
"linkedin": "https://www.linkedin.com/company/101881123",
"twitter": "https://x.com/scrapegraphai",
"github": "https://github.com/ScrapeGraphAI/Scrapegraph-ai"
}
}
कई पेजों से जानकारी निकालने, Python स्क्रिप्ट बनाने, या यहाँ तक कि ऑडियो फ़ाइलें बनाने के लिए अन्य पाइपलाइनें भी उपलब्ध हैं।