업데이트로 돌아가기
New releaseAug 19, 2026

Scrapegraph-ai v2.1.7

AI 기반 Python 스크레이퍼

공유

🚀 더 빠르고 간단하게 대규모 스크래핑을 할 방법을 찾고 계신가요? (단 5줄의 코드만으로!) 그렇다면 향상된 버전을 ScrapeGraphAI.com에서 확인해보세요! 🚀


🕷️ ScrapeGraphAI: 한 번만 스크래핑하세요

ScrapeGraphAI

English | 中文 | 日本語 | 한국어 | Русский | Türkçe | Deutsch | Español | français | Português | Italiano

PyPI Downloads

License: MIT

ScrapeGraphAI%2FScrapegraph-ai | Trendshift

ScrapeGraphAI는 LLM과 직접 그래프 로직을 사용하여 웹사이트 및 로컬 문서(XML, HTML, JSON, Markdown 등)에 대한 스크래핑 파이프라인을 생성하는 웹 스크래핑 Python 라이브러리입니다.

추출하려는 정보를 말하기만 하면 라이브러리가 알아서 해줍니다!

🚀 통합

ScrapeGraphAI는 인기 있는 프레임워크 및 도구와의 원활한 통합을 제공하여 스크래핑 기능을 향상시킵니다. Python 또는 Node.js로 구축하든, LLM 프레임워크를 사용하든, 노코드 플랫폼에서 작업하든, 포괄적인 통합 옵션으로 모든 것을 지원합니다..

Web data extraction at scale? Try ScrapeGraphAI cloud

다음 링크에서 더 많은 정보를 찾을 수 있습니다.

통합:

🚀 빠른 설치

Scrapegraph-ai의 참조 페이지는 PyPI 공식 페이지에서 확인할 수 있습니다: pypi.

pip install scrapegraphai

# IMPORTANT (for fetching websites content)
playwright install

참고: 다른 라이브러리와의 충돌을 방지하기 위해 가상 환경에 라이브러리를 설치하는 것이 좋습니다 🐱

💻 사용법

웹사이트(또는 로컬 파일)에서 정보를 추출하는 데 사용할 수 있는 여러 표준 스크래핑 파이프라인이 있습니다.

가장 일반적인 것은 SmartScraperGraph로, 사용자 프롬프트와 소스 URL을 기반으로 단일 페이지에서 정보를 추출합니다.

from scrapegraphai.graphs import SmartScraperGraph

# Define the configuration for the scraping pipeline
graph_config = {
    "llm": {
        "model": "ollama/llama3.2",
        "model_tokens": 8192,
        "format": "json",
    },
    "verbose": True,
    "headless": False,
}

# Create the SmartScraperGraph instance
smart_scraper_graph = SmartScraperGraph(
    prompt="Extract useful information from the webpage, including a description of what the company does, founders and social media links",
    source="https://scrapegraphai.com/",
    config=graph_config
)

# Run the pipeline
result = smart_scraper_graph.run()

import json
print(json.dumps(result, indent=4))

[!NOTE] OpenAI 및 기타 모델의 경우 llm 설정만 변경하면 됩니다!

graph_config = {
   "llm": {
       "api_key": "YOUR_OPENAI_API_KEY",
       "model": "openai/gpt-4o-mini",
   },
   "verbose": True,
   "headless": False,
}

출력은 다음과 같은 딕셔너리 형태가 됩니다:

{
    "description": "ScrapeGraphAI transforms websites into clean, organized data for AI agents and data analytics. It offers an AI-powered API for effortless and cost-effective data extraction.",
    "founders": [
        {
            "name": "",
            "role": "Founder & Technical Lead",
            "linkedin": "https://www.linkedin.com/in/perinim/"
        },
        {
            "name": "Marco Vinciguerra",
            "role": "Founder & Software Engineer",
            "linkedin": "https://www.linkedin.com/in/marco-vinciguerra-7ba365242/"
        },
        {
            "name": "Lorenzo Padoan",
            "role": "Founder & Product Engineer",
            "linkedin": "https://www.linkedin.com/in/lorenzo-padoan-4521a2154/"
        }
    ],
    "social_media_links": {
        "linkedin": "https://www.linkedin.com/company/101881123",
        "twitter": "https://x.com/scrapegraphai",
        "github": "https://github.com/ScrapeGraphAI/Scrapegraph-ai"
    }
}

여러 페이지에서 정보를 추출하거나, Python 스크립트를 생성하거나, 오디오 파일을 생성하는 데 사용할 수 있는 다른 파이프라인도 있습니다.

파이프라인 이름설명
SmartScraperGraph사용자 프롬프트와 입력 소스만 필요한 단일 페이지 스크래퍼.
SearchGraph검색 엔진의 상위 n개 검색 결과에서 정보를 추출하는 다중 페이지 스크래퍼.
SpeechGraph웹사이트에서 정보를 추출하고 오디오 파일을 생성하는 단일 페이지 스크래퍼.
ScriptCreatorGraph웹사이트에서 정보를 추출하고 Python 스크립트를 생성하는 단일 페이지 스크래퍼.
SmartScraperMultiGraph단일 프롬프트와 소스 목록을 기반으로 여러 페이지에서 정보를 추출하는 다중 페이지 스크래퍼.
ScriptCreatorMultiGraph여러 페이지와 소스에서 정보를 추출하는 Python 스크립트를 생성하는 다중 페이지 스크래퍼.

이러한 각 그래프에는 멀티 버전이 있습니다. 이를 통해 LLM 호출을 병렬로 수행할 수 있습니다.

OpenAI, Groq, Azure, Gemini, MiniMax 등과 같은 API를 통해 다양한 LLM을 사용하거나 Ollama를 사용하여 로컬 모델을 사용할 수 있습니다.

로컬 모델을 사용하려면 Ollama를 설치하고 ollama pull 명령어로 모델을 다운로드해야 합니다.

📖 문서

Open In Colab

ScrapeGraphAI 문서는 여기에서 확인할 수 있습니다.

🆚 오픈 소스 vs 관리형 API

ScrapeGraphAI는 두 가지 형태로 제공됩니다: 직접 실행하는 오픈 소스 라이브러리와 (Python 및 JS/TS SDK를 통해 사용하는) 관리형 클라우드 API입니다. 아래 표는 차이점을 설명하여 적합한 것을 선택할 수 있도록 합니다.

카테고리