アップデート一覧に戻る
New releaseAug 19, 2026

Scrapegraph-ai v2.1.7

AI ベースの Python スクレイパー

共有

🚀 さらに高速でシンプルな大規模スクレイピング方法(わずか5行のコード)をお探しですか? ScrapeGraphAI.com で拡張版をチェックしてください! 🚀


🕷️ ScrapeGraphAI: スクレイプは一度だけ

ScrapeGraphAI

English | 中文 | 日本語 | 한국어 | Русский | Türkçe | Deutsch | Español | français | Português | Italiano

PyPI Downloads

License: MIT

ScrapeGraphAI%2FScrapegraph-ai | Trendshift

ScrapeGraphAI は、LLMとダイレクトグラフロジックを使用して、ウェブサイトやローカルドキュメント(XML、HTML、JSON、Markdownなど)向けのスクレイピングパイプラインを作成する ウェブスクレイピング Pythonライブラリです。

抽出したい情報を指定するだけで、ライブラリが処理を実行してくれます!

🚀 統合機能

ScrapeGraphAIは、人気のフレームワークやツールとのシームレスな統合を提供し、スクレイピング機能を強化します。PythonやNode.jsでの開発、LLMフレームワークの利用、ノーコードプラットフォームでの作業など、あらゆるニーズに対応する包括的な統合オプションを提供しています。

大規模なWebデータ抽出をお探しですか?ScrapeGraphAIクラウドをお試しください

詳細については、次のリンクをご覧ください。

統合機能:

🚀 クイックインストール

Scrapegraph-aiのリファレンスページは、PyPIの公式ページで公開されています: pypi

pip install scrapegraphai

# IMPORTANT (for fetching websites content)
playwright install

注記: 他のライブラリとの競合を避けるために、仮想環境にライブラリをインストールすることをお勧めします 🐱

💻 使用方法

ウェブサイト(またはローカルファイル)から情報を抽出するために使用できる、複数の標準スクレイピングパイプラインがあります。

最も一般的なのは SmartScraperGraph で、ユーザープロンプトとソースURLを指定すると、単一のページから情報を抽出します。

from scrapegraphai.graphs import SmartScraperGraph

# Define the configuration for the scraping pipeline
graph_config = {
    "llm": {
        "model": "ollama/llama3.2",
        "model_tokens": 8192,
        "format": "json",
    },
    "verbose": True,
    "headless": False,
}

# Create the SmartScraperGraph instance
smart_scraper_graph = SmartScraperGraph(
    prompt="Extract useful information from the webpage, including a description of what the company does, founders and social media links",
    source="https://scrapegraphai.com/",
    config=graph_config
)

# Run the pipeline
result = smart_scraper_graph.run()

import json
print(json.dumps(result, indent=4))

[!NOTE] OpenAIやその他のモデルを使用する場合は、llm設定を変更するだけです!

graph_config = {
   "llm": {
       "api_key": "YOUR_OPENAI_API_KEY",
       "model": "openai/gpt-4o-mini",
   },
   "verbose": True,
   "headless": False,
}

出力は次のような辞書になります:

{
    "description": "ScrapeGraphAI transforms websites into clean, organized data for AI agents and data analytics. It offers an AI-powered API for effortless and cost-effective data extraction.",
    "founders": [
        {
            "name": "",
            "role": "Founder & Technical Lead",
            "linkedin": "https://www.linkedin.com/in/perinim/"
        },
        {
            "name": "Marco Vinciguerra",
            "role": "Founder & Software Engineer",
            "linkedin": "https://www.linkedin.com/in/marco-vinciguerra-7ba365242/"
        },
        {
            "name": "Lorenzo Padoan",
            "role": "Founder & Product Engineer",
            "linkedin": "https://www.linkedin.com/in/lorenzo-padoan-4521a2154/"
        }
    ],
    "social_media_links": {
        "linkedin": "https://www.linkedin.com/company/101881123",
        "twitter": "https://x.com/scrapegraphai",
        "github": "https://github.com/ScrapeGraphAI/Scrapegraph-ai"
    }
}

複数のページから情報を抽出したり、Pythonスクリプトを生成したり、オーディオファイルを生成したりできる、他のパイプラインもあります。

パイプライン名説明
SmartScraperGraphユーザープロンプトと入力ソースのみを必要とするシングルページスクレイパー。
SearchGraph検索エンジンの上位n件の検索結果から情報を抽出するマルチページスクレイパー。
SpeechGraphウェブサイトから情報を抽出し、オーディオファイルを生成するシングルページスクレイパー。
ScriptCreatorGraphウェブサイトから情報を抽出し、Pythonスクリプトを生成するシングルページスクレイパー。
SmartScraperMultiGraph単一のプロンプトとソースのリストを指定して、複数のページから情報を抽出するマルチページスクレイパー。
ScriptCreatorMultiGraph複数のページとソースから情報を抽出するためのPythonスクリプトを生成するマルチページスクレイパー。

これらの各グラフにはマルチバージョンがあります。LLMへの呼び出しを並列で実行できます。

OpenAIGroqAzureGeminiMiniMax などのAPIを通じてさまざまなLLMを使用したり、Ollama を使用してローカルモデルを使用したりすることができます。

ローカルモデルを使用する場合は、Ollama をインストールし、ollama pull コマンドでモデルをダウンロードすることを忘れないでください。

📖 ドキュメント

Open In Colab

ScrapeGraphAIのドキュメントはこちらにあります。

🆚 オープンソース vs マネージドAPI

ScrapeGraphAIには、自分で実行するオープンソースライブラリと、マネージドクラウドAPIPython および JS/TS SDK経由で使用)の2つのバージョンがあります。この表は違いを説明しているので、適切な方を選択できます。

オープンソース(scrapegraphaiマネージドAPI(scrapegraph-py / scrapegraph-js
概要自分で実行するPythonライブラリSDK経由で呼び出すホスト型クラウドサービス
実行環境自社インフラ(セルフホスト)ScrapeGraphAIクラウド
LLM自分で用意(OpenAI、Groq、Gemini、Azure、Ollama経由のローカル)管理不要
ブラウザ / JSレンダリング自分で設定(Playwright)管理済み(ステルス、auto/fast/js モード)
プロキシ & アンチボット自己責任含まれています
スケーリング & メンテナンス自己責任完全管理
コストモデルLLMトークン + 自社インフラ従量課金クレジット
認証独自のLLMキーSGAI_API_KEY
機能グラフパイプライン(SmartScraper、Search、Speech、ScriptCreator…)Scrape、Extract、Search、Crawl、Monitor、History
セットアップの手間設定が多い最小限 — APIキー + 1回の呼び出し
ライセンスMITSDKはMIT、APIサービスは有料

完全な制御、オンプレミス/セルフホストのデータ、ローカルLLM(Ollama)、または細かいコスト調整を希望し、ブラウザ、プロキシ、スケーリングを自分で管理しても構わない場合は、オープンソースライブラリを選択してください。

インフラゼロ、管理されたJSレンダリング&アンチボット、組み込みのCrawl とスケジュールされたMonitor ジョブ、そして本番環境への最短ルートを希望する場合は、マネージドAPI を選択してください — クレジット単位の課金です。

🤝 コントリビューション

ぜひコントリビュートして、改善点について話し合い、提案を共有するためにDiscordサーバーに参加してください!

コントリビューションガイドラインをご覧ください。

My Skills My Skills My Skills

🔗 ScrapeGraph API & SDKs

ScrapeGraphをシステムに統合するための迅速なソリューションをお探しの場合は、こちらで当社の高性能APIをチェックしてください!

API Banner

PythonとNode.jsの両方でSDKを提供しており、プロジェクトへの統合が簡単です。以下で確認できます:

SDK言語GitHubリンク
Python SDKPythonscrapegraph-py
Node.js SDKNode.jsscrapegraph-js

公式APIドキュメントはこちらにあります。

📈 テレメトリー

パッケージの品質とユーザーエクスペリエンスを向上させるため、匿名の使用状況メトリクスを収集しています。このデータは、改善の優先順位付けと互換性の確保に役立ちます。オプトアウトを希望する場合は、環境変数 SCRAPEGRAPHAI_TELEMETRY_ENABLED=false を設定してください。詳細については、こちらのドキュメントを参照してください。

❤️ コントリビューター

Contributors

🎓 引用

研究目的で当ライブラリを使用された場合は、以下の参考文献として引用してください:

  @misc{scrapegraph-ai,
    author = {Lorenzo Padoan, Marco Vinciguerra},
    title = {Scrapegraph-ai},
    year = {2024},
    url = {https://github.com/ScrapeGraphAI/Scrapegraph-ai},
    note = {A Python library for scraping leveraging large language models}
  }

著作者

連絡先情報
Marco VinciguerraLinkedin Badge
Lorenzo PadoanLinkedin Badge

📜 ライセンス

ScrapeGraphAIはMITライセンスの下でライセンスされています。詳細については、LICENSEファイルを参照してください。

謝辞

  • プロジェクトへのすべてのコントリビューターと、支援してくださったオープンソースコミュニティに感謝いたします。
  • ScrapeGraphAIは、データ探索および研究目的専用に作られています。ライブラリの誤用については一切責任を負いません。

❤️を込めて ScrapeGraph AI が作成

Scarf tracking

カテゴリ