
New releaseOct 6, 2026
promptfoo v0.124.0
プロンプト、エージェント、RAGをテスト。AI向けのレッドチーミング/ペネトレーションテスト/脆弱性スキャン。GPT、Claude、Gemini、DeepSeekなどのパフォーマンスを比較。シンプルな宣言的設定で、コマンドラインおよびCI/CD統合に対応。OpenAIやAnthropicが使用しています。
Promptfoo: LLM 評価 & レッドチーミング
promptfoo は、LLM ベースのアプリを評価およびレッドチーミングするための CLI およびライブラリです。試行錯誤はやめて、安全で信頼性の高いエージェントを出荷しましょう
ウェブサイト · はじめに · レッドチーミング · ドキュメント · Discord
Promptfoo は OpenAI の一部となりました。Promptfoo はオープンソースかつ MIT ライセンスのままです。企業アップデートをお読みください。
クイックスタート
npm install -g promptfoo
promptfoo init --example getting-started
brew install promptfoo および pip install promptfoo でも利用可能です。または、インストールせずに任意のコマンドを実行するには npx promptfoo@latest を使用してください。
ほとんどの LLM プロバイダーは API キーを必要とします。環境変数として設定してください:
export OPENAI_API_KEY=sk-abc123
評価を実行して結果を表示:
cd getting-started
promptfoo eval
promptfoo view
Promptfoo でできること
- 自動評価でプロンプトとモデルをテスト
- レッドチーミングと脆弱性スキャンでLLM アプリを保護
- モデルを比較(OpenAI、Anthropic、Azure、Bedrock、Ollama、その他多数)
- CI/CDでチェックを自動化
- コードスキャンで LLM 関連のセキュリティおよびコンプライアンス問題についてプルリクエストをレビュー
- チームと結果を共有
実際の動作はこちら:
コマンドラインでも動作します:
セキュリティ脆弱性レポートを生成することもできます:
なぜ Promptfoo なのか?
- 開発者ファースト: ライブリロードやキャッシュなどの機能を備えた高速な動作
- プライベート: LLM 評価は 100% ローカルで実行 - プロンプトがマシンから出ることはありません
- 柔軟: あらゆる LLM API やプログラミング言語で動作
- 実戦で実証済み: 本番環境で 1,000 万人以上のユーザーにサービスを提供する LLM アプリを支える
- データドリブン: 勘ではなく指標に基づいて意思決定
- オープンソース: MIT ライセンス、活発なコミュニティ
さらに学ぶ
コントリビューション
コントリビューションを歓迎します!始めるにはコントリビューションガイドをご覧ください。
ヘルプやディスカッションには Discord コミュニティにご参加ください。