
promptfoo v0.122.0
プロンプト、エージェント、RAGをテスト。AI向けのレッドチーミング/ペネトレーションテスト/脆弱性スキャン。GPT、Claude、Gemini、DeepSeekなどのパフォーマンスを比較。シンプルな宣言的設定で、コマンドラインおよびCI/CD統合に対応。OpenAIやAnthropicが使用しています。
Promptfoo: LLM 評価 & レッドチーミング
promptfoo は、LLMアプリの評価とレッドチーミングのためのCLIおよびライブラリです。試行錯誤のアプローチをやめ、安全で信頼性の高いAIアプリを出荷しましょう。
ウェブサイト · はじめに · レッドチーミング · ドキュメント · Discord
Promptfoo は OpenAI の一部になりました。Promptfoo は引き続きオープンソースで MIT ライセンスです。会社の最新情報をご覧ください。
クイックスタート
npm および npx の使用には Node.js ^20.20.0 または >=22.22.0 が必要です。
Node.js 20 のサポートは 2026 年 7 月 30 日 00:00 UTC に終了します; その期限までに promptfoo を更新する前に Node.js 24 LTS にアップグレードしてください。
npm install -g promptfoo
promptfoo init --example getting-started
brew install promptfoo および pip install promptfoo でも利用できます。また、インストールせずに npx promptfoo@latest を使用して任意のコマンドを実行することもできます。
ほとんどのLLMプロバイダーはAPIキーを必要とします。環境変数として設定してください:
export OPENAI_API_KEY=sk-abc123
サンプルディレクトリに移動したら、評価を実行して結果を表示します:
cd getting-started
promptfoo eval
promptfoo view
詳細は、はじめに(評価)またはレッドチーミング(脆弱性スキャン)を参照してください。
Promptfoo でできること
- プロンプトとモデルをテスト 自動評価を使用
- LLMアプリを保護 レッドチーミングと脆弱性スキャンで
- モデルを比較 並べて表示(OpenAI, Anthropic, Azure, Bedrock, Ollama など詳細)
- チェックを自動化 CI/CDで
- プルリクエストをレビュー コードスキャンでLLM関連のセキュリティとコンプライアンスの問題を
- 結果を共有 チームで
実際の動作は次のとおりです:
コマンドラインでも動作します:
また、セキュリティ脆弱性レポートを生成することもできます:
Promptfoo の利点
- 開発者ファースト: 高速で、ライブリロードやキャッシュなどの機能を搭載
- プライベート: LLM 評価は100%ローカルで実行 - プロンプトがマシンを離れることはありません
- 柔軟性: 任意のLLM APIまたはプログラミング言語で動作
- 実戦でテスト済み: 本番環境で1000万以上のユーザーにサービスを提供するLLMアプリを支える
- データ駆動型: 直感ではなくメトリクスに基づいて意思決定
- オープンソース: MITライセンス、活発なコミュニティ
詳細情報
コントリビューション
コントリビューションを歓迎します!コントリビューションガイドをチェックして始めてください。
ヘルプやディスカッションのために、Discordコミュニティに参加してください。