
LLMセキュリティを評価・改善するためのツールセット。
🤗 Hugging Face のモデル | ブログ | ウェブサイト | CyberSec Eval 論文 | Llama Guard 論文
Purple Llama は、時間の経過とともに、ツールと評価を結集し、コミュニティがオープンな生成 AI モデルを 責任を持って構築できるようにするための上位プロジェクトです。初期リリースには、サイバーセキュリティと 入出力セーフガードのためのツールと評価が含まれますが、近い将来 さらに多くの貢献を追加する予定です。
サイバーセキュリティの世界から 概念を借用し、生成 AI がもたらす課題を真に軽減するには、 攻撃(レッドチーム)と防御(ブルーチーム)の両方の姿勢を取る必要があると私たちは考えています。 レッドチームとブルーチームの両方の責務で構成されるパープルチーミングは、 潜在的なリスクを評価・軽減するための協力的なアプローチであり、 同じ理念が生成 AI にも当てはまります。したがって、 Purple Llama への投資は包括的なものになります。
Purple Llama プロジェクト内のコンポーネントは、研究と商用利用の両方を可能にする寛容なライセンスの下で提供されます。 これは、コミュニティのコラボレーションを可能にし、生成 AI 開発のための信頼と安全のツールの開発と利用を標準化するための大きな一歩であると考えています。 より具体的には、評価とベンチマークは MIT ライセンスの下で提供され、モデルは対応する Llama Community ライセンスを使用します。以下の表を参照してください:
| コンポーネント種別 | コンポーネント | ライセンス |
|---|---|---|
| 評価/ベンチマーク | Cyber Security Eval(今後追加予定) | MIT |
| セーフガード | Llama Guard | Llama 2 Community License |
| セーフガード | Llama Guard 2 | Llama 3 Community License |
| セーフガード | Llama Guard 3-8B | Llama 3.2 Community License |
| セーフガード | Llama Guard 3-1B | Llama 3.2 Community License |
| セーフガード | Llama Guard 3-11B-vision | Llama 3.2 Community License |
| セーフガード | Prompt Guard | Llama 3.2 Community License |
| セーフガード | Code Shield | MIT |
Llama 3 の 責任ある利用ガイド で概説したように、 LLM へのすべての入力と出力は、アプリケーションに適したコンテンツガイドラインに従って チェックし、フィルタリングすることをお勧めします。
Llama Guard 3 は、開発者がさまざまな一般的なタイプの違反コンテンツを検出できるように設計された、一連の高性能な入力・出力モデレーションモデルで構成されています。
これらは Meta-Llama 3.1 および 3.2 モデルをファインチューニングして構築され、さまざまな開発者のユースケースに対応するため、MLCommons 標準ハザード分類の検出をサポートするよう最適化されています。 また、7 つの新しい言語、128k のコンテキストウィンドウ、画像推論など、Llama 3.2 の機能リリースをサポートしています。Llama Guard 3 モデルは、有用なサイバー攻撃応答を検出し、コードインタープリタを使用する Llama システムのホスティング環境で LLM が生成した悪意のあるコードが実行されないようにするためにも最適化されています。
Prompt Guard は、LLM を活用したアプリケーションを悪意のあるプロンプトから保護し、そのセキュリティと完全性を確保するための強力なツールです。
プロンプト攻撃のカテゴリには、プロンプトインジェクションとジェイルブレイクが含まれます:
Code Shield は、LLM によって生成された安全でないコードの推論時フィルタリングをサポートします。Code Shield は、安全でないコード提案リスクの軽減、コードインタープリタの乱用防止、安全なコマンド実行を提供します。CodeShield サンプルノートブック。
CyberSec Eval v1 は、LLM 向けの業界初のサイバーセキュリティ安全評価セットであると私たちは考えています。これらのベンチマークは、業界のガイダンスと標準(例:CWE や MITRE ATT&CK)に基づいており、セキュリティの専門家との協力のもとに構築されました。私たちは、責任ある AI の開発に関するホワイトハウスのコミットメント に概説されたいくつかのリスクに対処するためのツールを提供することを目指しています。これには以下が含まれます:
私たちは、これらのツールが LLM が安全でない AI 生成コードを提案する頻度を減らし、サイバー攻撃者に対する有用性を低下させると考えています。初期の結果では、LLM には安全でないコードの推奨と悪意のあるリクエストへの対応の両方において、重大なサイバーセキュリティリスクがあることが示されています。詳細については、Cybersec Eval 論文 を参照してください。
CyberSec Eval 2 は、LLM がコードインタープリタを乱用する傾向、攻撃的なサイバーセキュリティ能力、およびプロンプトインジェクションへの感受性を測定することで、前バージョンを拡張します。論文はこちらから読むことができます。
🤗 リーダーボードはこちらから確認できます。
新しくリリースされた CyberSec Eval 3 には、視覚的プロンプトインジェクションテスト、スピアフィッシング能力テスト、自律型攻撃的サイバー運用テストの 3 つの追加テストスイートが含まれています。
Llama リファレンスシステム の一部として、これらのセーフガードの採用と展開を容易にするための安全レイヤーを統合しています。 セーフガードを開始するためのリソースは、Llama-recipe GitHub リポジトリ で入手できます。
Purple Llama コンポーネントだけでなく、一般的な Llama モデルに関する よくある質問の随時更新リストについては、FAQ を こちらで参照してください。
協力方法については、CONTRIBUTING ファイルを参照してください。