Skip to content
KitploitKITPLOIT
ツールブログ
提出
ツールブログ
提出

ハッキング、侵入テスト、サイバーセキュリティツールをあなたのセキュリティアーセナルに!

Kitploitはハッキング、サイバーセキュリティ、ペネトレーションテストのツールディレクトリです。最新のプロジェクトアップデートを見つけて、脆弱性の発見、システム分析、テストの自動化、セキュリティの強化を行いましょう。

··フィード·お問い合わせ·プライバシー·© 2026 Kitploit

ツールディレクトリ

カテゴリ

すべてのカテゴリを見る
Loading categories
PurpleLlama — LLMセキュリティを評価・改善するためのツールセット。 | Kitploit
ツール/GitHubGitHub/meta-llama/purplellama
防御ツール脆弱性分析コード分析論文と研究レッドチーミングAIセキュリティ敵対的攻撃敵対的攻撃 第10位AIセキュリティ 第4位
GitHub
4.4k7736425日前Kitploit レビュー済み

人気

すべて見る →

コミュニティで最も使われているツールを見つけましょう。

すべてのツールを探索

ツールコレクションを閲覧

すべてのツールを見る →
共有
meta-llama/purplellama

PurpleLlama

LLMセキュリティを評価・改善するためのツールセット。

リポジトリを見る

🤗 Hugging Face のモデル  | ブログ  | ウェブサイト  | CyberSec Eval 論文   | Llama Guard 論文 


Purple Llama

Purple Llama は、時間の経過とともに、ツールと評価を結集し、コミュニティがオープンな生成 AI モデルを 責任を持って構築できるようにするための上位プロジェクトです。初期リリースには、サイバーセキュリティと 入出力セーフガードのためのツールと評価が含まれますが、近い将来 さらに多くの貢献を追加する予定です。

なぜ Purple なのか?

サイバーセキュリティの世界から 概念を借用し、生成 AI がもたらす課題を真に軽減するには、 攻撃(レッドチーム)と防御(ブルーチーム)の両方の姿勢を取る必要があると私たちは考えています。 レッドチームとブルーチームの両方の責務で構成されるパープルチーミングは、 潜在的なリスクを評価・軽減するための協力的なアプローチであり、 同じ理念が生成 AI にも当てはまります。したがって、 Purple Llama への投資は包括的なものになります。

ライセンス

Purple Llama プロジェクト内のコンポーネントは、研究と商用利用の両方を可能にする寛容なライセンスの下で提供されます。 これは、コミュニティのコラボレーションを可能にし、生成 AI 開発のための信頼と安全のツールの開発と利用を標準化するための大きな一歩であると考えています。 より具体的には、評価とベンチマークは MIT ライセンスの下で提供され、モデルは対応する Llama Community ライセンスを使用します。以下の表を参照してください:

コンポーネント種別コンポーネントライセンス
評価/ベンチマークCyber Security Eval(今後追加予定)MIT
セーフガードLlama GuardLlama 2 Community License
セーフガードLlama Guard 2Llama 3 Community License
セーフガードLlama Guard 3-8BLlama 3.2 Community License
セーフガードLlama Guard 3-1BLlama 3.2 Community License
セーフガードLlama Guard 3-11B-visionLlama 3.2 Community License
セーフガードPrompt GuardLlama 3.2 Community License
セーフガードCode ShieldMIT

システムレベルのセーフガード

Llama 3 の 責任ある利用ガイド で概説したように、 LLM へのすべての入力と出力は、アプリケーションに適したコンテンツガイドラインに従って チェックし、フィルタリングすることをお勧めします。

Llama Guard

Llama Guard 3 は、開発者がさまざまな一般的なタイプの違反コンテンツを検出できるように設計された、一連の高性能な入力・出力モデレーションモデルで構成されています。

これらは Meta-Llama 3.1 および 3.2 モデルをファインチューニングして構築され、さまざまな開発者のユースケースに対応するため、MLCommons 標準ハザード分類の検出をサポートするよう最適化されています。 また、7 つの新しい言語、128k のコンテキストウィンドウ、画像推論など、Llama 3.2 の機能リリースをサポートしています。Llama Guard 3 モデルは、有用なサイバー攻撃応答を検出し、コードインタープリタを使用する Llama システムのホスティング環境で LLM が生成した悪意のあるコードが実行されないようにするためにも最適化されています。

Prompt Guard

Prompt Guard は、LLM を活用したアプリケーションを悪意のあるプロンプトから保護し、そのセキュリティと完全性を確保するための強力なツールです。

プロンプト攻撃のカテゴリには、プロンプトインジェクションとジェイルブレイクが含まれます:

  • プロンプトインジェクションは、モデルのコンテキストウィンドウに第三者からの信頼できないデータが含まれることを悪用して、意図しない命令を実行させる入力です。
  • ジェイルブレイクは、モデルに組み込まれた安全性とセキュリティ機能を無効化するように設計された悪意のある命令です。

Code Shield

Code Shield は、LLM によって生成された安全でないコードの推論時フィルタリングをサポートします。Code Shield は、安全でないコード提案リスクの軽減、コードインタープリタの乱用防止、安全なコマンド実行を提供します。CodeShield サンプルノートブック。

評価とベンチマーク

サイバーセキュリティ

CyberSec Eval v1

CyberSec Eval v1 は、LLM 向けの業界初のサイバーセキュリティ安全評価セットであると私たちは考えています。これらのベンチマークは、業界のガイダンスと標準(例:CWE や MITRE ATT&CK)に基づいており、セキュリティの専門家との協力のもとに構築されました。私たちは、責任ある AI の開発に関するホワイトハウスのコミットメント に概説されたいくつかのリスクに対処するためのツールを提供することを目指しています。これには以下が含まれます:

  • LLM のサイバーセキュリティリスクを定量化するためのメトリクス。
  • 安全でないコード提案の頻度を評価するためのツール。
  • 悪意のあるコードを生成したり、サイバー攻撃を支援したりすることを困難にするための LLM 評価ツール。

私たちは、これらのツールが LLM が安全でない AI 生成コードを提案する頻度を減らし、サイバー攻撃者に対する有用性を低下させると考えています。初期の結果では、LLM には安全でないコードの推奨と悪意のあるリクエストへの対応の両方において、重大なサイバーセキュリティリスクがあることが示されています。詳細については、Cybersec Eval 論文 を参照してください。

CyberSec Eval 2

CyberSec Eval 2 は、LLM がコードインタープリタを乱用する傾向、攻撃的なサイバーセキュリティ能力、およびプロンプトインジェクションへの感受性を測定することで、前バージョンを拡張します。論文はこちらから読むことができます。

🤗 リーダーボードはこちらから確認できます。

CyberSec Eval 3

新しくリリースされた CyberSec Eval 3 には、視覚的プロンプトインジェクションテスト、スピアフィッシング能力テスト、自律型攻撃的サイバー運用テストの 3 つの追加テストスイートが含まれています。

はじめに

Llama リファレンスシステム の一部として、これらのセーフガードの採用と展開を容易にするための安全レイヤーを統合しています。 セーフガードを開始するためのリソースは、Llama-recipe GitHub リポジトリ で入手できます。

FAQ

Purple Llama コンポーネントだけでなく、一般的な Llama モデルに関する よくある質問の随時更新リストについては、FAQ を こちらで参照してください。

Purple Llama コミュニティに参加する

協力方法については、CONTRIBUTING ファイルを参照してください。

ツールをダウンロード