
ステータス: ドラフト — インキュベーション中の OWASP プロジェクト
この標準は活発に開発中です。貢献とフィードバックを歓迎します。
HuggingFace やその他のリポジトリから事前学習モデルをダウンロードするとき、あなたは本質的にブラックボックスを信頼していることになります。そのモデルがどのようなデータで学習されたのか、そのデータに個人情報が含まれているかどうか、敵対的攻撃に対してどのようにテストされたのか、既知の障害モードが何かを知ることはできません。ほとんどの趣味のプロジェクトではそれで問題ありません。しかし、実際のユーザー、規制産業、または機微データに触れるものにとっては、それはまったく問題ありです。
モデルカードは以前から存在し、良いアイデアです。しかし、既存のフォーマットはほぼ完全にパフォーマンス指標と公平性の考慮事項に焦点を当てています。セキュリティは、たとえ含まれていたとしても、ほとんど後付けです。
このプロジェクトはそれを修正しようとしています。私たちは、モデルカードに含めるべきセキュリティ関連情報を定義するオープン標準を構築しています。たとえば、トレーニングデータの来歴、PII露出リスク、既知の脆弱性、サプライチェーンの詳細、規制コンプライアンス状況などです。セキュリティチームがモデルをデプロイしても安全かどうかを評価する際に実際に使用できるものです。
いくつかの要素が同時に重なっています:
セキュリティに焦点を当てたモデルカード標準は、開発者、監査人、調達チームに共通言語と、実際に行動に移せるチェックリストを提供します。
この標準に基づくセキュリティ重視のモデルカードのイメージは次のとおりです:
model_card_version: "0.1"
model_name: "example-text-classifier"
model_version: "1.2.0"
training_data:
sources:
- name: "Common Crawl (filtered)"
pii_assessment: "Presidio scan applied; residual risk: low"
license: "CC0"
pii_removal_method: "Microsoft Presidio + manual review on 5% sample"
data_cutoff_date: "2024-01-01"
security:
known_vulnerabilities: []
adversarial_testing: "Red-teamed against prompt injection; results in /security/redteam-report.md"
supply_chain:
base_model: "bert-base-uncased"
base_model_source: "https://huggingface.co/bert-base-uncased"
compliance:
eu_ai_act_risk_tier: "Limited"
gdpr_considerations: "No personal data retained post-training"
これは簡略化した抜粋です。完全なスキーマは、インシデント履歴、出力フィルタリング、デプロイ制約などの追加フィールドをカバーしています。
/
├── README.md ← you are here
├── standard/
│ └── OWASP-Modelcard-Standard-Proposal.md ← the specification
├── templates/
│ └── model-card-template.md ← blank template to copy and fill in
├── examples/
│ └── llm-example.md ← worked example for a large language model
├── schema/
│ └── model-card-schema.json ← machine-readable JSON schema
├── mappings/
│ └── owasp-nist-euaiact-mapping.md ← how this standard relates to other frameworks
├── CONTRIBUTING.md ← how to get involved
├── CHANGELOG.md
└── LICENSE ← CC BY 4.0
この標準は、既存の取り組みを置き換えるのではなく補完するように設計されています:
これは初期段階のプロジェクトであり、方向性を形作る余地が十分にあります。貢献する方法はいくつかあります:
#ai-ml-securityで議論に参加してくださいどこから始めればよいかわからない場合は、good first issueとラベル付けされたオープンイシューを探すのがよいでしょう。
このプロジェクトは現在、OWASPの新規プロジェクトプロセスを進めています。承認されると、github.com/OWASP/owasp-model-card-security-standardのOWASP GitHub組織に移行します。
この標準はクリエイティブ・コモンズ 表示 4.0 国際 (CC BY 4.0)の下で公開されています。適切なクレジットを表示する限り、商用を含め、自由に使用、改変、再配布できます。
このリポジトリ内のツールはApache 2.0の下でライセンスされています。
| フレームワーク | 関係 |
|---|
| OWASP Top 10 for LLM Applications | この標準は、LLM Top 10のリスクのいくつかに対する緩和策を文書化するのに役立ちます |
| OWASP AI Exchange | AIセキュリティガイダンスと整合し、関連する箇所で相互参照されます |
| NIST AI Risk Management Framework | 標準フィールドはAI RMFのgovern、map、measure、manage機能に対応します |
| EU AI Act | 限定リスクおよび高リスクAIシステムの透明性と文書化の義務をカバーします |
| HuggingFace Model Cards | HuggingFace形式をセキュリティ固有のフィールドで拡張します |
| Google Model Cards | Googleのアプローチと互換性があり、その上にセキュリティレイヤーを追加します |