用于记录AI模型安全相关元数据的开放标准,涵盖训练数据来源、个人身份信息(PII)风险、已知漏洞及供应链详细信息。
状态:草案 — OWASP 孵化项目
本标准正在积极开发中。非常欢迎贡献和反馈。
当你从 HuggingFace 或任何其他仓库下载预训练模型时,你本质上是在信任一个黑盒。你不知道它是在什么数据上训练的,这些数据是否包含个人信息,是否做过对抗性攻击测试,也不知道它已知的失败模式是什么。对大多数业余项目来说,这没问题。但对于任何涉及真实用户、受监管行业或敏感数据的场景——这就真的不行了。
模型卡已经存在了一段时间,而且是个好主意。但现有的格式几乎完全集中在性能指标和公平性考量上。安全在很大程度上是事后才想到的,甚至可能根本没有涉及。
本项目正试图解决这个问题。我们正在构建一个开放标准,定义模型卡应包含哪些与安全相关的信息——如训练数据来源、PII(个人身份信息)暴露风险、已知漏洞、供应链细节和监管合规状态。这些是安全团队在评估某个模型能否安全部署时,真正能用得上的内容。
几件事同时汇聚在一起:
一个以安全为核心的模型卡标准,为开发者、审计人员和采购团队提供了通用语言和一份他们真正可以执行的检查清单。
以下是该标准下以安全为核心的模型卡的样子:
model_card_version: "0.1"
model_name: "example-text-classifier"
model_version: "1.2.0"
training_data:
sources:
- name: "Common Crawl (filtered)"
pii_assessment: "Presidio scan applied; residual risk: low"
license: "CC0"
pii_removal_method: "Microsoft Presidio + manual review on 5% sample"
data_cutoff_date: "2024-01-01"
security:
known_vulnerabilities: []
adversarial_testing: "Red-teamed against prompt injection; results in /security/redteam-report.md"
supply_chain:
base_model: "bert-base-uncased"
base_model_source: "https://huggingface.co/bert-base-uncased"
compliance:
eu_ai_act_risk_tier: "Limited"
gdpr_considerations: "No personal data retained post-training"
这是一个简化的摘录。完整的 schema 还涵盖事件历史、输出过滤、部署约束等更多字段。
/
├── README.md ← you are here
├── standard/
│ └── OWASP-Modelcard-Standard-Proposal.md ← the specification
├── templates/
│ └── model-card-template.md ← blank template to copy and fill in
├── examples/
│ └── llm-example.md ← worked example for a large language model
├── schema/
│ └── model-card-schema.json ← machine-readable JSON schema
├── mappings/
│ └── owasp-nist-euaiact-mapping.md ← how this standard relates to other frameworks
├── CONTRIBUTING.md ← how to get involved
├── CHANGELOG.md
└── LICENSE ← CC BY 4.0
本标准旨在补充而非取代现有工作:
这是一个早期阶段的项目,在发展方向上还有很大的塑造空间。以下是几种贡献方式:
#ai-ml-security 频道参与讨论如果你不确定从哪里开始,带有 good first issue 标签的开放 issue 是一个不错的切入点。
该项目目前正在进行 OWASP 新项目流程。一旦获得批准,它将迁移到 OWASP GitHub 组织下的 github.com/OWASP/owasp-model-card-security-standard。
本标准根据 知识共享署名 4.0 国际许可协议(CC BY 4.0) 发布。只要给予适当署名,你可以自由使用、改编和再分发本标准——包括商业用途。
本仓库中的任何工具均根据 Apache 2.0 许可。
| 框架 | 关系 |
|---|
| OWASP Top 10 for LLM Applications | 本标准有助于记录针对 LLM Top 10 中多项风险的缓解措施 |
| OWASP AI Exchange | 与 AI 安全指南保持一致,并在相关处交叉引用 |
| NIST AI Risk Management Framework | 标准字段映射到 AI RMF 的治理(Govern)、映射(Map)、度量(Measure)和管理(Manage)功能 |
| EU AI Act | 涵盖有限风险和高风险 AI 系统的透明度与文档记录义务 |
| HuggingFace Model Cards | 以安全专用字段扩展 HuggingFace 格式 |
| Google Model Cards | 与 Google 的方法兼容,并在此基础上增加安全层 |