Открытый стандарт для документирования метаданных ИИ-моделей, значимых для безопасности, включая происхождение обучающих данных, риск PII, известные уязвимости и сведения о цепочке поставок.
Статус: Черновик — инкубационный проект OWASP
Этот стандарт находится в стадии активной разработки. Вклад и обратная связь очень приветствуются.
Когда вы загружаете предобученную модель с HuggingFace или из любого другого репозитория, вы по сути доверяете чёрному ящику. Вы не знаете, на каких данных она обучалась, содержали ли эти данные персональную информацию, как она проверялась на состязательные атаки и каковы её известные режимы отказов. Для большинства любительских проектов это нормально. Для всего, что касается реальных пользователей, регулируемых отраслей или чувствительных данных, — уже совсем нет.
Карточки моделей существуют уже какое-то время, и это хорошая идея. Но существующие форматы почти полностью сосредоточены на метриках производительности и вопросах справедливости. Безопасность, по сути, остаётся на втором плане — если вообще присутствует.
Этот проект пытается это исправить. Мы создаём открытый стандарт, определяющий, какую информацию, значимую для безопасности, должна содержать карточка модели, — например, происхождение обучающих данных, риск раскрытия PII, известные уязвимости, детали цепочки поставок и статус соответствия нормативным требованиям. То, что команда безопасности действительно может использовать при оценке того, безопасно ли разворачивать модель.
Сразу несколько факторов сошлись одновременно:
Стандарт карточек моделей, ориентированный на безопасность, даёт разработчикам, аудиторам и закупочным командам общий язык и чек-лист, на основе которого они реально могут действовать.
Вот пример того, как выглядит карточка модели с фокусом на безопасность в соответствии с этим стандартом:
model_card_version: "0.1"
model_name: "example-text-classifier"
model_version: "1.2.0"
training_data:
sources:
- name: "Common Crawl (filtered)"
pii_assessment: "Presidio scan applied; residual risk: low"
license: "CC0"
pii_removal_method: "Microsoft Presidio + manual review on 5% sample"
data_cutoff_date: "2024-01-01"
security:
known_vulnerabilities: []
adversarial_testing: "Red-teamed against prompt injection; results in /security/redteam-report.md"
supply_chain:
base_model: "bert-base-uncased"
base_model_source: "https://huggingface.co/bert-base-uncased"
compliance:
eu_ai_act_risk_tier: "Limited"
gdpr_considerations: "No personal data retained post-training"
Это упрощённый фрагмент. Полная схема охватывает дополнительные поля для истории инцидентов, фильтрации выходных данных, ограничений развёртывания и много другого.
/
├── README.md ← you are here
├── standard/
│ └── OWASP-Modelcard-Standard-Proposal.md ← the specification
├── templates/
│ └── model-card-template.md ← blank template to copy and fill in
├── examples/
│ └── llm-example.md ← worked example for a large language model
├── schema/
│ └── model-card-schema.json ← machine-readable JSON schema
├── mappings/
│ └── owasp-nist-euaiact-mapping.md ← how this standard relates to other frameworks
├── CONTRIBUTING.md ← how to get involved
├── CHANGELOG.md
└── LICENSE ← CC BY 4.0
Этот стандарт призван дополнять, а не заменять существующие наработки:
| Фреймворк | Связь |
|---|---|
| OWASP Top 10 for LLM Applications | Этот стандарт помогает документировать меры по снижению рисков для нескольких рисков из LLM Top 10 |
| OWASP AI Exchange | Согласован с руководствами по безопасности ИИ; перекрёстные ссылки приведены там, где уместно |
| NIST AI Risk Management Framework | Поля стандарта сопоставляются с функциями govern, map, measure и manage из AI RMF |
| EU AI Act | Охватывает обязательства по прозрачности и документации для систем ИИ с ограниченным и высоким риском |
| HuggingFace Model Cards | Расширяет формат HuggingFace полями, специфичными для безопасности |
| Google Model Cards | Совместим с подходом Google; добавляет поверх уровень безопасности |
Это проект на ранней стадии, и есть масса возможностей повлиять на его направление. Несколько способов внести вклад:
#ai-ml-securityЕсли не знаете, с чего начать, разумнее всего начать с открытых issues с меткой good first issue.
Этот проект в настоящее время проходит процедуру приёма новых проектов OWASP. После принятия он переедет в GitHub-организацию OWASP по адресу github.com/OWASP/owasp-model-card-security-standard.
Этот стандарт опубликован под лицензией Creative Commons Attribution 4.0 International (CC BY 4.0). Вы можете свободно использовать, адаптировать и распространять его — в том числе в коммерческих целях — при условии указания соответствующего авторства.
Все инструменты в этом репозитории лицензированы под Apache 2.0.