
Padrão aberto para documentar metadados de segurança relevantes de modelos de IA, incluindo proveniência dos dados de treinamento, risco de PII, vulnerabilidades conhecidas e detalhes da cadeia de suprimentos.
<<<<<<< HEAD
Status: Rascunho — Projeto OWASP em Incubação
Este padrão está em desenvolvimento ativo. Contribuições e feedback são muito bem-vindos.
Quando descarrega um modelo pré-treinado do HuggingFace ou de qualquer outro repositório, está essencialmente a confiar numa caixa negra. Não sabe em que dados foi treinado, se esses dados continham informações pessoais, como foi testado contra ataques adversariais, nem quais são os seus modos de falha conhecidos. Para a maioria dos projetos de hobby, não há problema. Mas para qualquer coisa que envolva utilizadores reais, setores regulados ou dados sensíveis — não é, de todo.
Os model cards já existem há algum tempo e são uma boa ideia. Mas os formatos atuais concentram-se quase exclusivamente em métricas de desempenho e considerações de equidade. A segurança é, em grande parte, uma reflexão tardia, quando existe.
Este projeto tenta resolver isso. Estamos a construir um padrão aberto que define quais as informações relevantes para a segurança que um model card deve conter — aspetos como a proveniência dos dados de treino, o risco de exposição de PII, vulnerabilidades conhecidas, detalhes da cadeia de abastecimento e o estado de conformidade regulamentar. Algo que uma equipa de segurança possa realmente utilizar ao avaliar se um modelo é seguro para implementar.
Vários fatores convergiram ao mesmo tempo:
Um padrão de model cards centrado na segurança dá a programadores, auditores e equipas de aquisição uma linguagem comum e uma lista de verificação que podem efetivamente pôr em prática.
Aqui está uma amostra do aspeto de um model card centrado na segurança de acordo com este padrão:
model_card_version: "0.1"
model_name: "example-text-classifier"
model_version: "1.2.0"
training_data:
sources:
- name: "Common Crawl (filtered)"
pii_assessment: "Presidio scan applied; residual risk: low"
license: "CC0"
pii_removal_method: "Microsoft Presidio + manual review on 5% sample"
data_cutoff_date: "2024-01-01"
security:
known_vulnerabilities: []
adversarial_testing: "Red-teamed against prompt injection; results in /security/redteam-report.md"
supply_chain:
base_model: "bert-base-uncased"
base_model_source: "https://huggingface.co/bert-base-uncased"
compliance:
eu_ai_act_risk_tier: "Limited"
gdpr_considerations: "No personal data retained post-training"
Este é um excerto simplificado. O schema completo cobre campos adicionais para histórico de incidentes, filtragem de saída, restrições de implementação e muito mais.
/
├── README.md ← you are here
├── standard/
│ └── OWASP-Modelcard-Standard-Proposal.md ← the specification
├── templates/
│ └── model-card-template.md ← blank template to copy and fill in
├── examples/
│ └── llm-example.md ← worked example for a large language model
├── schema/
│ └── model-card-schema.json ← machine-readable JSON schema
├── mappings/
│ └── owasp-nist-euaiact-mapping.md ← how this standard relates to other frameworks
├── CONTRIBUTING.md ← how to get involved
├── CHANGELOG.md
└── LICENSE ← CC BY 4.0
Este padrão foi concebido para complementar, e não substituir, o trabalho existente:
Este é um projeto em fase inicial e há muito espaço para moldar o seu rumo. Algumas formas de contribuir:
#ai-ml-securitySe não souber por onde começar, as issues abertas com a etiqueta good first issue são um bom ponto de partida.
Este projeto está atualmente a passar pelo processo de novos projetos da OWASP. Uma vez aceite, passará para a organização GitHub da OWASP em github.com/OWASP/owasp-model-card-security-standard.
Este padrão é publicado sob a licença Creative Commons Attribution 4.0 International (CC BY 4.0). É livre de o utilizar, adaptar e redistribuir — inclusive comercialmente — desde que atribua o devido crédito.
owasp/main
| Framework | Relação |
|---|
| OWASP Top 10 for LLM Applications | Este padrão ajuda a documentar mitigações para vários riscos do Top 10 de LLM |
| OWASP AI Exchange | Alinhado com as orientações de segurança de IA; com referências cruzadas quando relevante |
| NIST AI Risk Management Framework | Os campos do padrão mapeiam-se nas funções govern, map, measure e manage do AI RMF |
| EU AI Act | Cobre obrigações de transparência e documentação para sistemas de IA de risco limitado e de alto risco |
| HuggingFace Model Cards | Estende o formato HuggingFace com campos específicos de segurança |
| Google Model Cards | Compatível com a abordagem da Google; adiciona uma camada de segurança por cima |