
Standard aperto per la documentazione dei metadati rilevanti per la sicurezza dei modelli di IA, inclusi la provenienza dei dati di addestramento, il rischio PII, le vulnerabilità note e i dettagli della catena di fornitura.
<<<<<<< HEAD
Stato: Bozza — Progetto OWASP in fase di incubazione
Questo standard è in sviluppo attivo. Contributi e feedback sono molto graditi.
Quando scarichi un modello pre-addestrato da HuggingFace o da qualsiasi altro repository, ti stai sostanzialmente fidando di una scatola nera. Non sai su quali dati è stato addestrato, se quei dati contenevano informazioni personali, come è stato testato contro attacchi adversarial o quali sono le sue modalità di fallimento note. Per la maggior parte dei progetti hobbistici va bene. Per qualsiasi cosa che tocchi utenti reali, settori regolamentati o dati sensibili — non va affatto bene.
Le model card esistono da un po' di tempo e sono una buona idea. Ma i formati esistenti si concentrano quasi esclusivamente su metriche di performance e considerazioni di equità. La sicurezza è in gran parte un ripensamento, se non del tutto assente.
Questo progetto cerca di risolvere il problema. Stiamo costruendo uno standard aperto che definisce quali informazioni rilevanti per la sicurezza una model card dovrebbe contenere — ad esempio provenienza dei dati di addestramento, rischio di esposizione di PII, vulnerabilità note, dettagli sulla catena di fornitura e stato di conformità normativa. Qualcosa che un team di sicurezza possa effettivamente usare per valutare se un modello è sicuro da distribuire.
Alcuni fattori sono confluiti contemporaneamente:
Uno standard di model card incentrato sulla sicurezza offre a sviluppatori, revisori e team di procurement un linguaggio comune e una checklist su cui possono davvero agire.
Ecco un assaggio di come appare una model card incentrata sulla sicurezza secondo questo standard:
model_card_version: "0.1"
model_name: "example-text-classifier"
model_version: "1.2.0"
training_data:
sources:
- name: "Common Crawl (filtered)"
pii_assessment: "Presidio scan applied; residual risk: low"
license: "CC0"
pii_removal_method: "Microsoft Presidio + manual review on 5% sample"
data_cutoff_date: "2024-01-01"
security:
known_vulnerabilities: []
adversarial_testing: "Red-teamed against prompt injection; results in /security/redteam-report.md"
supply_chain:
base_model: "bert-base-uncased"
base_model_source: "https://huggingface.co/bert-base-uncased"
compliance:
eu_ai_act_risk_tier: "Limited"
gdpr_considerations: "No personal data retained post-training"
Questo è un estratto semplificato. Lo schema completo copre campi aggiuntivi per cronologia degli incidenti, filtraggio dell'output, vincoli di distribuzione e altro.
/
├── README.md ← you are here
├── standard/
│ └── OWASP-Modelcard-Standard-Proposal.md ← the specification
├── templates/
│ └── model-card-template.md ← blank template to copy and fill in
├── examples/
│ └── llm-example.md ← worked example for a large language model
├── schema/
│ └── model-card-schema.json ← machine-readable JSON schema
├── mappings/
│ └── owasp-nist-euaiact-mapping.md ← how this standard relates to other frameworks
├── CONTRIBUTING.md ← how to get involved
├── CHANGELOG.md
└── LICENSE ← CC BY 4.0
Questo standard è progettato per integrare, non sostituire, il lavoro esistente:
Questo è un progetto in fase iniziale e c'è ampio margine per orientarne la direzione. Alcuni modi per contribuire:
#ai-ml-securitySe non sai da dove iniziare, le issue aperte etichettate con good first issue sono un buon punto di partenza.
Questo progetto sta attualmente attraversando il processo di nuovi progetti OWASP. Una volta accettato, si sposterà nell'organizzazione GitHub di OWASP all'indirizzo github.com/OWASP/owasp-model-card-security-standard.
Questo standard è pubblicato sotto Creative Commons Attribution 4.0 International (CC BY 4.0). Sei libero di usarlo, adattarlo e ridistribuirlo — anche a fini commerciali — a condizione di fornire il giusto riconoscimento.
Gli strumenti inclusi in questo repository sono concessi in licenza sotto Apache 2.0.
=======
owasp/main
| Framework | Relazione |
|---|
| OWASP Top 10 for LLM Applications | Questo standard aiuta a documentare le mitigazioni per diversi rischi della Top 10 per LLM |
| OWASP AI Exchange | Allineato con le linee guida sulla sicurezza dell'IA; con riferimenti incrociati dove pertinente |
| NIST AI Risk Management Framework | I campi dello standard si mappano alle funzioni govern, map, measure e manage dell'AI RMF |
| EU AI Act | Copre gli obblighi di trasparenza e documentazione per i sistemi di IA a rischio limitato e ad alto rischio |
| HuggingFace Model Cards | Estende il formato HuggingFace con campi specifici per la sicurezza |
| Google Model Cards | Compatibile con l'approccio di Google; aggiunge un livello di sicurezza sopra |