
Offener Standard zur Dokumentation sicherheitsrelevanter Metadaten von KI-Modellen, einschließlich der Herkunft von Trainingsdaten, PII-Risiken, bekannten Schwachstellen und Details zur Lieferkette.
Status: Entwurf – Inkubierendes OWASP-Projekt
Dieser Standard wird aktiv weiterentwickelt. Beiträge und Feedback sind sehr willkommen.
Wenn du ein vortrainiertes Modell von HuggingFace oder einem anderen Repository herunterlädst, vertraust du im Grunde einer Blackbox. Du weißt nicht, mit welchen Daten es trainiert wurde, ob diese Daten personenbezogene Informationen enthielten, wie es auf adversariale Angriffe getestet wurde oder welche bekannten Fehlermodi es hat. Für die meisten Hobbyprojekte ist das in Ordnung. Für alles, was echte Nutzer, regulierte Branchen oder sensible Daten betrifft – eben nicht.
Model Cards gibt es schon seit einiger Zeit, und sie sind eine gute Idee. Aber die bestehenden Formate konzentrieren sich fast ausschließlich auf Leistungskennzahlen und Fairness-Aspekte. Sicherheit ist weitgehend ein nachträglicher Gedanke, wenn sie überhaupt vorkommt.
Dieses Projekt versucht, das zu beheben. Wir bauen einen offenen Standard, der festlegt, welche sicherheitsrelevanten Informationen eine Model Card enthalten sollte – etwa Herkunft der Trainingsdaten, Risiko der Offenlegung personenbezogener Daten (PII), bekannte Schwachstellen, Lieferketten-Details und Status der regulatorischen Konformität. Etwas, das ein Sicherheitsteam tatsächlich nutzen kann, um zu bewerten, ob ein Modell sicher bereitgestellt werden kann.
Mehrere Dinge kommen gleichzeitig zusammen:
Ein sicherheitsfokussierter Model-Card-Standard gibt Entwicklern, Prüfern und Beschaffungsteams eine gemeinsame Sprache und eine Checkliste, nach der sie tatsächlich handeln können.
Hier ein Eindruck davon, wie eine sicherheitsfokussierte Model Card unter diesem Standard aussieht:
model_card_version: "0.1"
model_name: "example-text-classifier"
model_version: "1.2.0"
training_data:
sources:
- name: "Common Crawl (filtered)"
pii_assessment: "Presidio scan applied; residual risk: low"
license: "CC0"
pii_removal_method: "Microsoft Presidio + manual review on 5% sample"
data_cutoff_date: "2024-01-01"
security:
known_vulnerabilities: []
adversarial_testing: "Red-teamed against prompt injection; results in /security/redteam-report.md"
supply_chain:
base_model: "bert-base-uncased"
base_model_source: "https://huggingface.co/bert-base-uncased"
compliance:
eu_ai_act_risk_tier: "Limited"
gdpr_considerations: "No personal data retained post-training"
Dies ist ein vereinfachter Auszug. Das vollständige Schema deckt weitere Felder ab, etwa Vorfallhistorie, Ausgabefilterung, Bereitstellungsrandbedingungen und mehr.
/
├── README.md ← you are here
├── standard/
│ └── OWASP-Modelcard-Standard-Proposal.md ← the specification
├── templates/
│ └── model-card-template.md ← blank template to copy and fill in
├── examples/
│ └── llm-example.md ← worked example for a large language model
├── schema/
│ └── model-card-schema.json ← machine-readable JSON schema
├── mappings/
│ └── owasp-nist-euaiact-mapping.md ← how this standard relates to other frameworks
├── CONTRIBUTING.md ← how to get involved
├── CHANGELOG.md
└── LICENSE ← CC BY 4.0
Dieser Standard soll bestehende Arbeiten ergänzen, nicht ersetzen:
Dies ist ein Projekt in einem frühen Stadium, und es gibt viel Spielraum, um seine Richtung zu gestalten. Ein paar Möglichkeiten, einen Beitrag zu leisten:
#ai-ml-security teilnehmenWenn du nicht weißt, wo du anfangen sollst, sind die offenen Issues mit dem Label good first issue ein guter Ausgangspunkt.
Dieses Projekt durchläuft derzeit den OWASP-Prozess für neue Projekte. Nach der Annahme wird es in die OWASP-GitHub-Organisation unter github.com/OWASP/owasp-model-card-security-standard verschoben.
Dieser Standard ist unter Creative Commons Attribution 4.0 International (CC BY 4.0) veröffentlicht. Du kannst ihn frei nutzen, anpassen und weiterverbreiten – auch kommerziell – solange du angemessen nennst.
Jegliche Werkzeuge in diesem Repository sind unter Apache 2.0 lizenziert.
| Framework | Relationship |
|---|
| OWASP Top 10 for LLM Applications | Dieser Standard hilft, Maßnahmen für mehrere Risiken der LLM Top 10 zu dokumentieren |
| OWASP AI Exchange | Abgestimmt mit den KI-Sicherheitsleitlinien; wo relevant querverwiesen |
| NIST AI Risk Management Framework | Die Standardfelder bilden die Funktionen Govern, Map, Measure und Manage des AI RMF ab |
| EU AI Act | Deckt Transparenz- und Dokumentationspflichten für KI-Systeme mit begrenztem und hohem Risiko ab |
| HuggingFace Model Cards | Erweitert das HuggingFace-Format um sicherheitsspezifische Felder |
| Google Model Cards | Kompatibel mit Googles Ansatz; ergänzt eine Sicherheitsebene |