
Estándar abierto para documentar metadatos relevantes para la seguridad de los modelos de IA, incluida la procedencia de los datos de entrenamiento, el riesgo de PII, las vulnerabilidades conocidas y los detalles de la cadena de suministro.
<<<<<<< HEAD
Estado: Borrador — Proyecto de OWASP en incubación
Este estándar está en desarrollo activo. Las contribuciones y los comentarios son muy bienvenidos.
Cuando descargas un modelo preentrenado de HuggingFace o de cualquier otro repositorio, estás confiando esencialmente en una caja negra. No sabes con qué datos fue entrenado, si esos datos contenían información personal, cómo ha sido probado frente a ataques adversarios, ni cuáles son sus modos de fallo conocidos. Para la mayoría de los proyectos de hobby, eso está bien. Para cualquier cosa que afecte a usuarios reales, industrias reguladas o datos sensibles — en realidad no lo está.
Las tarjetas de modelo llevan ya un tiempo entre nosotros, y son una buena idea. Pero los formatos existentes se centran casi por completo en métricas de rendimiento y consideraciones de equidad. La seguridad es en gran medida algo secundario, si es que se tiene en cuenta.
Este proyecto intenta arreglar eso. Estamos construyendo un estándar abierto que define qué información relevante para la seguridad debería contener una tarjeta de modelo — cosas como la procedencia de los datos de entrenamiento, el riesgo de exposición de PII, vulnerabilidades conocidas, detalles de la cadena de suministro y el estado de cumplimiento normativo. Algo que un equipo de seguridad pueda usar de verdad al evaluar si un modelo es seguro de desplegar.
Algunas cosas han convergido a la vez:
Un estándar de tarjetas de modelo centrado en la seguridad ofrece a desarrolladores, auditores y equipos de compras un lenguaje común y una lista de verificación sobre la que pueden actuar de verdad.
Aquí tienes una muestra de cómo se ve una tarjeta de modelo centrada en la seguridad según este estándar:
model_card_version: "0.1"
model_name: "example-text-classifier"
model_version: "1.2.0"
training_data:
sources:
- name: "Common Crawl (filtered)"
pii_assessment: "Presidio scan applied; residual risk: low"
license: "CC0"
pii_removal_method: "Microsoft Presidio + manual review on 5% sample"
data_cutoff_date: "2024-01-01"
security:
known_vulnerabilities: []
adversarial_testing: "Red-teamed against prompt injection; results in /security/redteam-report.md"
supply_chain:
base_model: "bert-base-uncased"
base_model_source: "https://huggingface.co/bert-base-uncased"
compliance:
eu_ai_act_risk_tier: "Limited"
gdpr_considerations: "No personal data retained post-training"
Este es un extracto simplificado. El esquema completo incluye campos adicionales para historial de incidentes, filtrado de salidas, restricciones de despliegue y más.
/
├── README.md ← you are here
├── standard/
│ └── OWASP-Modelcard-Standard-Proposal.md ← the specification
├── templates/
│ └── model-card-template.md ← blank template to copy and fill in
├── examples/
│ └── llm-example.md ← worked example for a large language model
├── schema/
│ └── model-card-schema.json ← machine-readable JSON schema
├── mappings/
│ └── owasp-nist-euaiact-mapping.md ← how this standard relates to other frameworks
├── CONTRIBUTING.md ← how to get involved
├── CHANGELOG.md
└── LICENSE ← CC BY 4.0
Este estándar está diseñado para complementar, no reemplazar, el trabajo existente:
Este es un proyecto en fase inicial y hay mucho margen para darle forma. Algunas formas de contribuir:
#ai-ml-security.Si no sabes por dónde empezar, los issues abiertos etiquetados como good first issue son un buen lugar para mirar.
Este proyecto está pasando actualmente por el proceso de nuevos proyectos de OWASP. Una vez aceptado, se trasladará a la organización de OWASP en GitHub en github.com/OWASP/owasp-model-card-security-standard.
Este estándar se publica bajo Creative Commons Attribution 4.0 International (CC BY 4.0). Eres libre de usarlo, adaptarlo y redistribuirlo — incluso con fines comerciales — siempre que des el crédito apropiado.
owasp/main
| Framework | Relationship |
|---|
| OWASP Top 10 for LLM Applications | Este estándar ayuda a documentar mitigaciones para varios riesgos del Top 10 de LLM |
| OWASP AI Exchange | Alineado con la guía de seguridad de IA; con referencias cruzadas cuando proceda |
| NIST AI Risk Management Framework | Los campos estándar se corresponden con las funciones govern, map, measure y manage del AI RMF |
| EU AI Act | Cubre las obligaciones de transparencia y documentación para sistemas de IA de riesgo limitado y alto riesgo |
| HuggingFace Model Cards | Extiende el formato de HuggingFace con campos específicos de seguridad |
| Google Model Cards | Compatible con el enfoque de Google; añade una capa de seguridad adicional |