Skip to content
KitploitKITPLOIT
HerramientasBlog
Enviar
HerramientasBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

··Feeds·Contacto·Privacidad·© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
PurpleLlama — Conjunto de herramientas para evaluar y mejorar la seguridad de los LLM. | Kitploit
Herramientas/GitHubGitHub/meta-llama/purplellama
Herramientas DefensivasAnálisis de VulnerabilidadesAnálisis de CódigoPapers e InvestigaciónRed TeamingSeguridad de IAAtaque AdversarioTop en Ataque Adversario #10Top en Seguridad de IA #4
4.4k77364hace 25 díasRevisado por Kitploit

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →
GitHub
meta-llama/purplellama

PurpleLlama

Conjunto de herramientas para evaluar y mejorar la seguridad de los LLM.

Ver Repositorio
Compartir

🤗 Modelos en Hugging Face  | Blog  | Sitio web  | Artículo de CyberSec Eval   | Artículo de Llama Guard 


Purple Llama

Purple Llama es un proyecto general que, con el tiempo, reunirá herramientas y evaluaciones para ayudar a la comunidad a desarrollar soluciones de forma responsable con modelos generativos de IA abiertos. El lanzamiento inicial incluirá herramientas y evaluaciones para Ciberseguridad y salvaguardas de Entrada/Salida, pero tenemos previsto aportar más en un futuro cercano.

¿Por qué purple?

Tomando prestado un concepto del mundo de la ciberseguridad, creemos que para mitigar de verdad los desafíos que presenta la IA generativa, necesitamos adoptar tanto posturas de ataque (red team) como defensivas (blue team). El purple teaming, compuesto por responsabilidades tanto de red como de blue team, es un enfoque colaborativo para evaluar y mitigar riesgos potenciales, y la misma filosofía se aplica a la IA generativa y, por tanto, nuestra inversión en Purple Llama será integral.

Licencia

Los componentes del proyecto Purple Llama se publicarán con licencias permisivas que permiten tanto el uso comercial como el de investigación. Creemos que este es un paso importante para habilitar la colaboración comunitaria y estandarizar el desarrollo y uso de herramientas de confianza y seguridad para el desarrollo de IA generativa. Más concretamente, las evaluaciones y los benchmarks se publican bajo la licencia MIT, mientras que cualquier modelo utiliza la licencia comunitaria de Llama correspondiente. Consulta la tabla siguiente:

Tipo de componenteComponentesLicencia
Evaluaciones/BenchmarksCyber Security Eval (otros próximamente)MIT
SalvaguardaLlama GuardLicencia comunitaria de Llama 2
SalvaguardaLlama Guard 2Licencia comunitaria de Llama 3
SalvaguardaLlama Guard 3-8BLicencia comunitaria de Llama 3.2
SalvaguardaLlama Guard 3-1BLicencia comunitaria de Llama 3.2
SalvaguardaLlama Guard 3-11B-visionLicencia comunitaria de Llama 3.2
SalvaguardaPrompt GuardLicencia comunitaria de Llama 3.2
SalvaguardaCode ShieldMIT

Salvaguardas a nivel de sistema

Como se indica en la Guía de uso responsable de Llama 3, recomendamos que todas las entradas y salidas del LLM se comprueben y filtren de acuerdo con las directrices de contenido adecuadas para la aplicación.

Llama Guard

Llama Guard 3 consiste en una serie de modelos de moderación de entrada y salida de alto rendimiento diseñados para ayudar a los desarrolladores a detectar varios tipos comunes de contenido infractor.

Se crearon ajustando los modelos Meta-Llama 3.1 y 3.2 y se optimizaron para apoyar la detección de la taxonomía estándar de peligros de MLCommons, atendiendo a una variedad de casos de uso de los desarrolladores. Admiten el lanzamiento de las capacidades de Llama 3.2, incluidos 7 nuevos idiomas, una ventana de contexto de 128k y el razonamiento de imágenes. Los modelos Llama Guard 3 también se optimizaron para detectar respuestas útiles a ciberataques y evitar que el código malicioso generado por LLMs se ejecute en entornos de alojamiento para sistemas Llama que usan intérpretes de código.

Prompt Guard

Prompt Guard es una herramienta eficaz para proteger aplicaciones basadas en LLM contra prompts maliciosos, garantizando su seguridad e integridad.

Las categorías de ataques de prompts incluyen la inyección de prompts y el jailbreaking:

  • Las inyecciones de prompts son entradas que explotan la inclusión de datos no confiables de terceros en la ventana de contexto de un modelo para lograr que ejecute instrucciones no deseadas.
  • Los jailbreaks son instrucciones maliciosas diseñadas para anular las funciones de seguridad y protección integradas en un modelo.

Code Shield

Code Shield añade soporte para el filtrado en tiempo de inferencia de código inseguro generado por LLMs. Code Shield ofrece mitigación del riesgo de sugerencias de código inseguro, prevención del abuso de intérpretes de código y ejecución segura de comandos. Cuaderno de ejemplo de CodeShield.

Evaluaciones y benchmarks

Ciberseguridad

CyberSec Eval v1

CyberSec Eval v1 fue, según creemos, el primer conjunto de evaluaciones de seguridad cibernética para LLMs de toda la industria. Estos benchmarks se basan en orientaciones y estándares del sector (p. ej., CWE y MITRE ATT&CK) y se construyeron en colaboración con nuestros expertos en seguridad. Nuestro objetivo es ofrecer herramientas que ayuden a abordar algunos de los riesgos descritos en los compromisos de la Casa Blanca sobre el desarrollo de una IA responsable, incluidos:

  • Métricas para cuantificar los riesgos de ciberseguridad de los LLMs.
  • Herramientas para evaluar la frecuencia de sugerencias de código inseguro.
  • Herramientas para evaluar a los LLMs a fin de que sea más difícil generar código malicioso o ayudar a llevar a cabo ciberataques.

Creemos que estas herramientas reducirán la frecuencia con la que los LLMs sugieren código inseguro generado por IA y reducirán su utilidad para los adversarios cibernéticos. Nuestros resultados iniciales muestran que existen riesgos significativos de ciberseguridad para los LLMs, tanto al recomendar código inseguro como al cumplir solicitudes maliciosas. Consulta nuestro artículo de CyberSec Eval para más detalles.

CyberSec Eval 2

CyberSec Eval 2 amplía su predecesor al medir la propensión de un LLM a abusar de un intérprete de código, las capacidades ofensivas de ciberseguridad y la susceptibilidad a la inyección de prompts. Puedes leer el artículo aquí.

También puedes consultar el 🤗 leaderboard aquí.

CyberSec Eval 3

El recién publicado CyberSec Eval 3 incluye tres suites de pruebas adicionales: pruebas de inyección visual de prompts, pruebas de capacidad de spear phishing y pruebas de operaciones ciberofensivas autónomas.

Primeros pasos

Como parte del sistema de referencia Llama, estamos integrando una capa de seguridad para facilitar la adopción e implementación de estas salvaguardas. Los recursos para comenzar con las salvaguardas están disponibles en el repositorio de GitHub llama-recipes.

FAQ

Para obtener una lista actualizada de preguntas frecuentes, no solo sobre los componentes de Purple Llama sino también sobre los modelos Llama en general, consulta las FAQ aquí.

Únete a la comunidad de Purple Llama

Consulta el archivo CONTRIBUTING para saber cómo ayudar.

Descargar herramienta