
Conjunto de ferramentas para avaliar e melhorar a segurança de LLM.
🤗 Modelos no Hugging Face | Blog | Site | Artigo do CyberSec Eval | Artigo do Llama Guard
Purple Llama é um projeto guarda-chuva que, com o tempo, reunirá ferramentas e avaliações para ajudar a comunidade a construir de forma responsável com modelos generativos de IA abertos. O lançamento inicial incluirá ferramentas e avaliações para Segurança Cibernética e salvaguardas de Entrada/Saída, mas planejamos contribuir com mais em um futuro próximo.
Tomando emprestado um conceito do mundo da segurança cibernética, acreditamos que para realmente mitigar os desafios que a IA generativa apresenta, precisamos adotar tanto posturas de ataque (red team) quanto defensivas (blue team). O purple teaming, composto por responsabilidades de red e blue team, é uma abordagem colaborativa para avaliar e mitigar riscos potenciais, e o mesmo espírito se aplica à IA generativa e, portanto, nosso investimento no Purple Llama será abrangente.
Os componentes do projeto Purple Llama serão licenciados de forma permissiva, permitindo uso tanto para pesquisa quanto comercial. Acreditamos que este é um passo importante para viabilizar a colaboração da comunidade e padronizar o desenvolvimento e o uso de ferramentas de confiança e segurança para o desenvolvimento de IA generativa. Mais concretamente, avaliações e benchmarks são licenciados sob a licença MIT, enquanto qualquer modelo usa a licença correspondente da Comunidade Llama. Veja a tabela abaixo:
| Tipo de Componente | Componentes | Licença |
|---|---|---|
| Avaliações/Benchmarks | Cyber Security Eval (outras por vir) | MIT |
| Salvaguarda | Llama Guard | Licença Comunitária Llama 2 |
| Salvaguarda | Llama Guard 2 | Licença Comunitária Llama 3 |
| Salvaguarda | Llama Guard 3-8B | Licença Comunitária Llama 3.2 |
| Salvaguarda | Llama Guard 3-1B | Licença Comunitária Llama 3.2 |
| Salvaguarda | Llama Guard 3-11B-vision | Licença Comunitária Llama 3.2 |
| Salvaguarda | Prompt Guard | Licença Comunitária Llama 3.2 |
| Salvaguarda | Code Shield | MIT |
Como descrevemos no Guia de Uso Responsável do Llama 3, nós recomendamos que todas as entradas e saídas do LLM sejam verificadas e filtradas de acordo com as diretrizes de conteúdo apropriadas para a aplicação.
Llama Guard 3 consiste em uma série de modelos de moderação de entrada e saída de alto desempenho, projetados para ajudar desenvolvedores a detectar vários tipos comuns de conteúdo violador.
Eles foram criados por meio de fine-tuning dos modelos Meta-Llama 3.1 e 3.2 e otimizados para apoiar a detecção da taxonomia de riscos padrão do MLCommons, atendendo a uma variedade de casos de uso de desenvolvedores.
Eles dão suporte ao lançamento dos recursos do Llama 3.2, incluindo 7 novos idiomas, uma janela de contexto de 128k e raciocínio sobre imagens. Os modelos Llama Guard 3 também foram otimizados para detectar respostas úteis a ataques cibernéticos e impedir que códigos maliciosos gerados por LLMs sejam executados em ambientes de hospedagem para sistemas Llama que usam interpretadores de código.
O Prompt Guard é uma ferramenta poderosa para proteger aplicações baseadas em LLM contra prompts maliciosos, garantindo sua segurança e integridade.
As categorias de ataques por prompt incluem injeção de prompt e jailbreak:
O Code Shield adiciona suporte à filtragem em tempo de inferência de código inseguro produzido por LLMs. O Code Shield oferece mitigação do risco de sugestões de código inseguro, prevenção de abuso do interpretador de código e execução segura de comandos. Notebook de Exemplo do CodeShield.
O CyberSec Eval v1 foi, segundo acreditamos, o primeiro conjunto de avaliações de segurança cibernética para LLMs em todo o setor. Esses benchmarks são baseados em orientações e padrões do setor (por exemplo, CWE e MITRE ATT&CK) e foram construídos em colaboração com nossos especialistas em segurança. Nosso objetivo é fornecer ferramentas que ajudem a tratar alguns dos riscos descritos nos compromissos da Casa Branca sobre o desenvolvimento de IA responsável, incluindo:
Acreditamos que essas ferramentas reduzirão a frequência com que LLMs sugerem código inseguro gerado por IA e diminuirão sua utilidade para adversários cibernéticos. Nossos resultados iniciais mostram que existem riscos significativos de segurança cibernética para LLMs, tanto na recomendação de código inseguro quanto no atendimento a solicitações maliciosas. Consulte nosso Artigo do CyberSec Eval para obter mais detalhes.
O CyberSec Eval 2 expande seu antecessor ao medir a propensão de um LLM a abusar de um interpretador de código, as capacidades ofensivas de segurança cibernética e a suscetibilidade à injeção de prompt. Você pode ler o artigo aqui.
Você também pode conferir o 🤗 leaderboard aqui.
O recém-lançado CyberSec Eval 3 traz três suítes de teste adicionais: testes de injeção visual de prompt, testes de capacidade de spear phishing e testes de operações cibernéticas ofensivas autônomas.
Como parte do sistema de referência Llama, estamos integrando uma camada de segurança para facilitar a adoção e a implantação dessas salvaguardas.
Recursos para começar a usar as salvaguardas estão disponíveis no repositório Llama-recipe no GitHub.
Para uma lista atualizada de perguntas frequentes, não apenas sobre os componentes do Purple Llama, mas também sobre os modelos Llama em geral, consulte as FAQ aqui.
Consulte o arquivo CONTRIBUTING para saber como ajudar.