
Set di strumenti per valutare e migliorare la sicurezza degli LLM.
🤗 Modelli su Hugging Face | Blog | Sito web | Paper CyberSec Eval | Paper Llama Guard
Purple Llama è un progetto-ombrello che nel tempo riunirà strumenti e valutazioni per aiutare la comunità a sviluppare in modo responsabile con modelli di IA generativa aperti. La versione iniziale includerà strumenti e valutazioni per la cybersicurezza e salvaguardie di Input/Output, ma prevediamo di contribuire con altro nel prossimo futuro.
Mutuando un concetto dal mondo della cybersicurezza, riteniamo che per mitigare realmente le sfide poste dall'IA generativa sia necessario adottare sia posture offensive (red team) che difensive (blue team). Il purple teaming, che comprende le responsabilità sia del red team sia del blue team, è un approccio collaborativo per valutare e mitigare i potenziali rischi e la stessa filosofia si applica all'IA generativa e quindi il nostro investimento in Purple Llama sarà completo.
I componenti del progetto Purple Llama saranno concessi in licenza in modo permissivo, consentendo sia l'uso per la ricerca sia l'uso commerciale. Riteniamo che questo sia un passo importante verso la collaborazione della comunità e la standardizzazione dello sviluppo e dell'uso di strumenti di fiducia e sicurezza per lo sviluppo di IA generativa. Più concretamente, le valutazioni e i benchmark sono concessi in licenza MIT, mentre i modelli utilizzano la corrispondente licenza Llama Community. Vedi la tabella seguente:
| Tipo di componente | Componenti | Licenza |
|---|---|---|
| Valutazioni/Benchmark | Cyber Security Eval (altri in arrivo) | MIT |
| Salvaguardia | Llama Guard | Llama 2 Community License |
| Salvaguardia | Llama Guard 2 | Llama 3 Community License |
| Salvaguardia | Llama Guard 3-8B | Llama 3.2 Community License |
| Salvaguardia | Llama Guard 3-1B | Llama 3.2 Community License |
| Salvaguardia | Llama Guard 3-11B-vision | Llama 3.2 Community License |
| Salvaguardia | Prompt Guard | Llama 3.2 Community License |
| Salvaguardia | Code Shield | MIT |
Come indicato nella Guida all'uso responsabile di Llama 3, consigliamo che tutti gli input e output del LLM siano controllati e filtrati in base a linee guida sui contenuti appropriate all'applicazione.
Llama Guard 3 è costituito da una serie di modelli ad alte prestazioni per la moderazione di input e output, progettati per aiutare gli sviluppatori a rilevare vari tipi comuni di contenuti vietati.
Sono stati creati mediante fine-tuning dei modelli Meta-Llama 3.1 e 3.2 e ottimizzati per supportare il rilevamento della tassonomia standard dei pericoli MLCommons, soddisfacendo una gamma di casi d'uso per sviluppatori. Supportano il rilascio delle funzionalità di Llama 3.2, tra cui 7 nuove lingue, una finestra di contesto di 128k e il ragionamento sulle immagini. I modelli Llama Guard 3 sono stati inoltre ottimizzati per rilevare risposte utili agli attacchi informatici e per impedire che il codice dannoso generato dagli LLM venga eseguito in ambienti di hosting per sistemi Llama che utilizzano interpreti di codice.
Prompt Guard è un potente strumento per proteggere le applicazioni basate su LLM da prompt dannosi, garantendone sicurezza e integrità.
Le categorie di attacchi tramite prompt includono il prompt injection e il jailbreak:
Code Shield aggiunge il supporto per il filtraggio in fase di inferenza del codice non sicuro prodotto dagli LLM. Code Shield offre mitigazione del rischio di suggerimenti di codice non sicuro, prevenzione dell'abuso dell'interprete di codice ed esecuzione sicura dei comandi. Notebook di esempio CodeShield.
CyberSec Eval v1 è stata, a nostra conoscenza, la prima suite a livello di settore di valutazioni di sicurezza informatica per LLM. Questi benchmark si basano su indicazioni e standard di settore (ad es. CWE e MITRE ATT&CK) e sono stati sviluppati in collaborazione con i nostri esperti di sicurezza. L'obiettivo è fornire strumenti che aiutino ad affrontare alcuni dei rischi delineati negli impegni della Casa Bianca per lo sviluppo di un'IA responsabile, tra cui:
Riteniamo che questi strumenti ridurranno la frequenza con cui gli LLM suggeriscono codice non sicuro generato dall'IA e ridurranno la loro utilità per gli avversari informatici. I nostri risultati iniziali mostrano che esistono rischi di cybersicurezza significativi per gli LLM, sia nel consigliare codice non sicuro sia nel soddisfare richieste malevole. Per maggiori dettagli, consulta il nostro paper su CyberSec Eval.
CyberSec Eval 2 amplia il suo predecessore misurando la propensione di un LLM ad abusare di un interprete di codice, le capacità offensive di cybersicurezza e la suscettibilità al prompt injection. Puoi leggere il paper qui.