
promptfoo v0.124.0
Testez vos prompts, agents et RAGs. Red teaming / tests d'intrusion / scan de vulnérabilités pour l'IA. Comparez les performances de GPT, Claude, Gemini, DeepSeek et plus. Configurations déclaratives simples avec ligne de commande et intégration CI/CD. Utilisé par OpenAI et Anthropic.
Promptfoo : évaluations LLM et red teaming
promptfoo est une CLI et une bibliothèque pour évaluer et faire du red teaming d'applications basées sur des LLM. Arrêtez d'utiliser la méthode essai-erreur... commencez à livrer des agents sécurisés et fiables
Site web · Premiers pas · Red Teaming · Documentation · Discord
Promptfoo fait désormais partie d'OpenAI. Promptfoo reste open source et sous licence MIT. Lisez la mise à jour de l'entreprise.
Démarrage rapide
npm install -g promptfoo
promptfoo init --example getting-started
Également disponible via brew install promptfoo et pip install promptfoo. Ou utilisez npx promptfoo@latest pour exécuter n'importe quelle commande sans installation.
La plupart des fournisseurs de LLM nécessitent une clé API. Définissez la vôtre comme variable d'environnement :
export OPENAI_API_KEY=sk-abc123
Lancez une évaluation et consultez les résultats :
cd getting-started
promptfoo eval
promptfoo view
Consultez Premiers pas (évaluations) ou Red Teaming (analyse de vulnérabilités) pour en savoir plus !
Que pouvez-vous faire avec Promptfoo ?
- Testez vos prompts et modèles avec des évaluations automatisées
- Sécurisez vos applications LLM avec le red teaming et l'analyse de vulnérabilités
- Comparez les modèles côte à côte (OpenAI, Anthropic, Azure, Bedrock, Ollama, et plus encore)
- Automatisez les vérifications dans CI/CD
- Examinez les pull requests pour les problèmes de sécurité et de conformité liés aux LLM avec l'analyse de code
- Partagez les résultats avec votre équipe
Voici à quoi cela ressemble en action :
Cela fonctionne aussi en ligne de commande :
Il peut également générer des rapports de vulnérabilités de sécurité :
Pourquoi Promptfoo ?
- Axé développeur : Rapide, avec des fonctionnalités comme le rechargement à chaud et la mise en cache
- Privé : Les évaluations LLM s'exécutent à 100 % en local - vos prompts ne quittent jamais votre machine
- Flexible : Fonctionne avec n'importe quelle API LLM ou langage de programmation
- Éprouvé : Alimente des applications LLM servant plus de 10 millions d'utilisateurs en production
- Basé sur les données : Prenez des décisions fondées sur des métriques, pas sur l'intuition
- Open source : Sous licence MIT, avec une communauté active
En savoir plus
- Premiers pas
- Documentation complète
- Guide de Red Teaming
- Utilisation de la CLI
- Package Node.js
- Modèles pris en charge
- Guide d'analyse de code
Contribution
Nous accueillons les contributions ! Consultez notre guide de contribution pour commencer.
Rejoignez notre communauté Discord pour obtenir de l'aide et discuter.