
Guide organisé des configurations de données sans rétention pour les API LLM. Couvre les points de terminaison ZDR propres à chaque fournisseur, les modèles de menace, les correspondances de conformité et les modèles d'auto-hébergement pour les ingénieurs dans les industries réglementées.
Dernière mise à jour : Avril 2026
Un guide pratique pour garder vos données privées lors de l'utilisation des API LLM. Couvre les points de terminaison à rétention zéro, l'auto-hébergement, les exigences de conformité et les modèles de protection des données pour les ingénieurs dans les industries réglementées.
La « rétention zéro » n'est pas une fonctionnalité unique – c'est un ensemble de contrôles techniques + conditions contractuelles garantissant que le contenu du client (prompts, sorties, fichiers) n'est pas stocké au repos par le fournisseur. Différentes approches offrent différents compromis :```mermaid flowchart TD Start(["Need Private AI?"]) --> Q1{"Can you\nself-host?"}
Q1 -->|"Yes, have GPUs"| SH["Self-Host Open Weights\n(Llama 4 · DeepSeek · Mistral · Qwen)"]
Q1 -->|"Yes, CPU only"| OL["Ollama + Quantized Models\n(7B–14B on consumer hardware)"]
Q1 -->|No| Q2{"Need frontier\nmodel quality?"}
Q2 -->|Yes| Q3{"Regulatory\nrequirements?"}
Q2 -->|No| Q4{"Budget\nconstrained?"}
Q3 -->|"HIPAA / FedRAMP"| Cloud["Azure OpenAI · AWS Bedrock\n+ Private Endpoints + BAA"]
Q3 -->|"Multi-provider"| GW["OpenRouter · Cloudflare AI Gateway\nwith ZDR routing"]
Q3 -->|"Single provider OK"| Direct["Direct ZDR Contract\n(OpenAI · Anthropic · Google)"]
Q4 -->|Yes| Budget["Fireworks · Together AI\n(open-weights, low cost, ZDR included)"]
Q4 -->|"Not really"| Fast["Groq · Fireworks · Together\nZDR toggle in dashboard"]
style Start fill:#4a90d9,stroke:#2c5f8a,color:#fff
style SH fill:#2ecc71,stroke:#1a9c54,color:#fff
style OL fill:#2ecc71,stroke:#1a9c54,color:#fff
style Cloud fill:#e67e22,stroke:#b3611a,color:#fff
style GW fill:#9b59b6,stroke:#7a3d92,color:#fff
style Direct fill:#3498db,stroke:#2471a3,color:#fff
style Budget fill:#1abc9c,stroke:#148f77,color:#fff
style Fast fill:#1abc9c,stroke:#148f77,color:#fff
### Comparaison des Approches
| Approche | Confidentialité | Qualité du Modèle | Coût Opérationnel | Complexité de Mise en Place |
| :--- | :--- | :--- | :--- | :--- |
| **Auto-hébergé (air-gapped)** | Maximale | Open-weight uniquement | Matériel + exploitation | Élevée |
| **Auto-hébergé (VPC)** | Très élevée | Open-weight uniquement | Coût GPU cloud | Moyenne |
| **Cloud ZDR + Private Link** | Élevée (contractuelle) | Modèles de pointe | Tarification API | Faible-Moyenne |
| **API SaaS ZDR** | Bonne (contractuelle) | Modèles de pointe | Tarification API | Faible |
| **Passerelle avec routage ZDR** | Bonne (déléguée) | Multi-fournisseur | API + frais de passerelle | Faible |
---
## Modèle de Menaces
Avant de choisir une approche, comprenez contre quoi vous vous protégez :
| Menace | Description | Atténuée Par |
| :--- | :--- | :--- |
| **Fuite de données d'entraînement** | Vos requêtes/réponses utilisées pour entraîner les modèles du fournisseur | Contrat ZDR, niveau API (pas gratuit), auto-hébergement |
| **Rétention pour surveillance des abus** | Le fournisseur stocke les requêtes pour examen de sécurité (souvent 30 jours) | Option ZDR/MAM de désinscription, auto-hébergement |
| **Accès employé** | Le personnel du fournisseur peut consulter vos données lors d'une réponse à incident | ZDR + chiffrement BYOK, auto-hébergement |
| **Assignation / découverte légale** | Demandes gouvernementales ou légales au fournisseur pour vos données | Auto-hébergement, contrôles de résidence des données, contrat sans rétention |
| **Violation chez le fournisseur** | Systèmes du fournisseur compromis, exfiltration de vos données | Aucune rétention (rien à voler), auto-hébergement, chiffrement au repos |
| **Votre propre journalisation** | Votre infrastructure (proxies, APM, traqueurs d'erreurs) enregistre des requêtes sensibles | Proxy DLP, rédaction de logs, audit de votre pipeline |
| **Exfiltration par injection de prompt** | Une entrée malveillante provoque la fuite de données de l'LLM via des appels d'outils | Analyse des sorties, outils à privilèges minimaux, sandboxing |
### Cycle de Vie des Données : Où Vont Vos Requêtes```mermaid
flowchart LR
User["User Input"] --> App["Your App"]
subgraph YourInfra["Your Infrastructure"]
App --> Logs1["App Logs ⚠️"]
App --> DLP["DLP / PII Proxy"]
DLP --> GW["API Gateway"]
GW --> Logs2["Gateway Logs ⚠️"]
end
subgraph Provider["LLM Provider"]
GW --> Inference["Model Inference\n(in-memory)"]
Inference --> Abuse["Abuse Monitor\n(0–30 day retention)"]
Inference --> Training["Model Training\n(opt-out or ZDR)"]
end
Inference --> Response["Response"]
Response --> App
style Logs1 fill:#e74c3c,stroke:#c0392b,color:#fff
style Logs2 fill:#e74c3c,stroke:#c0392b,color:#fff
style Abuse fill:#f39c12,stroke:#d68910,color:#fff
style Training fill:#e74c3c,stroke:#c0392b,color:#fff
style DLP fill:#2ecc71,stroke:#1a9c54,color:#fff
style Inference fill:#3498db,stroke:#2471a3,color:#fff
Rouge = points de risque où les données peuvent être conservées. Vert = couche de protection. ZDR élimine les risques côté fournisseur ; DLP/proxy élimine les risques côté utilisateur.
store est toujours traité comme false, même s'il est défini sur true dans les requêtesstore fonctionnel — pour les organisations qui ont besoin de rétention des données mais d'une surveillance réduitePoints de terminaison éligibles au ZDR :
/v1/chat/completions, /v1/responses, /v1/images/*, /v1/embeddings, /v1/audio/*, /v1/moderations, /v1/completions, /v1/realtime