
Kuratierter Leitfaden zu Zero-Data-Retention-Konfigurationen für LLM APIs. Deckt anbieterspezifische ZDR-Endpunkte, Bedrohungsmodelle, Compliance-Zuordnungen und Self-Hosting-Muster für Ingenieure in regulierten Branchen ab.
Zuletzt aktualisiert: April 2026
Ein praktischer Leitfaden, um Ihre Daten bei der Nutzung von LLM-APIs privat zu halten. Deckt Zero-Retention-Endpunkte, Self-Hosting, Compliance-Anforderungen und Datenschutzmuster für Ingenieure in regulierten Branchen ab.
„Zero-Retention“ ist keine einzelne Funktion – es ist ein Bündel technischer Kontrollen + Vertragsbedingungen, das sicherstellt, dass Kundeninhalte (Prompts, Ausgaben, Dateien) vom Anbieter nicht im Ruhezustand gespeichert werden. Verschiedene Ansätze bieten unterschiedliche Kompromisse:```mermaid flowchart TD Start(["Need Private AI?"]) --> Q1{"Can you\nself-host?"}
Q1 -->|"Yes, have GPUs"| SH["Self-Host Open Weights\n(Llama 4 · DeepSeek · Mistral · Qwen)"]
Q1 -->|"Yes, CPU only"| OL["Ollama + Quantized Models\n(7B–14B on consumer hardware)"]
Q1 -->|No| Q2{"Need frontier\nmodel quality?"}
Q2 -->|Yes| Q3{"Regulatory\nrequirements?"}
Q2 -->|No| Q4{"Budget\nconstrained?"}
Q3 -->|"HIPAA / FedRAMP"| Cloud["Azure OpenAI · AWS Bedrock\n+ Private Endpoints + BAA"]
Q3 -->|"Multi-provider"| GW["OpenRouter · Cloudflare AI Gateway\nwith ZDR routing"]
Q3 -->|"Single provider OK"| Direct["Direct ZDR Contract\n(OpenAI · Anthropic · Google)"]
Q4 -->|Yes| Budget["Fireworks · Together AI\n(open-weights, low cost, ZDR included)"]
Q4 -->|"Not really"| Fast["Groq · Fireworks · Together\nZDR toggle in dashboard"]
style Start fill:#4a90d9,stroke:#2c5f8a,color:#fff
style SH fill:#2ecc71,stroke:#1a9c54,color:#fff
style OL fill:#2ecc71,stroke:#1a9c54,color:#fff
style Cloud fill:#e67e22,stroke:#b3611a,color:#fff
style GW fill:#9b59b6,stroke:#7a3d92,color:#fff
style Direct fill:#3498db,stroke:#2471a3,color:#fff
style Budget fill:#1abc9c,stroke:#148f77,color:#fff
style Fast fill:#1abc9c,stroke:#148f77,color:#fff
### Ansatzvergleich
| Ansatz | Datenschutzstärke | Modellqualität | Betriebskosten | Einrichtungskomplexität |
| :--- | :--- | :--- | :--- | :--- |
| **Self-hosted (Air-Gapped)** | Stärkste | Nur Open-Weight | Hardware + Betrieb | Hoch |
| **Self-hosted (VPC)** | Sehr stark | Nur Open-Weight | Cloud-GPU-Kosten | Mittel |
| **Cloud ZDR + Private Link** | Stark (vertraglich) | Frontier-Modelle | API-Preise | Niedrig-Mittel |
| **SaaS ZDR API** | Gut (vertraglich) | Frontier-Modelle | API-Preise | Niedrig |
| **Gateway mit ZDR-Routing** | Gut (delegiert) | Multi-Provider | API + Gateway-Gebühr | Niedrig |
---
## Bedrohungsmodell
Bevor Sie einen Ansatz wählen, verstehen Sie, wogegen Sie sich schützen:
| Bedrohung | Beschreibung | Gemindert durch |
| :--- | :--- | :--- |
| **Trainingsdaten-Leckage** | Ihre Prompts/Ausgaben werden zum Trainieren der Modelle des Anbieters verwendet | ZDR-Vertrag, API-Tier (nicht Free-Tier), Self-Hosting |
| **Aufbewahrung zur Missbrauchsüberwachung** | Anbieter speichert Prompts zur Sicherheitsprüfung (oft 30 Tage) | ZDR/MAM-Opt-out, Self-Hosting |
| **Mitarbeiterzugriff** | Personal des Anbieters kann Ihre Daten bei der Incident-Response einsehen | ZDR + BYOK-Verschlüsselung, Self-Hosting |
| **Vorladung / rechtliche Offenlegung** | Behördliche oder rechtliche Anfragen an den Anbieter bezüglich Ihrer Daten | Self-Hosting, Datenresidenz-Kontrollen, No-Retention-Vertrag |
| **Sicherheitsverletzung beim Anbieter** | Systeme des Anbieters kompromittiert, Ihre Daten abgeflossen | No-Retention (nichts zu stehlen), Self-Hosting, Verschlüsselung im Ruhezustand |
| **Eigenes Logging** | Ihre Infrastruktur (Proxys, APM, Error Tracker) protokolliert sensible Prompts | DLP-Proxy, Log-Redaktion, Prüfung Ihrer Pipeline |
| **Prompt-Injection-Exfiltration** | Bösartige Eingabe führt dazu, dass das LLM Daten über Tool-Aufrufe preisgibt | Ausgabe-Scanning, Least-Privilege-Tools, Sandboxing |
### Datenlebenszyklus: Wohin Ihre Prompts gelangen```mermaid
flowchart LR
User["User Input"] --> App["Your App"]
subgraph YourInfra["Your Infrastructure"]
App --> Logs1["App Logs ⚠️"]
App --> DLP["DLP / PII Proxy"]
DLP --> GW["API Gateway"]
GW --> Logs2["Gateway Logs ⚠️"]
end
subgraph Provider["LLM Provider"]
GW --> Inference["Model Inference\n(in-memory)"]
Inference --> Abuse["Abuse Monitor\n(0–30 day retention)"]
Inference --> Training["Model Training\n(opt-out or ZDR)"]
end
Inference --> Response["Response"]
Response --> App
style Logs1 fill:#e74c3c,stroke:#c0392b,color:#fff
style Logs2 fill:#e74c3c,stroke:#c0392b,color:#fff
style Abuse fill:#f39c12,stroke:#d68910,color:#fff
style Training fill:#e74c3c,stroke:#c0392b,color:#fff
style DLP fill:#2ecc71,stroke:#1a9c54,color:#fff
style Inference fill:#3498db,stroke:#2471a3,color:#fff
Rot = Risikopunkte, an denen Daten gespeichert werden können. Grün = Schutzschicht. ZDR eliminiert die anbieterseitigen Risiken; DLP/Proxy eliminiert Ihre eigenen Risiken.
store wird immer als false behandelt, auch wenn er in Anfragen auf true gesetzt iststore funktionsfähig — für Organisationen, die Datenaufbewahrung benötigen, aber eine reduzierte Überwachung wünschenZDR-berechtigte Endpunkte:
/v1/chat/completions, /v1/responses, /v1/images/*, /v1/embeddings, /v1/audio/*, /v1/moderations, /v1/completions, /v1/realtime
NICHT ZDR-berechtigt:
Assistants API (/v1/assistants, /v1/threads, /v1/vector_stores), Conversations API, Dateien, Fine-Tuning, Batches, Evals, Hintergrundmodus (/v1/responses mit background: true), Gehostete Container (Code Interpreter)