
Guia curado para configurações de retenção zero de dados para APIs LLM. Aborda endpoints ZDR específicos de provedores, modelos de ameaça, mapeamentos de conformidade e padrões de auto-hospedagem para engenheiros em indústrias regulamentadas.
Última atualização: Abril de 2026
Um guia prático para manter seus dados privados ao usar APIs de LLM. Abrange endpoints de retenção zero, auto-hospedagem, requisitos de conformidade e padrões de proteção de dados para engenheiros em indústrias regulamentadas.
"Zero-retention" não é um recurso único — é um conjunto de controles técnicos + termos contratuais que garante que o conteúdo do cliente (prompts, saídas, arquivos) não seja armazenado em repouso pelo fornecedor. Diferentes abordagens oferecem diferentes compensações:```mermaid flowchart TD Start(["Need Private AI?"]) --> Q1{"Can you\nself-host?"}
Q1 -->|"Yes, have GPUs"| SH["Self-Host Open Weights\n(Llama 4 · DeepSeek · Mistral · Qwen)"]
Q1 -->|"Yes, CPU only"| OL["Ollama + Quantized Models\n(7B–14B on consumer hardware)"]
Q1 -->|No| Q2{"Need frontier\nmodel quality?"}
Q2 -->|Yes| Q3{"Regulatory\nrequirements?"}
Q2 -->|No| Q4{"Budget\nconstrained?"}
Q3 -->|"HIPAA / FedRAMP"| Cloud["Azure OpenAI · AWS Bedrock\n+ Private Endpoints + BAA"]
Q3 -->|"Multi-provider"| GW["OpenRouter · Cloudflare AI Gateway\nwith ZDR routing"]
Q3 -->|"Single provider OK"| Direct["Direct ZDR Contract\n(OpenAI · Anthropic · Google)"]
Q4 -->|Yes| Budget["Fireworks · Together AI\n(open-weights, low cost, ZDR included)"]
Q4 -->|"Not really"| Fast["Groq · Fireworks · Together\nZDR toggle in dashboard"]
style Start fill:#4a90d9,stroke:#2c5f8a,color:#fff
style SH fill:#2ecc71,stroke:#1a9c54,color:#fff
style OL fill:#2ecc71,stroke:#1a9c54,color:#fff
style Cloud fill:#e67e22,stroke:#b3611a,color:#fff
style GW fill:#9b59b6,stroke:#7a3d92,color:#fff
style Direct fill:#3498db,stroke:#2471a3,color:#fff
style Budget fill:#1abc9c,stroke:#148f77,color:#fff
style Fast fill:#1abc9c,stroke:#148f77,color:#fff
### Comparação de Abordagens
| Abordagem | Força de Privacidade | Qualidade do Modelo | Custo Operacional | Complexidade de Configuração |
| :--- | :--- | :--- | :--- | :--- |
| **Auto-hospedado (air-gapped)** | Mais forte | Apenas pesos abertos | Hardware + operações | Alta |
| **Auto-hospedado (VPC)** | Muito forte | Apenas pesos abertos | Custo de GPU em nuvem | Média |
| **ZDR em nuvem + Private Link** | Forte (contratual) | Modelos de fronteira | Preço de API | Baixa-Média |
| **API ZDR SaaS** | Boa (contratual) | Modelos de fronteira | Preço de API | Baixa |
| **Gateway com roteamento ZDR** | Boa (delegada) | Multi-provedor | Taxa de API + gateway | Baixa |
---
## Modelo de Ameaça
Antes de escolher uma abordagem, entenda contra o que você está se protegendo:
| Ameaça | Descrição | Mitigado Por |
| :--- | :--- | :--- |
| **Vazamento de dados de treinamento** | Seus prompts/saídas usados para treinar os modelos do provedor | Contrato ZDR, nível de API (não nível gratuito), auto-hospedagem |
| **Retenção de monitoramento de abuso** | O provedor armazena prompts para revisão de segurança (geralmente 30 dias) | Opt-out ZDR/MAM, auto-hospedagem |
| **Acesso de funcionários** | A equipe do provedor pode ver seus dados durante resposta a incidentes | ZDR + criptografia BYOK, auto-hospedagem |
| **Intimação / descoberta legal** | Solicitações governamentais ou legais ao provedor pelos seus dados | Auto-hospedagem, controles de residência de dados, contrato sem retenção |
| **Violação no provedor** | Sistemas do provedor comprometidos, seus dados exfiltrados | Sem retenção (nada para roubar), auto-hospedagem, criptografia em repouso |
| **Seu próprio registro** | Sua infraestrutura (proxies, APM, rastreadores de erros) registra prompts sensíveis | Proxy DLP, redação de logs, audite seu pipeline |
| **Exfiltração por injeção de prompt** | Entrada maliciosa faz o LLM vazar dados por chamadas de ferramentas | Varredura de saída, ferramentas com privilégios mínimos, sandboxing |
### Ciclo de Vida dos Dados: Para Onde Seus Prompts Vão```mermaid
flowchart LR
User["User Input"] --> App["Your App"]
subgraph YourInfra["Your Infrastructure"]
App --> Logs1["App Logs ⚠️"]
App --> DLP["DLP / PII Proxy"]
DLP --> GW["API Gateway"]
GW --> Logs2["Gateway Logs ⚠️"]
end
subgraph Provider["LLM Provider"]
GW --> Inference["Model Inference\n(in-memory)"]
Inference --> Abuse["Abuse Monitor\n(0–30 day retention)"]
Inference --> Training["Model Training\n(opt-out or ZDR)"]
end
Inference --> Response["Response"]
Response --> App
style Logs1 fill:#e74c3c,stroke:#c0392b,color:#fff
style Logs2 fill:#e74c3c,stroke:#c0392b,color:#fff
style Abuse fill:#f39c12,stroke:#d68910,color:#fff
style Training fill:#e74c3c,stroke:#c0392b,color:#fff
style DLP fill:#2ecc71,stroke:#1a9c54,color:#fff
style Inference fill:#3498db,stroke:#2471a3,color:#fff
Vermelho = pontos de risco onde os dados podem ser retidos. Verde = camada de proteção. ZDR elimina os riscos do lado do provedor; DLP/proxy elimina os riscos do seu lado.
store é sempre tratado como false, mesmo se definido como true nas requisiçõesstore funcional — para organizações que precisam de retenção de dados, mas com monitoramento reduzidoEndpoints Elegíveis para ZDR:
/v1/chat/completions, /v1/responses, /v1/images/*, /v1/embeddings, /v1/audio/*, /v1/moderations, /v1/completions, /v1/realtime
NÃO Elegíveis para ZDR:
Assistants API (/v1/assistants, /v1/threads, /v1/vector_stores), Conversations API, Files, Fine-tuning, Batches, Evals, Background mode (/v1/responses com background: true), Hosted containers (Code Interpreter)