Melhores plataformas para agentes de IA sem retenção de dados em 2026

Compare 9 plataformas para agentes de IA com retenção zero de dados, preços, limites e riscos. Veja qual protege melhor os fluxos empresariais em 2026.

Wednesday, September 2, 2026Omid Saffari
Melhores plataformas para agentes de IA sem retenção de dados em 2026

A OpenAI API é a melhor plataforma com retenção zero de dados para a maioria das equipes de agentes de IA em 2026, pois mantém modelos de fronteira em uma rota ZDR. Já o Amazon Bedrock leva vantagem quando a política de retenção precisa bloquear qualquer chamada incompatível em todo o ambiente AWS. O ponto de atenção é que ZDR protege uma rota de inferência, não um produto de agentes: memória com estado, arquivos, sandboxes de código, busca e camadas gerenciadas de agentes podem voltar a introduzir retenção. Em uma carga normalizada de 1 milhão de tokens de entrada e 200,000 tokens de saída, o GPT-5.6 Luna custa $0.44 nas tarifas Standard atuais; a decisão de orçamento mais relevante é saber se a empresa pode assumir o estado do agente.

Melhores plataformas para agentes de IA com retenção zero de dados

Zero Data Retention, ou ZDR, significa que prompts e saídas compatíveis não permanecem armazenados após o processamento. Isso não inclui automaticamente todo repositório de arquivos, camada de memória, ferramenta ou agente gerenciado conectado ao modelo. Essa diferença é o critério mais importante deste ranking.

Os preços abaixo foram conferidos nas páginas dos fornecedores em 22 de agosto de 2026. Os valores por token correspondem a 1 milhão de tokens, salvo quando outra unidade estiver indicada. “Não informado” quer dizer que o fornecedor não anunciava um teste específico da plataforma na página de preços — não que a equipe comercial seja incapaz de oferecer créditos.

FerramentaMelhor paraPreço inicialTeste grátis
OpenAI APIModelos de fronteira em uma organização com ZDR aprovadoGPT-5.6 Luna: $0.20 entrada, $1.20 saídaNão informado
Amazon BedrockAplicação de políticas na AWS que bloqueia chamadas incompatíveisIntelligent Prompt Routing: $1 por 1,000 solicitações, além do uso do modeloNão informado
Google Gemini Enterprise Agent PlatformEquipes no Google Cloud capazes de governar todos os recursos do agenteGemini 3.1 Flash-Lite: $0.25 entrada, $1.50 saídaNão informado
Anthropic APIAgentes Claude com estado e ferramentas sob controle do clienteHaiku 4.5: $1 entrada, $5 saídaNão informado
Fireworks AIInferência de modelos abertos com ZDR por padrãoGPT OSS 20B: $0.07 entrada, $0.30 saídaCrédito de $1
GroqCloudInferência de modelos abertos com baixa latênciaGPT OSS 20B: $0.075 entrada, $0.30 saídaPlano gratuito
Microsoft FoundryInferência sem estado governada pelo AzureGPT-5.6 Luna: $0.20 entrada, $1.20 saídaNão informado
OpenRouterRoteamento entre vários provedores com filtro de política ZDRGratuito ou taxa de 5.5% no Pay-as-you-goPlano gratuito
Mistral AICargas aprovadas e sem estado na Mistral APIMistral Large: $0.50 entrada, $1.50 saídaSem plano ZDR gratuito

A discussão mais ampla sobre qualidade dos modelos, orquestração e aderência ao negócio está nesta comparação de plataformas de agentes de IA para empresas. Aqui, a ordem muda porque a segurança da retenção pesa mais do que a variedade de recursos. Uma plataforma perde pontos quando suas funções mais convenientes para agentes tornam falsa a promessa de ZDR.

O que retenção zero de dados significa para um agente de IA empresarial

“Não treinamos com seus dados” e “não retemos seus dados” respondem a perguntas diferentes. O compromisso de não usar dados no treinamento ainda pode permitir que o fornecedor mantenha prompts para monitorar abuso, depurar problemas, preservar o histórico da conversa, processar lotes ou recuperar arquivos. ZDR é a promessa mais restrita de que o conteúdo compatível não será mantido depois que a solicitação terminar.

Cumprir essa promessa em um agente é mais difícil do que em uma única conclusão de chat. Um agente empresarial útil costuma precisar de pelo menos quatro camadas:

  • Inferência: o modelo lê um prompt e devolve uma resposta.
  • Estado: memória, histórico de conversas, checkpoints e status das tarefas.
  • Conhecimento: arquivos enviados, bancos vetoriais, bancos de dados e logs de recuperação.
  • Ações: busca, execução de código, navegadores, servidores MCP e aplicativos de negócio.

Somente a primeira camada é naturalmente sem estado. As outras três existem justamente porque algo persiste em algum lugar. Portanto, uma plataforma pode ser excelente em inferência ZDR e, ainda assim, ser inadequada para um agente gerenciado cuja transcrição, arquivos ou sandbox permanecem no produto do fornecedor.

Arquitetura em que uma solicitação cruza a fronteira de inferência sem retenção, enquanto arquivos, memória gerenciada e terceiros continuam sendo riscos separados de retenção
ZDR protege a rota de inferência. Cada acesso lateral com estado precisa de uma política própria.

Essa é a conta por assumir o estado. ZDR estrito geralmente exige que a empresa controle o banco de dados da memória, o armazenamento de objetos dos arquivos, o sistema de rastreamento usado na análise de incidentes e a fila que retoma tarefas demoradas. As equipes jurídica e de segurança ganham uma fronteira de controle bem definida, mas a engenharia passa a responder por rotinas de exclusão, políticas de acesso, regras de backup e plantão.

O padrão prático não é perguntar “o fornecedor tem uma página sobre ZDR?”. A pergunta certa é: você consegue desenhar uma rota completa da solicitação e provar que todo sistema que toca no conteúdo do cliente segue uma regra de retenção compatível? Se a resposta depender de uma caixa marcada por padrão, de um plugin sem documentação ou de um recurso gerenciado que armazena estado silenciosamente, o fluxo ainda não está pronto para dados sensíveis.

Como estas plataformas foram selecionadas

As nove plataformas foram comparadas com base nas páginas ativas de controle de dados, documentação e preços dos fornecedores em 22 de agosto de 2026. O ranking não deriva de um teste inventado nem de um selo genérico de segurança. A ordem foi definida por cinco critérios:

  1. Promessa de retenção: o fornecedor declara que prompts e saídas compatíveis não ficam armazenados após o processamento?
  2. Bloqueio por padrão: um modelo ou recurso incompatível é bloqueado ou o desenvolvedor pode sair silenciosamente da rota ZDR?
  3. Cobertura do agente: o que acontece com memória, arquivos, tarefas em lote, execução de código, busca na web, MCP e transcrições de agentes gerenciados?
  4. Comprovação administrativa: o responsável pela segurança consegue ativar a política de forma centralizada e confirmar que ela está vigente?
  5. Clareza comercial: as tarifas atuais e o custo de alternativas compatíveis com privacidade estão claros o suficiente para montar o orçamento?

Foram eliminadas as plataformas que apenas prometem não treinar com dados de clientes. Frameworks de orquestração sem compromisso de retenção por parte do provedor também ficaram de fora, pois não podem garantir o que o host do modelo subjacente armazena. A lista final reúne fornecedores com um controle ZDR utilizável ou uma rota sem estado defensável para tráfego empresarial de API.

O ranking também penaliza nomes que induzem ao erro. A Mistral, por exemplo, oferece ZDR em várias APIs sem estado, mas exclui o produto chamado Agents. A Microsoft documenta inferência de modelo sem estado e monitoramento de abuso modificado, porém não oferece um botão simples e autogerenciado de ZDR. As duas ainda podem ser boas escolhas, desde que a equipe de implementação entenda essas condições.

1. OpenAI API: melhor opção geral para ZDR com modelos de fronteira

A OpenAI API é a melhor escolha geral para empresas que querem modelos de fronteira atuais sem abrir mão de uma rota com Zero Data Retention.

Documentação de controles de dados da OpenAI API com elegibilidade para Zero Data Retention e comportamento dos endpoints
Controles de dados da OpenAI API

O anúncio da OpenAI de 19 de agosto é relevante porque explicita a consequência para os negócios: clientes de API elegíveis podem manter o ZDR à medida que os modelos assumem tarefas mais longas e complexas. Pelo compromisso publicado, prompts e respostas do modelo não são retidos após o processamento, o conteúdo fica indisponível para o pessoal da OpenAI e os dados empresariais não entram no treinamento, a menos que o cliente autorize. A empresa também antecipou o Private Safety Processing, criado para detectar padrões de risco em interações relacionadas sem expor o conteúdo subjacente ao pessoal da OpenAI.

O argumento de compra é especialmente forte para bancos, empresas de software para saúde, plataformas jurídicas e fornecedores de SaaS empresarial que precisam da capacidade do modelo, mas não podem aceitar acesso rotineiro do provedor aos prompts. A OpenAI oferece a esse comprador uma API direta, controles no nível do projeto, um conjunto amplo de endpoints de inferência elegíveis para ZDR e um roadmap de modelos claro. O GPT-5.6 Luna também reduz bastante o custo de entrada: um milhão de tokens de entrada e 200,000 tokens de saída custam $0.44 nas tarifas Standard para contexto curto.

O limite está no estado da aplicação. A tabela ativa de retenção por endpoint da OpenAI marca Chat Completions e Responses como elegíveis para ZDR, com restrições, mas Conversations, threads do ChatKit, Assistants, Threads, Vector Stores, Files, Evals e Batches não são elegíveis. Servidores MCP remotos seguem políticas de retenção próprias. Hosted Shell e Code Interpreter podem gravar dados temporários enquanto seus contêineres estiverem ativos. Background Responses grava estado temporário em disco por cerca de 10 minutos para que o cliente possa consultar a tarefa.

Isso faz da OpenAI a melhor plataforma de modelos da lista, mas não autoriza o uso irrestrito de todos os recursos da empresa. Uma implantação rigorosa deve manter memória e persistência de arquivos na infraestrutura do cliente, chamar um endpoint sem estado compatível e aprovar separadamente cada destino das ferramentas. Sob ZDR, a OpenAI trata store como false em chamadas de Responses e Chat Completions mesmo quando a solicitação envia true, eliminando um padrão perigoso. A organização ainda precisa obter aprovação prévia para ZDR.

Private Safety Processing também deve ser tratado como prévia, não como um controle disponível hoje para uma arquitetura de produção. A OpenAI informou que os testes com os primeiros clientes estavam em andamento e que planejava o lançamento e um white paper técnico para setembro de 2026. O ZDR existente é o dado relevante para a compra; a prévia indica a direção futura. Imagens sinalizadas como possível CSAM continuam sendo uma exceção explícita e podem ser retidas para análise manual e comunicação às autoridades.

Melhor para: empresas que precisam de modelos de fronteira da OpenAI em uma rota sem estado aprovada.
Destaque: o ZDR impõe store=false às chamadas compatíveis de Responses e Chat Completions.
Preço: a tabela atual de preços da OpenAI API lista o GPT-5.6 Luna de contexto curto por $0.20 de entrada, $0.02 de entrada em cache, $0.25 de gravação em cache e $1.20 de saída no Standard; $0.10, $0.01, $0.125 e $0.60 no Batch ou Flex; e $0.40, $0.04, $0.50 e $2.40 no Fast, por 1 milhão de tokens. O processamento com residência regional de dados acrescenta 10% para modelos elegíveis lançados a partir de 5 de março de 2026.
Teste grátis: a página ativa de preços da API não informa teste específico da plataforma.

O ponto forte
O que faz bem
4 points

  • Compromisso explícito, assumido em agosto de 2026, de manter o ZDR em implantações com modelos de fronteira.
  • Controles de organização e projeto permitem isolar cargas aprovadas.
  • As chamadas de inferência compatíveis impõem store=false sob ZDR.
  • A tarifa baixa do GPT-5.6 Luna facilita o orçamento da inferência de um agente privado.
O ponto fraco
Onde deixa a desejar
4 points

  • ZDR exige aprovação e obrigações adicionais.
  • Muitos recursos convenientes e com estado para agentes ficam fora do ZDR.
  • Servidores MCP e outras ferramentas externas criam fronteiras de retenção separadas.
  • Estados temporários de contêiner, cache e processamento em segundo plano ainda exigem análise da arquitetura.
  1. Formalize o controle

    Solicite ZDR para a organização de API exata que atenderá ao tráfego de produção. Registre a aprovação, o escopo contratual, os modelos elegíveis, as exceções e o responsável pela segurança.

  2. Crie um projeto dedicado

    Coloque o agente sensível em um projeto próprio e selecione o controle de retenção aprovado, em vez de herdar um padrão ambíguo da organização. Separe as chaves de desenvolvimento das chaves de produção.

  3. Faça o inventário dos endpoints

    Compare o fluxo com a tabela atual de endpoints da OpenAI. Mantenha a rota principal de inferência em chamadas elegíveis de Responses ou Chat Completions. Retire Conversations, Assistants, Files, Vector Stores, Evals e Batch da rota rigorosa.

  4. Leve o estado para a sua fronteira

    Armazene memória, status das tarefas, documentos e rastros de auditoria em sistemas regidos pelo seu próprio cronograma de retenção. Envie apenas o contexto mínimo necessário em cada chamada ao modelo.

  5. Execute um teste-canário de retenção

    Envie um registro sensível sintético, rastreie todos os destinos, confirme store=false, verifique se o registro aparece somente nos sistemas aprovados do cliente e faça um recurso incompatível falhar antes de liberar dados reais.

2. Amazon Bedrock: melhor para políticas que bloqueiam desvios

O Amazon Bedrock é a opção mais forte quando a política de retenção precisa valer para toda uma organização AWS, sem depender da memória de cada desenvolvedor.

Documentação de retenção de dados do Amazon Bedrock sobre os modos none, default, compartilhamento com o provedor e aplicação de políticas
Modos de retenção de dados do Amazon Bedrock

O Bedrock transforma a retenção em um modo configurável no nível da conta ou do projeto. Ao definir data_retention_mode como none, a documentação de retenção do Bedrock afirma que nenhuma solicitação ou resposta é gravada em armazenamento durável nem compartilhada com o provedor do modelo. Se um modelo exigir retenção, a solicitação será bloqueada. Na Responses API, store tem false como padrão, store=true é rejeitado e o modo Background fica indisponível. Chat Completions e Messages nunca são retidos nesse modo.

Esse comportamento de bloqueio é o motivo de o Bedrock superar plataformas com uma promessa de marketing mais simples. Uma empresa regulada pode usar políticas IAM ou Service Control Policies para negar qualquer configuração de retenção diferente de none. Assim, o controle resiste a trocas de equipe, lançamentos apressados e exemplos de código copiados. Ele passa a integrar a postura de segurança da nuvem, em vez de ser apenas um item no checklist da engenharia.

O limite declarado é a disponibilidade de modelos. Claude Fable 5 e Claude Mythos 5 exigem provider_data_share, a menos que a conta receba aprovação de ZDR para cada modelo. Com o compartilhamento ativo, prompts e conclusões podem ser retidos por até 30 dias. Uma equipe que definir none deve esperar que esses modelos apareçam como indisponíveis — e interpretar a chamada bloqueada como prova de que o controle está funcionando.

O Bedrock também alerta que store=false, sozinho, não garante ZDR. Um modelo ainda pode reter conteúdo para análise de segurança se o modo efetivo de retenção não for none. Essa diferença é valiosa para compras: um parâmetro de API define o comportamento da solicitação, enquanto o modo de retenção define a política.

Os preços são menos compactos do que os de uma API direta porque o Bedrock hospeda vários fornecedores, regiões e modos de serviço. A página de preços do Bedrock lista o Intelligent Prompt Routing a $1 por 1,000 solicitações, mais os tokens do modelo subjacente. O recurso pode rotear dentro de uma família de modelos, mas quem precisa de ZDR deve primeiro confirmar que todos os modelos candidatos permitem none. Otimizar custos só é útil depois que a política de retenção estiver atendida.

Melhor para: empresas na AWS que querem uma política de retenção aplicada de forma centralizada.
Destaque: chamadas a modelos incompatíveis falham, em vez de reter dados silenciosamente.
Preço: o uso varia conforme fornecedor, modelo, região e modo de serviço. Intelligent Prompt Routing custa $1 por 1,000 solicitações On-Demand, além do uso do modelo.
Teste grátis: a página ativa de preços do Bedrock não informa um teste específico.

O ponto forte
O que faz bem
4 points

  • Os modos de retenção de conta e projeto são explícitos.
  • Políticas IAM e SCP podem fazer de none a única configuração permitida.
  • Chamadas a modelos incompatíveis são bloqueadas.
  • Uma única plataforma pode governar vários provedores de modelos em um ambiente AWS.
O ponto fraco
Onde deixa a desejar
4 points

  • O ZDR pode retirar modelos desejados do catálogo.
  • O preço depende do modelo subjacente e da região.
  • Background Responses fica indisponível sob none.
  • Alguns dos modelos Claude mais novos exigem uma aprovação ZDR separada para cada modelo.

3. Google Gemini Enterprise Agent Platform: melhor para equipes no Google Cloud

O Google Gemini Enterprise Agent Platform é a melhor opção para uma organização no Google Cloud capaz de governar cada recurso do agente com o mesmo rigor aplicado à chamada do modelo.

Documentação do Google Cloud que explica como alcançar retenção zero de dados nos recursos da Gemini Enterprise Agent Platform
Controles ZDR da Gemini Enterprise Agent Platform

A documentação do Google de 21 de agosto é particularmente útil porque identifica os controles que invalidam uma promessa ampla de ZDR. A base é sólida: os dados do cliente não são usados para treinar ou fazer fine-tuning de modelos gerenciados sem permissão, o registro de solicitações e respostas vem desativado por padrão e os clientes podem pedir uma exceção quando estiverem sujeitos ao registro de prompts para monitoramento de abuso.

A dificuldade é que cada recurso do agente tem um comportamento de armazenamento diferente. A Interactions API usa store igual a true por padrão; por isso, uma solicitação ZDR precisa enviar store=false explicitamente. O Grounding with Google Search armazena consultas derivadas e contexto por até 3 dias, sem opção de desativação. O Google recomenda o Web Grounding for Enterprise como alternativa. O Grounding with Google Maps guarda prompts, contexto e saída gerada por 30 dias, também sem botão para desligar.

O CodeMender cria outra fronteira relevante. Ele mantém por até 7 dias dados criptografados da sessão, incluindo trechos de código, diffs, configuração e checkpoints de análise, para permitir a retomada de uma varredura longa. O conteúdo de código é apagado em segundos após um estado terminal, enquanto o restante do registro da sessão expira no limite de 7 dias. Pode ser um cronograma de retenção empresarial razoável, mas não é zero.

A retomada de sessão do Gemini Live é opcional e armazena texto, áudio, vídeo e saídas em cache por até 24 horas. Deixe-a desligada em uma rota rigorosa. O cache padrão em memória do Google também tem TTL de 24 horas, mas a empresa considera esse cache isolado por projeto e não persistente compatível com ZDR, além de permitir que administradores o desativem para todo o projeto. A equipe de compras deve decidir se essa definição coincide com a política interna, em vez de presumir que todos os auditores tratarão memória volátil da mesma maneira.

O Google vence para uma empresa que já usa IAM, rede, logging e serviços de dados do Google Cloud, porque o agente aprovado pode manter o estado durável dentro da fronteira de nuvem existente. Ele perde para o Bedrock em simplicidade de bloqueio. Várias configurações precisam estar corretas, e alguns recursos de Advanced AI podem inviabilizar o ZDR. O Google orienta os clientes a pedir esclarecimentos à equipe responsável pela conta — conversa que deve ocorrer antes da aprovação do modelo.

Melhor para: empresas no Google Cloud que criam agentes com chamadas Gemini sem estado e aprovadas.
Destaque: orientação detalhada, recurso por recurso, para Search, Maps, Interactions, sessões Live, cache e CodeMender.
Preço: a tabela atual de preços dos modelos do Google lista o Gemini 3.1 Flash-Lite global Standard a $0.25 de entrada, $0.025 de entrada em cache e $1.50 de saída; Priority a $0.45, $0.045 e $2.70; e Flex/Batch a $0.125, $0.0125 e $0.75, por 1 milhão de tokens de texto. O Web Grounding for Enterprise inclui 5,000 consultas de grounding por mês e depois custa $14 por 1,000.
Teste grátis: a página ativa de preços da plataforma não informa um teste específico.

O ponto forte
O que faz bem
4 points

  • Ótima integração com a governança do Google Cloud e armazenamento sob controle do cliente.
  • A documentação atual identifica o comportamento de retenção de cada recurso.
  • O registro de solicitações e respostas vem desativado por padrão.
  • O Web Grounding for Enterprise oferece uma alternativa orientada a ZDR para o grounding com Google Search.
O ponto fraco
Onde deixa a desejar
4 points

  • A Interactions API armazena estado por padrão, a menos que store=false seja explícito.
  • Search, Maps, retomada de sessão e CodeMender introduzem retenção.
  • Alguns recursos de Advanced AI podem tornar o ZDR impossível.
  • A plataforma exige uma análise de configuração maior do que um único botão de ZDR faria parecer.

4. Anthropic API: melhor para Claude com estado sob controle do cliente

A Anthropic API é a opção certa para Claude quando a empresa aceita montar o agente com recursos elegíveis e sem estado, mantendo o estado durável sob seu próprio controle.

Documentação da Anthropic API e de retenção de dados com a elegibilidade de modelos e recursos para Zero Data Retention
Elegibilidade ZDR da Anthropic API

Em um acordo ZDR aprovado com a Anthropic, a empresa afirma não armazenar prompts nem respostas de clientes depois que a resposta é devolvida. O acordo é habilitado por organização por meio da equipe comercial. Chamadas elegíveis de Messages e Token Counting são cobertas, e Claude Code também pode entrar no acordo quando usa uma chave de API de uma organização Commercial ou o Claude Enterprise com ZDR ativado.

O ponto mais forte da Anthropic é a granularidade da tabela de elegibilidade. Bash, Text Editor, Computer Use e Memory executados no lado do cliente, além de Messages padrão, Prompt Caching e Web Search padrão, podem permanecer dentro do acordo ZDR. Assim, uma equipe de engenharia competente consegue criar um agente útil e manter estado e execução de ferramentas no próprio ambiente. O Prompt Caching conserva representações KV e hashes na memória durante o TTL do cache, em vez de armazenar prompts e saídas.

A maior barreira é a divisão entre os modelos de fronteira. Claude Fable 5 e Claude Mythos 5 exigem retenção de 30 dias e não estão disponíveis sob ZDR. Uma organização com ZDR aprovado pode ativar retenção em um workspace, mas o tráfego desse workspace deixa de cumprir a política estrita. Essa é uma decisão de compra, não uma simples configuração do modelo: aceite a retenção desses modelos ou escolha outro modelo elegível.

Os recursos gerenciados são a segunda barreira. Claude Managed Agents mantém estado, e as transcrições persistem até serem excluídas. Batch retém dados por 29 dias. Code Execution e Programmatic Tool Calling podem guardar dados do contêiner por até 30 dias. Files persistem até a exclusão ou expiração, e o MCP Connector segue a retenção padrão. A filtragem dinâmica de Web Search e Web Fetch não é elegível para ZDR, embora as versões padrão sejam.

Uma diferença em relação ao Bedrock merece destaque na análise da arquitetura: sob o ZDR da Anthropic, um recurso não elegível não é necessariamente bloqueado. O desenvolvedor pode usá-lo e retirar aqueles dados do acordo. A flexibilidade da API devolve a responsabilidade pela aplicação da política à revisão de código, ao gateway e aos testes de integração da empresa.

A Anthropic também documenta exceções. Dados sinalizados ou sujeitos a retenção legal podem ser guardados por até 2 anos. Isso não torna o contrato inútil, mas mostra que “zero” tem uma fronteira jurídica e de segurança. As equipes de segurança devem registrar essa fronteira, em vez de prometer um absoluto que o próprio fornecedor não oferece.

Melhor para: cargas Claude cuja memória e ferramentas possam rodar em sistemas controlados pelo cliente.
Destaque: uma matriz detalhada de elegibilidade separa ferramentas do lado do cliente de recursos gerenciados que retêm dados.
Preço: os preços da Anthropic API listam o Haiku 4.5 a $1 de entrada e $5 de saída. O Sonnet 5 custa $2 de entrada, $10 de saída, $2.50 de gravação em cache e $0.20 de leitura do cache. O Opus 5 custa $5 de entrada e $25 de saída, por 1 milhão de tokens. O Fable 5 custa $10 de entrada e $50 de saída, mas não é elegível para ZDR. O Batch reduz o preço em 50%, porém também fica fora do ZDR.
Teste grátis: a página ativa de preços não informa teste da API.

O ponto forte
O que faz bem
4 points

  • Tabela clara de elegibilidade ZDR para cada recurso.
  • Rota elegível robusta com Messages, memória e ferramentas no lado do cliente.
  • Claude Code pode se qualificar na organização comercial correta.
  • Prompt Caching continua disponível sob ZDR.
O ponto fraco
Onde deixa a desejar
4 points

  • Fable 5 e Mythos 5 exigem retenção de 30 dias.
  • Managed Agents, Batch, execução de código, arquivos e MCP podem sair da fronteira ZDR.
  • Recursos não elegíveis não são bloqueados automaticamente sob ZDR.
  • Dados sinalizados podem ser retidos por até 2 anos.

5. Fireworks AI: melhor para inferência privada com modelos abertos

A Fireworks AI é a escolha mais simples para empresas que querem inferência com modelos abertos e Zero Data Retention como comportamento padrão.

Documentação da Fireworks AI que explica o Zero Data Retention padrão e o comportamento de armazenamento da Responses API
Tratamento de dados na Fireworks AI

No caso de modelos abertos, a documentação de tratamento de dados da Fireworks informa que prompts e gerações existem somente na memória volátil durante a solicitação e não são gravados em armazenamento persistente, a menos que o usuário aceite o logging. O Prompt Caching pode manter dados do prompt e caches KV na memória volátil por vários minutos, e metadados de uso, como contagens de tokens, são retidos. É uma fronteira direta e compreensível para a análise de segurança.

O caso de uso ideal é um serviço privado de classificação, extração, resumo ou planejamento de agentes que dispense um objeto de conversa gerenciado pelo fornecedor. A equipe de plataforma pode escolher um modelo aberto, manter o banco de memória na própria nuvem e usar a Fireworks como camada de inferência de alto throughput. O padrão do provedor reduz o risco de um projeto novo começar com logging ativado.

A exceção é importante: a Responses API da Fireworks usa store=True por padrão. Nesse modo, prompts, respostas e chamadas de ferramentas são retidos por 30 dias. Defina store=False em um fluxo ZDR com Responses. Outros serviços da Fireworks seguem a política ZDR padrão, mas recursos avançados, como FireOptimizer, podem exigir consentimento explícito para registrar prompts.

A tabela de preços Serverless da Fireworks é transparente o bastante para comparar configurações de implantação. O GPT OSS 120B Standard custa $0.15 de entrada, $0.015 de entrada em cache e $0.60 de saída. A rota Priority custa $0.18, $0.018 e $0.72. O GPT OSS 20B Standard começa em $0.07 de entrada, $0.035 de entrada em cache e $0.30 de saída. Batch reduz pela metade os preços de entrada e saída do Serverless, mas qualquer fluxo assíncrono ainda deve ser conferido em relação ao requisito de retenção antes do uso.

A Fireworks fica abaixo dos três fornecedores de modelos de fronteira porque o comprador escolhe dentro de seu catálogo, em vez de receber todos os modelos proprietários mais novos sob um único compromisso ZDR. Ela supera a Groq pelo comportamento ZDR padrão e pela documentação especialmente clara da Responses API. A escolha entre as duas deve considerar disponibilidade de modelos, meta de latência e compatibilidade do plano de controle do provedor com a implantação.

Melhor para: empresas que servem modelos abertos por trás de uma stack de agentes controlada pelo cliente.
Destaque: ZDR é o padrão para inferência com modelos abertos, exceto em chamadas armazenadas de Responses.
Preço: o GPT OSS 20B Standard custa $0.07 de entrada, $0.035 de entrada em cache e $0.30 de saída. O GPT OSS 120B Standard custa $0.15, $0.015 e $0.60; o Priority custa $0.18, $0.018 e $0.72, por 1 milhão de tokens. Batch custa 50% das tarifas de entrada e saída do Serverless.
Teste grátis: contas novas recebem $1 em créditos gratuitos.

O ponto forte
O que faz bem
4 points

  • ZDR como padrão para inferência com modelos abertos.
  • Separação clara entre cache volátil e armazenamento persistente.
  • Tarifas publicadas baixas para modelos GPT OSS.
  • Rotas Standard, Priority, Fast e Batch atendem a diferentes necessidades de custo e latência.
O ponto fraco
Onde deixa a desejar
4 points

  • A Responses API armazena dados por 30 dias, a menos que store=False seja explícito.
  • Alguns recursos avançados exigem consentimento para logging.
  • Metadados de uso são retidos.
  • A razão para contratar a plataforma não é a cobertura de modelos proprietários de fronteira.

6. GroqCloud: melhor para inferência de baixa latência com modelos abertos

O GroqCloud é a melhor escolha quando um agente baseado em modelo aberto precisa de baixa latência e de um controle ZDR autogerenciado disponível para todos os clientes.

Documentação do GroqCloud com metadados retidos, logs temporários e controles de Zero Data Retention
Controles de dados do GroqCloud

A Groq não retém o conteúdo da inferência por padrão, mas esse padrão não equivale a ZDR. A documentação de dados do GroqCloud informa que a empresa pode registrar temporariamente entradas e saídas por até 30 dias para solucionar problemas de confiabilidade ou investigar suspeitas de abuso. Qualquer cliente pode ativar ZDR em Data Controls para impedir esse armazenamento, globalmente ou por recurso.

Essa rota autogerenciada interessa a startups e equipes de plataforma de médio porte que não podem esperar por um ciclo de vendas empresariais. Também é precisa o bastante para uma empresa financiada que desenvolve um agente de voz, classificação ou seleção de ferramentas sobre modelos abertos. Metadados de uso são sempre retidos, mas a Groq afirma que eles não contêm entradas nem saídas do cliente.

A contrapartida é a retirada de recursos. Arquivos Batch podem persistir por até 30 dias, salvo exclusão antecipada. Datasets e pesos de fine-tuning persistem até serem excluídos. Ativar ZDR desabilita recursos cujo funcionamento depende de dados retidos do cliente. O gerente de produto precisa, portanto, escolher entre uma rota de inferência rigorosa e a conveniência do processamento em lote ou da personalização hospedada.

O catálogo de produção atual da Groq cobra pelo GPT OSS 120B $0.15 de entrada e $0.60 de saída, e pelo GPT OSS 20B $0.075 de entrada e $0.30 de saída, por 1 milhão de tokens. O plano de conta Free permite validar integração e limites de uso com pouco risco. O upgrade para Developer não gera cobrança imediata e leva a conta para uso pay-as-you-go, com limites maiores, Flex, Batch, suporte e controles de gastos.

Os níveis de serviço acrescentam uma decisão operacional. On-Demand é o padrão. Flex usa os mesmos preços por token e oferece throughput maior, mas pode retornar erro de capacidade. Performance é um nível provisionado exclusivo do Enterprise, com preço comercial. auto escolhe um nível disponível. Um agente voltado ao usuário que não tolera novas tentativas pode precisar da conversa empresarial mesmo quando a tarifa por token parecer baixa.

Melhor para: agentes de baixa latência com modelos abertos que podem permanecer sem estado no provedor.
Destaque: qualquer cliente pode ativar ZDR sem um processo separado de aprovação empresarial.
Preço: o GPT OSS 20B custa $0.075 de entrada e $0.30 de saída; o GPT OSS 120B custa $0.15 de entrada e $0.60 de saída, por 1 milhão de tokens. Há planos de conta Free e Developer; o Performance usa preço Enterprise provisionado, negociado com a equipe comercial.
Teste grátis: há um plano de conta Free.

O ponto forte
O que faz bem
4 points

  • ZDR autogerenciado para todos os clientes.
  • Tarifas publicadas baixas para modelos abertos.
  • O plano gratuito viabiliza uma prova de integração antes do uso pago.
  • Planos pagos oferecem limites de gastos.
O ponto fraco
Onde deixa a desejar
4 points

  • Por padrão, a inferência ainda pode ser registrada temporariamente por até 30 dias.
  • ZDR desativa a persistência de Batch e fine-tuning.
  • Metadados de uso permanecem armazenados.
  • Garantias de desempenho exigem um contrato Enterprise.

7. Microsoft Foundry: melhor para empresas governadas pelo Azure

O Microsoft Foundry é a melhor opção para empresas no Azure que procuram inferência de modelo sem estado, armazenamento controlado pelo tenant e uma rota formal para desativar o armazenamento de conteúdo usado no monitoramento de abuso.

Documentação de privacidade do Microsoft Foundry com inferência sem estado, recursos armazenados e monitoramento de abuso modificado
Controles de privacidade de dados do Microsoft Foundry

A documentação de privacidade do Foundry afirma que os modelos vendidos pelo Azure não mantêm estado: prompts e conclusões não são armazenados no modelo nem usados para treinar ou melhorar modelos-base. Clientes gerenciados podem solicitar o monitoramento de abuso modificado. Depois da aprovação, o repositório de dados e o processo de análise humana do monitoramento de abuso deixam de ser usados, embora a análise automatizada ainda possa ocorrer durante o processamento da solicitação.

Essa combinação cria uma rota defensável no estilo ZDR, mas a Microsoft não a empacota como uma única configuração ZDR universal e autogerenciada. A empresa precisa obter aprovação, escolher recursos sem estado e verificar a assinatura. Um recurso Foundry aprovado exibe ContentLogging como false em suas capabilities quando o armazenamento do monitoramento de abuso está desligado. Isso fornece uma evidência valiosa ao responsável pelo controle, pois pode ser conferida no portal ou pelas APIs de gerenciamento do Azure.

O comprador natural é uma empresa cuja identidade, rede, gestão de chaves, residência de dados e compras já passam pelo Azure. O agente pode manter documentos e memória durável em recursos do Azure escolhidos pelo cliente, chamar uma implantação sem estado para inferência e preservar um único modelo de governança de nuvem. Muitas vezes, isso importa mais do que economizar alguns centavos na tarifa do modelo.

O limite é o conjunto de recursos que armazenam dados por definição. Responses pode guardar o histórico de mensagens. Assistants Threads, Files, Vector Stores, Stored Completions, Batch e fine-tuning também persistem dados do cliente no tenant. Criptografia, propriedade do tenant e controles de exclusão podem tornar esse armazenamento aceitável, mas não o transformam em retenção zero. Um fluxo rigoroso deve usar uma chamada de modelo sem estado e uma camada externa de estado com política de exclusão própria.

Os preços de modelos no Azure têm três formatos comerciais: Standard On-Demand, Provisioned Throughput Units e Batch. O Batch termina em até 24 horas com preço 50% menor que o Global Standard, porém armazena o trabalho enviado durante o processamento e, portanto, não é a rota rigorosa. O GPT-5.6 Luna de contexto curto custa $0.20 de entrada, $0.02 de entrada em cache, $0.25 de gravação em cache e $1.20 de saída no Global Standard. No Data Zone, as tarifas sobem para $0.22, $0.03, $0.28 e $1.32.

Melhor para: empresas que já governam IA sensível por meio de assinaturas e regiões geográficas do Azure.
Destaque: ContentLogging:false oferece ao cliente aprovado um controle verificável sobre o armazenamento para abuso.
Preço: o GPT-5.6 Luna de contexto curto no Global Standard custa $0.20 de entrada, $0.02 de entrada em cache, $0.25 de gravação em cache e $1.20 de saída; no Data Zone, custa $0.22, $0.03, $0.28 e $1.32, por 1 milhão de tokens. Batch fica 50% abaixo do Global Standard, mas armazena o trabalho. O preço provisionado depende da implantação e da reserva.
Teste grátis: a página ativa de preços dos modelos não informa teste específico do Foundry.

O ponto forte
O que faz bem
4 points

  • Ótima integração com identidade, rede, chaves e controles geográficos do Azure.
  • A inferência de modelo sem estado não armazena prompts no modelo.
  • O monitoramento de abuso modificado pode remover o armazenamento de conteúdo e a análise humana.
  • O estado do controle pode ser verificado nas capabilities do recurso.
O ponto fraco
Onde deixa a desejar
4 points

  • Nenhum botão ZDR universal cobre todo o produto.
  • O monitoramento de abuso modificado exige aprovação.
  • Várias conveniências para agentes armazenam dados do tenant.
  • As opções Data Zone e de implantação provisionada aumentam a complexidade dos preços.

8. OpenRouter: melhor para roteamento ZDR entre vários provedores

O OpenRouter é o melhor gateway quando um agente empresarial precisa acessar vários provedores e a camada de roteamento deve excluir endpoints sem política ZDR.

Documentação do OpenRouter com aplicação de ZDR global, por grupo de modelos, por guardrail e por solicitação
Controles de roteamento ZDR do OpenRouter

A aplicação de ZDR do OpenRouter funciona globalmente, por grupo de modelos, dentro de um guardrail ou em cada solicitação. Uma solicitação com zdr:true só é roteada para endpoints que o OpenRouter identifica como ZDR. A regra da solicitação é combinada às configurações da conta e do guardrail por um OR lógico; assim, uma chamada individual não consegue enfraquecer uma política mais rigorosa.

Isso é útil tanto na avaliação de modelos quanto no roteamento de produção entre vários provedores. A equipe de plataforma pode manter uma integração compatível com OpenAI, comparar endpoints elegíveis e impedir que um fallback leve a chamada até um provedor que retém prompts. O OpenRouter também afirma não reter prompts, salvo quando o cliente aceita o registro deles.

O benefício tem dois limites. Primeiro, a aplicação de ZDR do OpenRouter cobre o roteamento da inferência entre provedores, não plugins nem ferramentas como busca na web. Cada terceiro exige uma análise própria. Segundo, uma política de grupo de modelos pode mudar a rota de uma forma inesperada pelo comprador. Impor ZDR ao grupo Anthropic remove endpoints próprios da Anthropic, mas pode manter rotas do Bedrock e do Vertex. No grupo OpenAI, os endpoints próprios da OpenAI saem, mas os do Azure podem permanecer. No grupo Google, AI Studio sai, enquanto Vertex pode continuar.

Esse comportamento só é útil se a equipe de segurança aprovar a rota sobrevivente do provedor. “Modelo ZDR” não basta. Contrato, região, configuração do monitoramento de abuso, cadeia de ferramentas e proprietário do endpoint precisam estar alinhados à política pretendida. O OpenRouter publica uma lista atual de endpoints ZDR, mas a empresa deve registrar o conjunto aprovado e emitir um alerta quando a rota mudar.

A página de preços do OpenRouter é direta. O Free inclui mais de 25 modelos gratuitos, 4 provedores e 50 solicitações diárias. O Pay-as-you-go cobre mais de 500 modelos e 80 provedores, sem gasto mínimo, e cobra uma taxa de plataforma de 5.5%. O Enterprise usa compromissos de volume com descontos na taxa negociados com a equipe comercial. No Pay-as-you-go, o uso com chave própria não tem taxa até $25,000 de inferência pelo preço de tabela por mês; no Enterprise, o limite é $200,000. Depois disso, a taxa é de 5%.

O OpenRouter ocupa o oitavo lugar porque um gateway acrescenta uma camada de processamento e política. Isso pode melhorar a aplicação dos controles, mas não torna compatível uma ferramenta ou um provedor fora da política. Use-o quando a escolha de modelos e os fallbacks importarem o suficiente para justificar mais essa fronteira.

Melhor para: agentes multimodelo que precisam de roteamento e fallback atentos ao ZDR.
Destaque: controles de conta, grupo de modelos, guardrail e solicitação podem impedir rotas para endpoints sem ZDR.
Preço: o Free oferece mais de 25 modelos, 4 provedores e 50 solicitações por dia. O Pay-as-you-go cobra taxa de plataforma de 5.5% e não exige gasto mínimo. O Enterprise usa compromissos de volume com preço negociado. BYOK não tem taxa até $25,000 de inferência mensal pelo preço de tabela no Pay-as-you-go ou $200,000 no Enterprise; depois, a taxa é 5%.
Teste grátis: o plano Free é contínuo, e não limitado por tempo.

O ponto forte
O que faz bem
4 points

  • Uma camada de política governa endpoints de vários provedores.
  • Regras por solicitação não conseguem sobrepor uma política de conta mais rigorosa.
  • O plano gratuito atende a verificações de integração em baixo volume.
  • Metadados publicados dos endpoints tornam a política de roteamento inspecionável.
O ponto fraco
Onde deixa a desejar
4 points

  • Plugins e ferramentas ficam fora da fronteira de aplicação do ZDR.
  • Uma rota de nuvem sobrevivente ainda exige aprovação própria.
  • A elegibilidade dos provedores pode mudar com o tempo.
  • A taxa da plataforma encarece o uso roteado.

9. Mistral AI: melhor para cargas Mistral sem estado, não para Mistral Agents

A Mistral AI é uma boa plataforma ZDR para cargas de API aprovadas e sem estado, mas seu produto gerenciado Agents está explicitamente fora dessa fronteira.

Documentação da Mistral que lista endpoints sem estado cobertos por ZDR e produtos com estado excluídos
Cobertura ZDR da Mistral AI

A documentação de ZDR da Mistral disponibiliza o controle mediante aprovação nos planos pagos. Entre os endpoints sem estado cobertos estão Chat Completions, fill-in-the-middle completions, Embeddings, Moderation, Classification, OCR, Speech e Transcription. Os modelos Labs ficam excluídos. É um conjunto útil para serviços multilíngues de extração, classificadores privados de documentos e agentes de programação controlados pelo cliente.

O limite declarado é especialmente direto: Agents, arquivos Batch, Conversations, Libraries, Files, Vibe Work e Chat não estão cobertos. Portanto, o produto chamado Agents não pode ser a camada gerenciada de um agente ZDR rigoroso. Use a API sem estado por baixo do seu próprio orquestrador e mantenha memória, documentos e estado das tarefas em outro lugar.

A Mistral também separa ZDR da exclusão do treinamento. O cliente não precisa de ZDR apenas para impedir que dados elegíveis treinem modelos, e escolher não treinar não produz retenção zero. Essa formulação ajuda a equipe de compras a escrever o requisito corretamente.

Os preços da Mistral API listam o Mistral Large a $0.50 de entrada e $1.50 de saída por 1 milhão de tokens. Batch reduz o preço dos tokens em 50%, e a entrada em cache pode baixar o custo de entrada em até 90%, mas arquivos Batch ficam fora do ZDR. Os planos de produtos para usuários são Free, com $10 mensais em créditos de API; Pro, a $14.99 por mês com $30 em créditos mensais de API; Team, a $24.99 por usuário por mês; e Enterprise, negociado com a equipe comercial. Esses planos não tornam o recurso gerenciado Agents elegível para ZDR. Uma organização ZDR precisa de um plano pago e de aprovação.

A Mistral fica em último lugar porque a busca em questão trata especificamente de agentes empresariais. A API sem estado é competitiva, o preço é claro e a lista de cobertura é útil. Ainda assim, o desencontro entre o nome do produto e sua elegibilidade deixa espaço demais para um executivo comprar a camada errada.

Melhor para: chamadas a modelos Mistral dentro de uma arquitetura de agentes criada e armazenada pelo cliente.
Destaque: cobertura ampla de APIs sem estado para texto, OCR, classificação e áudio.
Preço: o Mistral Large custa $0.50 de entrada e $1.50 de saída por 1 milhão de tokens. Batch custa 50% menos, e a entrada em cache pode custar até 90% menos, mas arquivos Batch ficam fora do ZDR. Os produtos para usuários são Free, com $10 mensais em créditos de API; Pro, a $14.99 por mês com $30 em créditos mensais; Team, a $24.99 por usuário por mês; e Enterprise. Mesmo assim, ZDR exige um plano pago e aprovação.
Teste grátis: o plano de produto Free não se qualifica para ZDR.

O ponto forte
O que faz bem
4 points

  • Lista clara de endpoints sem estado compatíveis.
  • Preço competitivo por token do Mistral Large.
  • A cobertura vai além de texto e inclui APIs de OCR e áudio.
  • ZDR e exclusão do treinamento são documentados como decisões separadas.
O ponto fraco
Onde deixa a desejar
4 points

  • O produto gerenciado Agents não é elegível para ZDR.
  • Batch, arquivos, conversas e bibliotecas ficam excluídos.
  • Modelos Labs ficam excluídos.
  • Exige aprovação e um plano pago.

O orçamento mensal de inferência não é todo o orçamento de privacidade

As tarifas por token importam porque um agente empresarial pode gerar bilhões de tokens de entrada a partir de documentos recuperados, resultados de ferramentas e memória repetida. Ainda assim, elas não medem a qualidade do modelo. A comparação abaixo normaliza apenas uma carga: 1 bilhão de tokens de entrada e 200 milhões de tokens de saída, sem cache, ferramentas, acréscimo regional ou desconto por volume.

Escada de custos em cinco níveis que compara as tarifas mensais publicadas de tokens para Fireworks ou Groq, OpenAI, Google, Mistral e Anthropic
Tarifas publicadas para um único perfil de tokens. É uma comparação de orçamento, não um benchmark de qualidade.

Fireworks ou Groq com GPT OSS 120B chegam a $270. OpenAI GPT-5.6 Luna fica em $440. Google Gemini 3.1 Flash-Lite, em $550. Mistral Large, em $800. Anthropic Sonnet 5, em $4,000. Um número menor não significa que o modelo concluirá a mesma tarefa com a mesma precisão, latência ou quantidade de novas tentativas.

O cálculo de compras mais útil tem três linhas:

  1. Inferência: tokens do modelo, ferramentas, grounding, processamento regional e taxas de gateway.
  2. Propriedade do estado: banco de dados, armazenamento de objetos, segredos, criptografia, rotinas de exclusão, rastros e backups.
  3. Operação dos controles: evidências de aprovação, testes de regressão, monitoramento de fornecedores, análise de incidentes e horas da equipe.

Um agente privado é econômico quando a soma dessas três linhas fica abaixo do custo e do risco de um fluxo gerenciado que retém dados. O resultado muda conforme a sensibilidade dos dados. Um agente de atendimento que processa conteúdo público da central de ajuda talvez não precise de ZDR. Já um agente de due diligence que lê documentos de aquisição muitas vezes precisa.

Para analisar com mais profundidade a economia de tokens entre fornecedores, consulte a comparação das APIs de IA mais baratas. Mantenha o benchmark de qualidade separado da tabela de preços.

Qual plataforma escolher em cada cenário

Um fundador com investimento que esteja criando um produto de saúde ou finanças deve começar pela OpenAI API se a capacidade de fronteira for importante e a empresa puder obter aprovação ZDR. A memória de pacientes, clientes ou transações deve ficar na camada de dados da própria empresa. Se os recursos não elegíveis da OpenAI forem centrais ao produto planejado, corrija a arquitetura antes que compras aprove o modelo.

Um CTO de uma empresa de médio porte com plano de controle AWS consolidado deve escolher o Amazon Bedrock quando o objetivo de segurança for aplicar a política em toda a organização. A decisão deixa de favorecer o Bedrock se um modelo obrigatório não permitir none e o negócio não aceitar outro modelo.

Uma empresa no Google Cloud deve escolher a Gemini Enterprise Agent Platform quando IAM, repositórios de dados e operações já estiverem lá. A decisão muda se o fluxo depender de grounding com Google Search ou Maps, persistência de sessão do CodeMender ou outro recurso de Advanced AI incapaz de cumprir a política.

Um líder experiente de plataforma que queira Claude deve escolher a Anthropic API quando a equipe puder usar chamadas elegíveis de Messages e ferramentas no lado do cliente. A decisão muda se Fable 5, Mythos 5, Managed Agents, execução hospedada de código ou MCP Connector forem indispensáveis.

Uma equipe que trabalha com modelos abertos deve colocar Fireworks AI e GroqCloud na lista final. Escolha Fireworks quando o comportamento ZDR padrão e o catálogo de serviço forem adequados. Prefira Groq quando baixa latência, ZDR autogerenciado e seu modelo de capacidade se encaixarem melhor. Faça benchmark com o modelo e a carga exatos antes de decidir.

Uma empresa padronizada no Azure deve usar Microsoft Foundry quando o monitoramento de abuso modificado estiver aprovado e for possível confirmar ContentLogging:false. A escolha deixa de fazer sentido se a organização quiser um único contrato ZDR portátil entre nuvens, em vez de controles específicos do Azure.

Use OpenRouter quando escolha de modelos, fallback e diversidade de provedores forem requisitos. Não o transforme em atalho de privacidade. Cada plugin, ferramenta e endpoint restante do provedor ainda precisa de aprovação.

Use a API sem estado da Mistral quando os modelos da empresa servirem para a tarefa e a organização puder construir o próprio estado do agente. Não escolha o produto gerenciado Agents para uma exigência ZDR rigorosa.

O que evitar quando o ZDR precisa ser rigoroso

Evite Claude Fable 5 e Claude Mythos 5, a menos que a organização aceite formalmente a retenção de 30 dias. A mesma exclusão acompanha esses modelos cobertos na API própria e nos marketplaces de nuvem, salvo quando a conta tiver elegibilidade ZDR específica.

Evite Mistral Agents em um fluxo cujo requisito diga literalmente retenção zero de dados. As APIs sem estado da Mistral podem se qualificar; o produto gerenciado Agents, não.

Evite grounding com Google Search e Google Maps na rota rigorosa. Search tem um período inevitável de retenção de até 3 dias, e Maps armazena o conteúdo relevante por 30 dias. Use Web Grounding for Enterprise quando ele atender ao caso de uso e ao contrato.

Evite padrões que armazenam conversas. Fireworks Responses usa store=True por padrão. Google Interactions também define store como true por padrão. Uma política de produção deve configurar explicitamente o comportamento privado e rejeitar qualquer implantação que o omita.

Evite endpoints convenientes com estado sem uma aprovação de retenção separada. Isso inclui Conversations, Assistants, Threads, Files, Vector Stores e Batch da OpenAI; Managed Agents, Batch, Files, execução de código e MCP Connector da Anthropic; estado de Batch e fine-tuning da Groq; histórico de Responses, Assistants Threads, Files e Batch da Microsoft; e Conversations, Libraries, Files e Batch da Mistral.

Evite uma análise de privacidade restrita ao gateway. O OpenRouter pode impedir que uma rota de inferência chegue a um endpoint sem ZDR. Ele não governa o plugin de busca na web, servidor MCP, CRM, navegador, ferramenta de analytics ou banco de dados que recebe o conteúdo depois da chamada do modelo.

A ação de segunda-feira: execute um teste de retenção

Não comece com uma concorrência entre nove fornecedores. Escolha um fluxo sensível e comprove sua fronteira na segunda-feira.

  1. Escolha um registro

    Crie um registro sintético parecido com os dados sensíveis que o agente processará. Inclua uma string-canário única para que todas as cópias possam ser encontradas.

  2. Desenhe cada etapa

    Liste cliente, gateway, endpoint do modelo, cache, banco de memória, repositório de arquivos, sistema de observabilidade, ferramenta e rota de análise humana. Associe um responsável e uma regra de retenção a cada item.

  3. Ative o controle rigoroso

    Ligue a configuração ZDR ou sem estado da plataforma no nível da organização ou do projeto. Defina explicitamente os sinalizadores de armazenamento da solicitação, mesmo quando o fornecedor afirmar que o ZDR os substitui.

  4. Quebre o fluxo de propósito

    Chame um recurso incompatível. Um controle sólido deve bloqueá-lo, desativá-lo ou gerar um alerta. Se a chamada funcionar e armazenar o canário, a arquitetura precisa de outra camada de proteção.

  5. Busque, exclua e formalize

    Procure o canário em todos os sistemas aprovados, execute a rota de exclusão, preserve as evidências e obtenha a assinatura da segurança e do responsável pelo produto no diagrama. Repita o processo após qualquer mudança de modelo, ferramenta ou recurso do agente.

O resultado não é uma política de 40 páginas. É um mapa da solicitação, um pacote de evidências e uma decisão: manter o fluxo, trocar o recurso ou trocar o provedor. Assim, ZDR se torna um controle operacional, e não um adjetivo de compras.

Perguntas frequentes

Qual é a melhor plataforma de agentes de IA para empresas?

A OpenAI API é a melhor plataforma de modelos com ZDR para a maioria das empresas que precisam de capacidade de fronteira. O Amazon Bedrock é superior quando a política de retenção deve bloquear desvios em toda uma organização AWS. A Google Gemini Enterprise Agent Platform é a escolha mais forte para um ambiente já estabelecido no Google Cloud. A resposta muda quando um recurso obrigatório de memória, arquivo, busca ou agente gerenciado fica fora do ZDR.

Qual é o melhor agente de IA em 2026?

Não existe um único agente ideal para todos os fluxos empresariais. Para ZDR rigoroso, construa o agente sobre um endpoint de modelo compatível e sem estado, mantendo o estado durável em sistemas controlados pelo cliente. A OpenAI lidera em ZDR com modelos de fronteira, o Bedrock em aplicação de políticas e Fireworks ou Groq em inferência com modelos abertos.

Quais são as principais tendências de IA para empresas em 2026?

Uma tendência importante é a separação entre acesso ao modelo e propriedade do estado. As regras de retenção dos modelos de fronteira agora afetam a elegibilidade, enquanto as empresas precisam cada vez mais controlar memória, arquivos, rastros e governança de ferramentas para manter privados os fluxos sensíveis de agentes.

Qual é a melhor plataforma de IA em 2026?

Em um programa empresarial de IA amplo, a melhor plataforma é aquela que combina com os controles de nuvem, requisitos de modelo, fronteira de dados e equipe operacional da empresa. Para a exigência mais específica de ZDR, OpenAI API, Amazon Bedrock e Google Gemini Enterprise Agent Platform lideram, com diferenças na cobertura dos recursos e na aplicação das políticas.

Quer uma referência de uma página para associar ferramentas de IA a fluxos de negócio e riscos? Baixe o Mapa de ferramentas de IA para empresários pela newsletter.

Última atualização

2 de set. de 2026

CategoriaAI

Prefira este site no Google

Adicionar omidsaffari.com como fonte preferida na Busca do Google

Marque omidsaffari.com como fonte preferida e o Google destaca o site para você em Top Stories, AI Overviews e AI Mode.

Newsletter

Uma carta, todo domingo. Sistemas que funcionam, não hot takes.

Build logs, sistemas em produção e notas de campo de um portfólio de ventures de IA.

Semanal. Sem spam. Cancele quando quiser.