2026 年企业 AI 智能体:9 大零数据保留 AI 平台

对比 2026 年 9 大零数据保留 AI 平台:OpenAI API 适合需要前沿模型的企业,Amazon Bedrock 擅长用失败关闭策略强制执行留存规则。文章逐项拆解 ZDR 对推理、记忆、文件、工具与托管智能体的覆盖边界,并核对价格、审批门槛和部署风险,帮助安全、采购及平台团队为敏感工作流选出更稳妥的方案。

Wednesday, September 2, 2026Omid Saffari
2026 年企业 AI 智能体:9 大零数据保留 AI 平台

2026 年,对大多数企业智能体团队来说,OpenAI API 是综合表现最好的零数据保留 AI 平台:它让前沿模型始终可以走 ZDR 路径;如果留存策略必须在整个 AWS 环境中以“失败即关闭”的方式执行,Amazon Bedrock 则更强。需要注意的是,ZDR 保护的是推理路径,而不是整个智能体产品——有状态记忆、文件、代码沙箱、搜索和托管智能体层都可能重新引入数据留存。在统一为 100 万个输入 token 和 20 万个输出 token 的工作负载下,按当前 Standard 费率计算,GPT-5.6 Luna 的成本为 $0.44;真正影响预算的,是企业能否承担自建智能体状态层的成本。

2026 年最佳零数据保留 AI 平台速览

零数据保留(Zero Data Retention,ZDR)是指:受支持的 prompt 和输出在处理完成后不会以静态形式保存。但它不会自动覆盖连接到模型的每一个文件存储、记忆层、工具或托管智能体。这个边界差异,正是本次排名最重要的判断标准。

下列价格均于 2026 年 8 月 22 日从厂商实时页面核验。除非另有注明,token 价格均按每 100 万个 token 计算。“未列出”表示厂商定价页没有宣传平台专属试用,并不代表销售团队一定无法提供额度。

工具最适合起步价格免费试用
OpenAI API在获批 ZDR 组织中使用前沿模型GPT-5.6 Luna:输入 $0.20,输出 $1.20未列出
Amazon Bedrock通过 AWS 策略拦截不兼容调用Intelligent Prompt Routing:每 1,000 次请求 $1,另计模型费用未列出
Google Gemini Enterprise Agent Platform能够逐项管控智能体功能的 Google Cloud 团队Gemini 3.1 Flash-Lite:输入 $0.25,输出 $1.50未列出
Anthropic API由客户自行掌控状态与工具的 Claude 智能体Haiku 4.5:输入 $1,输出 $5未列出
Fireworks AI默认启用 ZDR 的开放模型推理GPT OSS 20B:输入 $0.07,输出 $0.30$1 额度
GroqCloud低延迟开放模型推理GPT OSS 20B:输入 $0.075,输出 $0.30免费层级
Microsoft Foundry由 Azure 治理的无状态推理GPT-5.6 Luna:输入 $0.20,输出 $1.20未列出
OpenRouter带 ZDR 策略过滤的多提供商路由免费,或收取 5.5% 的 Pay-as-you-go 费用免费方案
Mistral AI获批的无状态 Mistral API 工作负载Mistral Large:输入 $0.50,输出 $1.50无免费 ZDR 方案

模型质量、编排能力与业务适配度等更广泛的问题,可参阅这份企业 AI 智能体平台对比。本文的排序不同,因为数据留存安全高于功能丰富度。只要平台最方便的智能体功能会让 ZDR 承诺失效,它就会被扣分。

零数据保留对企业 AI 智能体意味着什么

“我们不会用你的数据训练模型”和“我们不会保留你的数据”回答的是两个不同问题。即使承诺不用于训练,提供商仍可能为滥用监控、调试、对话历史、批处理或文件检索而保存 prompt。ZDR 的承诺范围更窄:受支持的内容在请求结束后不会被保留。

对智能体而言,这项承诺比一次普通的聊天补全更难实现。一个实用的企业智能体通常至少包含四层:

  • **推理:**模型读取 prompt 并返回答案。
  • **状态:**记忆、对话历史、检查点和任务状态。
  • **知识:**上传文件、向量存储、数据库和检索日志。
  • **动作:**搜索、代码执行、浏览器、MCP 服务器和业务应用。

只有第一层天然无状态。其余三层之所以存在,正是因为某些内容必须在某处持久化。因此,一个平台完全可能拥有优秀的 ZDR 推理能力,却并不适合把对话记录、文件或沙箱留在厂商产品内的托管智能体。

请求穿过零保留推理边界,而文件、托管记忆和第三方仍构成独立留存风险的架构图
ZDR 保护的是推理路径。每个有状态侧门都需要自己的策略。

这就是状态所有权成本。严格 ZDR 往往意味着企业必须自行掌控保存记忆的数据库、容纳文件的对象存储、支持事件复盘的追踪系统,以及恢复长时间任务的队列。安全与法务团队由此获得清晰的控制边界,但删除作业、访问策略、备份规则和随时待命的运维压力都会落到工程团队身上。

真正可执行的标准不是“厂商有没有 ZDR 页面”,而是:能否画出一条完整请求路径,并证明每个接触客户内容的系统都有兼容的留存规则? 如果答案依赖默认复选框、没有文档的插件,或会悄悄保存状态的托管功能,这条工作流就还不能处理敏感数据。

这些零数据保留 AI 平台是如何入选的

本次对比基于 2026 年 8 月 22 日仍在线的厂商数据控制、文档和定价页面,共评估九个平台。排名不依赖虚构试用或笼统的安全徽章,而是由以下五项测试决定:

  1. **留存承诺:**提供商是否明确说明,受支持的 prompt 和输出在处理后不会以静态形式存储?
  2. **失败关闭:**不兼容的模型或功能会被拦截,还是开发者可能在不知情时离开 ZDR 路径?
  3. **智能体覆盖范围:**记忆、文件、批处理任务、代码执行、网页搜索、MCP 和托管智能体记录分别如何处理?
  4. **管理证据:**安全负责人能否集中启用策略,并验证其确实生效?
  5. **商业透明度:**当前费率及隐私安全替代方案的成本是否足够清晰,可以据此编制预算?

只承诺不使用客户数据训练的平台被排除。没有提供商侧留存承诺的编排框架也被排除,因为它们无法保证底层模型托管方会存储什么。最终名单只保留两类厂商:要么提供可用的 ZDR 控制,要么能为企业 API 流量给出站得住脚的无状态路径。

名称与实际覆盖范围不匹配也会影响排名。例如,Mistral 的多个无状态 API 支持 ZDR,但名为 Agents 的产品却不在范围内。Microsoft 记录了无状态模型推理和修改后的滥用监控,却没有提供一个简单的自助式 ZDR 开关。它们仍可能是好选择,但实施团队必须理解这些前提。

1. OpenAI API:前沿模型 ZDR 综合首选

企业既希望使用当前前沿模型,又不愿放弃零数据保留路径时,OpenAI API 是综合表现最好的选择。

OpenAI API 数据控制文档,展示零数据保留资格和端点行为
OpenAI API 数据控制

OpenAI 的8 月 19 日公告之所以重要,是因为它明确了业务层面的影响:随着模型承担更长、更复杂的工作,符合条件的 API 客户仍可保留 ZDR。按已发布的承诺,prompt 和模型响应在处理后不会被保留,OpenAI 人员无法访问相关内容;除非客户主动选择加入,否则企业数据不会用于训练。公司还预告了 Private Safety Processing,目标是在不向 OpenAI 人员暴露底层内容的情况下,识别跨多次相关交互的风险模式。

最典型的采购者,是需要模型能力、却不能接受提供商日常访问 prompt 的银行、医疗软件公司、法律平台或企业 SaaS 厂商。OpenAI 提供直接 API、项目级控制、广泛支持 ZDR 的推理端点,以及清晰的模型路线图。GPT-5.6 Luna 也让入门成本异常低:按 Standard 短上下文费率计算,100 万个输入 token 加 20 万个输出 token 只需 $0.44。

真正的边界在应用状态。OpenAI 实时端点留存表显示,Chat Completions 和 Responses 在一定限制下符合 ZDR;Conversations、ChatKit threads、Assistants、Threads、Vector Stores、Files、Evals 和 Batches 则不符合。远程 MCP 服务器遵循各自的留存策略。Hosted Shell 和 Code Interpreter 的容器在运行期间可以写入临时数据。Background Responses 会把临时状态写入磁盘约 10 分钟,以便客户端轮询任务。

因此,OpenAI 是本文最佳模型平台,并不意味着每项 OpenAI 功能都可以直接使用。严格部署应把记忆和文件持久化放在客户基础设施内,调用受支持的无状态端点,并分别审批每个工具的目标服务。在 ZDR 下,即便请求传入 true,OpenAI 也会把 Responses 和 Chat Completions 的 store 视为 false,从而消除一个危险的默认行为。组织仍须事先获得 ZDR 批准。

Private Safety Processing 也应被当作预览,而不是今天就能写入生产架构的控制项。OpenAI 表示早期客户测试已经开始,并计划在 2026 年 9 月推出服务和技术白皮书。已经存在的 ZDR 才是采购事实;这项预览只代表发展方向。被标记为可能属于 CSAM 的图片仍是明确例外,可以为人工审查和依法报告而保留。

**最适合:**需要通过获批无状态路径使用 OpenAI 前沿模型的企业。
**突出优势:**在 ZDR 下,受支持的 Responses 和 Chat Completions 调用会被强制设为 store=false
价格:当前 OpenAI API 价目表显示,GPT-5.6 Luna 短上下文在 Standard 下每 100 万个 token 的输入、缓存输入、缓存写入和输出价格依次为 $0.20、$0.02、$0.25 和 $1.20;Batch 或 Flex 为 $0.10、$0.01、$0.125 和 $0.60;Fast 为 $0.40、$0.04、$0.50 和 $2.40。对 2026 年 3 月 5 日或之后发布的符合条件模型,区域数据驻留处理加收 10%。
**免费试用:**实时 API 定价页未列出平台专属试用。

优势
做得好的地方
8 points

  • 明确承诺在 2026 年 8 月继续为前沿模型部署提供 ZDR。
  • 组织与项目控制可让企业隔离获批工作负载。
  • ZDR 会在受支持的推理调用中强制执行 store=false。
  • GPT-5.6 Luna 费率低,私有智能体的推理预算易于估算。
  • ZDR 需要审批,并附带额外义务。
  • 许多方便的有状态智能体资源不在 ZDR 范围内。
  • MCP 服务器及其他外部工具会形成独立的留存边界。
  • 临时容器、缓存和后台状态仍需架构审查。
  1. 取得书面控制依据

    为实际承载生产流量的 API 组织申请 ZDR。记录审批结果、合同范围、符合条件的模型、例外情况及负责的安全负责人。

  2. 创建专用项目

    将敏感智能体放入独立项目,并选择获批的留存控制,不要继承含糊的组织默认设置。开发密钥与生产密钥应分离。

  3. 盘点每个端点

    按照 OpenAI 当前的端点表映射整条工作流。主推理路径只保留符合条件的 Responses 或 Chat Completions 调用;从严格路径移除 Conversations、Assistants、Files、Vector Stores、Evals 和 Batch。

  4. 把状态移到自身边界

    将记忆、任务状态、文档和审计追踪存入受企业自身留存计划管控的系统。每次模型调用只传递最低限度的必要上下文。

  5. 执行金丝雀留存演练

    发送一条合成的敏感记录,追踪每个目标,验证 store=false,确认记录只出现在获批的客户系统中,并确保不兼容功能在接触真实数据前就会失败。

2. Amazon Bedrock:失败关闭策略执行首选

如果留存策略必须在整个 AWS 组织内统一强制执行,而不能依赖每位开发者牢记规则,Amazon Bedrock 是最强选择。

Amazon Bedrock 数据留存文档,说明 none、default、provider sharing 及策略执行
Amazon Bedrock 数据留存模式

Bedrock 把留存设为账户或项目级模式。将 data_retention_mode 设为 none 后,Bedrock 留存文档明确表示,请求和响应既不会写入持久存储,也不会共享给模型提供商。若某个模型要求留存,请求会被拦截。在 Responses API 中,store 默认为 falsestore=true 会被拒绝,Background 模式不可用;此模式下的 Chat Completions 和 Messages 永不保留。

正是这种失败关闭行为,让 Bedrock 排在营销承诺更简单的平台之前。受监管企业可以通过 IAM 策略或 Service Control Policies,拒绝 none 之外的所有留存设置。即使人员更替、版本仓促上线,或开发者复制了示例代码,控制仍然有效。它属于云安全体系,而不是工程检查清单上的一项提醒。

明确的限制是模型可用性。除非账户获得单模型 ZDR 批准,否则 Claude Fable 5 和 Claude Mythos 5 必须使用 provider_data_share。启用共享后,prompt 和 completion 最长可保留 30 天。设置 none 的团队应预期这些模型会显示为不可用,并把被拦截的请求视为控制正常生效。

Bedrock 还提醒,只有 store=false 并不能保证 ZDR。除非实际生效的留存模式为 none,模型仍可能为安全审查而保留内容。这一区分对采购很重要:API 参数描述请求行为,留存模式才是策略。

Bedrock 跨地区、以多种服务模式托管多家厂商的模型,因此价格不如直接模型 API 简洁。Bedrock 定价页显示,Intelligent Prompt Routing 每 1,000 次请求收费 $1,另加底层模型 token 费用。它可以在同一模型家族内路由,但 ZDR 买家首先应确认每个候选模型都允许 none。只有先满足留存策略,成本优化才有意义。

**最适合:**希望集中强制执行留存策略的 AWS 企业。
**突出优势:**对不兼容模型的请求会直接失败,而不是悄悄保留数据。
**价格:**模型费用因提供商、模型、地区和服务模式而异。Intelligent Prompt Routing 每 1,000 次 On-Demand 请求收费 $1,另计模型费用。
**免费试用:**实时 Bedrock 定价页未列出 Bedrock 专属试用。

优势
做得好的地方
8 points

  • 账户和项目的留存模式定义明确。
  • IAM 与 SCP 可强制要求只能使用 none。
  • 不兼容的模型调用会被拦截。
  • 一个 AWS 平台即可治理多家模型提供商。
  • ZDR 可能让所需模型从目录中消失。
  • 价格取决于底层模型和地区。
  • none 模式不支持 Background Responses。
  • 部分最新 Claude 模型需要单独申请单模型 ZDR 批准。

3. Google Gemini Enterprise Agent Platform:Google Cloud 智能体团队首选

对于能够像管控模型调用一样细致地治理每项智能体能力的 Google Cloud 组织,Google Gemini Enterprise Agent Platform 最为合适。

Google Cloud 文档,说明如何在 Gemini Enterprise Agent Platform 各项功能中实现零数据保留
Gemini Enterprise Agent Platform 的 ZDR 控制

Google 的8 月 21 日文档格外实用,因为它明确点出了会让宽泛 ZDR 假设失效的控制项。基础承诺很强:未经许可,客户数据不会用于训练或微调托管模型;请求—响应日志默认关闭;如果客户属于滥用监控 prompt 日志的适用范围,还可以申请例外。

难点在于,不同智能体功能的存储行为各不相同。Interactions API 的 store 默认为 true,因此 ZDR 请求必须明确传入 store=false。Grounding with Google Search 会把派生查询和上下文最长保存 3 天,而且无法关闭;Google 建议改用 Web Grounding for Enterprise。Grounding with Google Maps 会把 prompt、上下文和生成输出保存 30 天,同样没有关闭开关。

CodeMender 又形成了一条重要边界。为了让长时间扫描可以恢复,它会把代码片段、diff、配置和分析检查点等加密会话数据最长保存 7 天。任务进入终态后,代码内容会在数秒内清除,其余会话记录则在 7 天上限到期时删除。这可能是合理的企业留存周期,但不是零留存。

Gemini Live 的会话恢复为主动选择功能,会将缓存文本、音频、视频和输出最长保存 24 小时;严格路径应保持关闭。Google 默认的内存缓存同样有 24 小时 TTL,但 Google 认为这种项目隔离、非持久化的缓存与 ZDR 兼容,并允许管理员在项目范围内关闭。采购团队应判断这一定义是否符合内部策略,而不能假定所有审计人员都会同等看待易失性内存。

如果企业已经使用 Google Cloud IAM、网络、日志和数据服务,Google 的优势在于获批智能体可以把持久状态保留在现有云边界内。它在失败关闭的简洁度上不如 Bedrock:必须同时正确配置多项设置,部分 Advanced AI 功能甚至可能让 ZDR 无法实现。Google 建议客户向客户团队确认,且这一步应在模型获批前完成。

**最适合:**围绕获批的无状态 Gemini 调用构建智能体的 Google Cloud 企业。
**突出优势:**针对 Search、Maps、Interactions、Live 会话、缓存和 CodeMender 提供逐项功能指导。
价格:当前 Google 模型价目表显示,Gemini 3.1 Flash-Lite global Standard 每 100 万个文本 token 的输入、缓存输入和输出价格为 $0.25、$0.025 和 $1.50;Priority 为 $0.45、$0.045 和 $2.70;Flex/Batch 为 $0.125、$0.0125 和 $0.75。Web Grounding for Enterprise 每月包含 5,000 次 grounding 查询,超出后每 1,000 次收费 $14。
**免费试用:**实时平台定价页未列出平台专属试用。

优势
做得好的地方
8 points

  • 与 Google Cloud 治理和客户自有存储高度契合。
  • 当前文档明确列出各项功能的留存行为。
  • 请求—响应日志默认关闭。
  • Web Grounding for Enterprise 为 Google Search grounding 提供面向 ZDR 的替代方案。
  • 除非明确设置 store=false,Interactions API 默认会存储状态。
  • Search、Maps、会话恢复和 CodeMender 都会引入留存。
  • 部分 Advanced AI 功能可能让 ZDR 无法实现。
  • 相比单一 ZDR 开关,平台需要更全面的配置审查。

4. Anthropic API:客户自有状态的 Claude 首选

如果企业愿意用符合条件的无状态功能组装智能体,并自行控制持久状态,Anthropic API 是正确的 Claude 方案。

Anthropic API 与数据留存文档,列出模型和功能的零数据保留资格
Anthropic API 的 ZDR 资格

在获批的 Anthropic ZDR 安排下,Anthropic 表示,响应返回后不会以静态形式存储客户的 prompt 或响应。该安排由销售团队按组织启用。符合条件的 Messages 和 Token Counting 调用均在范围内;如果 Claude Code 使用 Commercial 组织 API key,或使用已启用 ZDR 的 Claude Enterprise,也可纳入覆盖。

Anthropic 最突出的优势,是资格表的颗粒度。客户端侧 Bash、Text Editor、Computer Use、Memory、标准 Messages、Prompt Caching 和标准 Web Search 都可以留在 ZDR 安排内。这让能力较强的工程团队能够构建实用智能体,同时把状态和工具执行留在自己的环境中。Prompt caching 会在缓存 TTL 内把 KV 表示和哈希保存在内存,而不是以静态形式存储 prompt 与输出。

最大的边界来自前沿模型的分化。Claude Fable 5 和 Claude Mythos 5 要求保留 30 天,因此不能用于 ZDR。已经获批 ZDR 的组织可以为某个 workspace 开启留存,但该 workspace 的流量随后就不再满足严格策略。这是采购决策,不是简单的模型开关:要么接受这些模型的留存,要么选择其他符合条件的模型。

第二条边界是托管功能。Claude Managed Agents 有状态,其对话记录会一直保留到被删除。Batch 将数据保留 29 天。Code Execution 与 Programmatic Tool Calling 的容器数据最长可保留 30 天。Files 会持续存在,直到被删除或到期;MCP Connector 遵循标准留存规则。Web Search 和 Web Fetch 的动态过滤不符合 ZDR,尽管其标准形式符合。

与 Bedrock 的一个差异必须在架构审查中重点标红:在 Anthropic ZDR 下,不符合条件的功能不一定会被拦截。开发者仍可使用它,只是相关数据会离开该安排。API 的灵活性把策略执行责任重新交给了代码审查、网关策略和集成测试。

Anthropic 也记录了例外情况。被标记的数据或受法律保全要求约束的数据最长可保留 2 年。这并不意味着合同没有价值,但说明“零”仍有安全和法律边界。安全团队应记录这一边界,而不是承诺厂商自己都没有承诺的绝对零留存。

**最适合:**记忆与工具可以运行在客户控制系统中的 Claude 工作负载。
**突出优势:**详细资格矩阵清楚区分客户端工具与会留存数据的托管功能。
价格:Anthropic API 定价显示,Haiku 4.5 的输入和输出价格为 $1 与 $5。Sonnet 5 的输入、输出、缓存写入和缓存读取价格为 $2、$10、$2.50 和 $0.20。Opus 5 的输入和输出价格为 $5 与 $25,均按每 100 万个 token 计算。Fable 5 的输入和输出价格为 $10 与 $50,但不符合 ZDR。Batch 可节省 50%,但同样不在 ZDR 范围内。
**免费试用:**实时定价页未列出 API 试用。

优势
做得好的地方
8 points

  • 按功能划分的 ZDR 资格表清晰明确。
  • Messages 配合客户端记忆和工具,可形成强大的合规路径。
  • 在正确的商业组织下,Claude Code 可以符合条件。
  • ZDR 下仍可使用 Prompt caching。
  • Fable 5 和 Mythos 5 要求保留 30 天。
  • Managed Agents、Batch、代码执行、Files 和 MCP 都可能离开 ZDR 边界。
  • ZDR 不会自动拦截不符合条件的功能。
  • 被标记的数据最长可保留 2 年。

5. Fireworks AI:开放模型私有推理首选

希望开放模型推理默认采用零数据保留行为的企业,Fireworks AI 是最干净的选择。

Fireworks AI 文档,说明默认零数据保留和 Responses API 的存储行为
Fireworks AI 数据处理方式

对于开放模型,Fireworks 数据处理文档说明,除非用户主动选择记录日志,否则 prompt 和生成内容只在请求期间存在于易失性内存中,不会写入持久存储。Prompt caching 可以把 prompt 数据与 KV cache 在易失性内存中保留数分钟;token 数量等使用元数据则会保留。对安全审查而言,这是一条直接、易懂的边界。

它最适合私有分类、提取、摘要或智能体规划服务,前提是企业不需要厂商托管的对话对象。平台团队可以选择开放模型,把记忆数据库留在自有云中,并将 Fireworks 用作高吞吐推理层。厂商默认设置降低了新项目一开始就启用日志的风险。

一个重要例外是:Fireworks Responses API 的默认值为 store=True。在该模式下,prompt、响应与工具调用会保留 30 天。ZDR Responses 工作流必须设置 store=False。Fireworks 的其他服务遵循默认 ZDR 策略,但 FireOptimizer 等高级功能可能需要明确选择加入 prompt 日志记录。

Fireworks Serverless 价目表足够透明,便于比较不同部署形态。GPT OSS 120B Standard 的输入、缓存输入和输出价格为 $0.15、$0.015 和 $0.60;Priority 路径为 $0.18、$0.018 和 $0.72。GPT OSS 20B Standard 起价分别为 $0.07、$0.035 和 $0.30。Batch 可将 Serverless 的输入与输出价格减半,但所有异步工作流在使用前仍应核对留存要求。

Fireworks 排在三家前沿模型厂商之后,是因为买家只能从其模型目录中选择,而无法通过一项 ZDR 承诺获得每个最新专有模型。它排在 Groq 之前,则得益于默认 ZDR 行为以及格外清晰的 Responses API 文档。两者之间的选择,应取决于模型可用性、延迟目标,以及哪家的控制平面更适合当前部署。

**最适合:**在客户自有智能体栈后提供开放模型的企业。
**突出优势:**除已存储的 Responses 调用外,开放模型推理默认启用 ZDR。
**价格:**GPT OSS 20B Standard 的输入、缓存输入和输出价格为 $0.07、$0.035 和 $0.30。GPT OSS 120B Standard 为 $0.15、$0.015 和 $0.60;Priority 为 $0.18、$0.018 和 $0.72,均按每 100 万个 token 计算。Batch 为 Serverless 输入和输出费率的 50%。
**免费试用:**新账户可获得 $1 免费额度。

优势
做得好的地方
8 points

  • 开放模型推理默认启用 ZDR。
  • 清楚区分易失性缓存和持久存储。
  • GPT OSS 模型公开费率较低。
  • Standard、Priority、Fast 与 Batch 路径可适配不同成本和延迟要求。
  • 除非明确设置 store=False,Responses API 会保留数据 30 天。
  • 部分高级功能需要主动加入日志记录。
  • 使用元数据会被保留。
  • 专有前沿模型覆盖并非选择它的理由。

6. GroqCloud:低延迟开放模型推理首选

如果开放模型智能体既需要低延迟,也需要向所有客户开放的自助式 ZDR 控制,GroqCloud 是最佳选择。

GroqCloud 文档,展示保留的元数据、临时日志和零数据保留控制
GroqCloud 数据控制

Groq 默认不保留推理内容,但这一默认行为不等同于 ZDR。GroqCloud 数据文档说明,公司可能为排查可靠性问题或调查疑似滥用,临时记录输入与输出,最长 30 天。任何客户都可以在 Data Controls 中启用 ZDR,从而在全局或按功能退出此类存储。

对于无法等待企业销售周期的初创公司或中型平台团队,这条自助路径很有吸引力。它也足够明确,适合资金充足的公司围绕开放模型构建语音、分类或工具选择智能体。使用元数据始终会被保留,但 Groq 表示其中不含客户输入或输出。

代价是部分功能会被移除。除非提前删除,Batch 文件最长可持续存在 30 天;微调数据集和权重则会一直保留到删除为止。启用 ZDR 后,依赖客户数据留存才能工作的功能会被禁用。因此,产品经理必须在严格推理路径与 Batch 或托管定制的便利之间作出选择。

Groq 的当前生产模型目录显示,GPT OSS 120B 每 100 万个 token 的输入和输出价格为 $0.15 与 $0.60,GPT OSS 20B 为 $0.075 与 $0.30。Free 账户层级可以低风险验证集成和速率限制。升级到 Developer 不会立即收费,但账户会转为更高限额的 Pay-as-you-go 使用模式,并获得 Flex、Batch、支持和支出控制。

服务层级还带来一项运营决策。On-Demand 是默认选项。Flex 使用相同的 token 定价、吞吐量更高,但可能返回容量错误。Performance 是仅面向 Enterprise、由销售定价的预置层级。auto 会选择可用层级。即使 token 价格看起来很低,不能容忍重试的面向用户智能体也可能需要洽谈企业方案。

**最适合:**能够在提供商侧保持无状态的低延迟开放模型智能体。
**突出优势:**所有客户都能启用 ZDR,无需单独走企业审批流程。
**价格:**GPT OSS 20B 的输入和输出价格为 $0.075 与 $0.30;GPT OSS 120B 为 $0.15 与 $0.60,均按每 100 万个 token 计算。提供 Free 与 Developer 账户层级;Performance 采用通过销售获得的 Enterprise 预置价格。
**免费试用:**提供 Free 账户层级。

优势
做得好的地方
8 points

  • 所有客户均可自助启用 ZDR。
  • 开放模型公开费率较低。
  • 免费层级支持在付费前完成集成验证。
  • 付费方案提供支出上限。
  • 默认推理仍可能被临时记录最长 30 天。
  • ZDR 会禁用 Batch 和微调持久化。
  • 使用元数据仍会保留。
  • 性能保证需要 Enterprise 协议。

7. Microsoft Foundry:Azure 治理型企业首选

对于希望获得无状态模型推理、租户自控存储,以及正式关闭滥用监控内容存储路径的 Azure 企业,Microsoft Foundry 最为合适。

Microsoft Foundry 数据隐私文档,展示无状态推理、存储型功能和修改后的滥用监控
Microsoft Foundry 数据隐私控制

Microsoft 的 Foundry 隐私文档说明,Azure 销售的模型均为无状态:prompt 和 completion 不会存入模型,也不会用于训练或改进基础模型。托管客户可以申请修改后的滥用监控。获批后,滥用监控不再使用数据存储和人工审查流程,但请求处理期间仍可能进行自动审查。

这一组合能形成有据可查的类 ZDR 路径,但 Microsoft 没有把它封装成一个通用的自助式 ZDR 设置。企业必须先获批、选择无状态功能,再验证订阅。关闭滥用监控存储后,获批的 Foundry 资源会在 capabilities 中显示 ContentLoggingfalse。控制负责人可以在门户或通过 Azure 管理 API 核验,因此这是一项有价值的证据。

最自然的买家,是已经通过 Azure 管理身份、网络、密钥、数据驻留和采购的企业。智能体可以把文档和持久记忆保留在客户选择的 Azure 资源中,调用无状态部署完成推理,同时维持一套云治理模型。这往往比从模型费率中再省几分钱更重要。

边界是那些按设计就会存储数据的功能。Responses 可以保存消息历史。Assistants Threads、Files、Vector Stores、Stored Completions、Batch 和微调同样会在租户中持久化客户数据。加密、租户所有权和删除控制可以让这些存储变得可接受,却不能把它变成零留存。严格工作流应使用无状态模型调用,并配置带独立删除策略的外部状态层。

Azure 模型定价分为三种商业形态:Standard On-Demand、Provisioned Throughput Units 和 Batch。Batch 可在 24 小时内完成,价格比 Global Standard 低 50%,但处理期间会存储上传的任务,因此不属于严格路径。GPT-5.6 Luna 短上下文在 Global Standard 下的输入、缓存输入、缓存写入和输出价格为 $0.20、$0.02、$0.25 和 $1.20;Data Zone 则提高到 $0.22、$0.03、$0.28 和 $1.32。

**最适合:**已经通过 Azure 订阅和地域设置治理敏感 AI 的企业。
突出优势:ContentLogging:false 为获批客户提供可验证的滥用内容存储控制。
**价格:**GPT-5.6 Luna 短上下文 Global Standard 的输入、缓存输入、缓存写入和输出价格为 $0.20、$0.02、$0.25 和 $1.20;Data Zone 为 $0.22、$0.03、$0.28 和 $1.32,均按每 100 万个 token 计算。Batch 比 Global Standard 低 50%,但会存储任务。Provisioned 价格取决于部署和预留方式。
**免费试用:**实时模型定价页未列出 Foundry 专属试用。

优势
做得好的地方
8 points

  • 与 Azure 身份、网络、密钥和地域控制高度契合。
  • 无状态模型推理不会把 prompt 存入模型。
  • 修改后的滥用监控可以移除内容存储和人工审查。
  • 可在资源 capabilities 中验证控制状态。
  • 没有一个通用 ZDR 开关覆盖整个产品。
  • 修改滥用监控需要审批。
  • 许多便捷的智能体功能会存储租户数据。
  • Data Zone 与预置部署选项增加了定价复杂度。

8. OpenRouter:多提供商 ZDR 路由首选

当一个企业智能体需要访问多家提供商,并要求路由层排除没有 ZDR 策略的端点时,OpenRouter 是最佳网关。

OpenRouter 文档,展示全局、模型组、guardrail 和单请求 ZDR 执行方式
OpenRouter ZDR 路由控制

OpenRouter ZDR 策略执行可应用于全局、模型组、guardrail 内部或单次请求。带有 zdr:true 的请求只会路由到 OpenRouter 标记为 ZDR 的端点。请求规则与账户及 guardrail 设置按逻辑 OR 组合,因此单次请求无法削弱更严格的策略。

这对模型评估和多提供商生产路由很有用。平台团队可以保留一套兼容 OpenAI 的集成,比较符合条件的端点,并防止回退流量落到会保留 prompt 的提供商。OpenRouter 也表示,除非客户主动加入 prompt 日志记录,否则不会保留 prompt。

这项优势有两项限制。第一,OpenRouter 的 ZDR 执行只覆盖推理的提供商路由,不覆盖插件或网页搜索等工具,每个第三方都需要单独审查。第二,模型组策略可能以买家没有预料到的方式改变路由。对 Anthropic 强制执行 ZDR 会移除 Anthropic 第一方端点,但 Bedrock 和 Vertex 路径仍可能可用。OpenAI 组会移除 OpenAI 第一方端点,却可能保留 Azure;Google 组会移除 AI Studio,却可能保留 Vertex。

只有安全团队批准剩余的提供商路径,这种行为才真正有用。“ZDR 模型”还不够:合同、地区、滥用监控配置、工具链和端点所有者都必须符合预期策略。OpenRouter 会发布当前的 ZDR 端点列表,但企业应保存获批集合的快照,并在路由发生变化时发出警报。

OpenRouter 定价页很直观。Free 包含超过 25 个免费模型、4 家提供商,每天 50 次请求。Pay-as-you-go 覆盖超过 500 个模型和 80 家提供商,无最低消费,平台费为 5.5%。Enterprise 通过销售签订用量承诺,并获得费率折扣。Pay-as-you-go 的 BYOK 每月前 $25,000 按目录价计算的推理用量免平台费;Enterprise 的免平台费额度为 $200,000,超出后均收取 5%。

OpenRouter 排在第八,是因为网关会增加一个数据处理方和策略层。这可以强化执行,却无法让不合规的工具或提供商变得合规。只有在模型选择、故障回退和提供商多样性足以证明新增边界值得时,才应使用它。

**最适合:**需要 ZDR 感知路由和回退控制的多模型智能体。
**突出优势:**账户、模型组、guardrail 和请求级策略可以阻止流量进入非 ZDR 端点。
**价格:**Free 提供超过 25 个模型、4 家提供商及每天 50 次请求。Pay-as-you-go 收取 5.5% 平台费,无最低消费。Enterprise 采用销售定价的用量承诺。BYOK 在 Pay-as-you-go 下每月前 $25,000、Enterprise 下每月前 $200,000 的目录价推理用量免平台费,超出后为 5%。
**免费试用:**Free 是持续方案,并非限时试用。

优势
做得好的地方
8 points

  • 一层策略即可治理多家提供商的端点。
  • 单请求规则无法覆盖更严格的账户策略。
  • 免费方案支持低流量集成检查。
  • 公开的端点元数据让路由策略可检查。
  • 插件和工具不在 ZDR 执行边界内。
  • 保留下来的云托管路径仍需单独审批。
  • 提供商资格可能随时间变化。
  • 平台费会增加路由用量的成本。

9. Mistral AI:适合无状态 Mistral 工作负载,不适合 Mistral Agents

对于获批的无状态 API 工作负载,Mistral AI 是不错的 ZDR 平台;但其托管 Agents 产品被明确排除在 ZDR 边界之外。

Mistral 文档,列出 ZDR 覆盖的无状态端点及被排除的有状态产品
Mistral AI 的 ZDR 覆盖范围

根据 Mistral ZDR 文档,付费方案经审批后可以启用该控制。覆盖的无状态端点包括 Chat Completions、fill-in-the-middle completions、Embeddings、Moderation、Classification、OCR、Speech 和 Transcription;Labs 模型除外。对于多语言提取服务、私有文档分类器或客户自建的编码智能体,这一范围相当实用。

限制写得异常直接:Agents、Batch files、Conversations、Libraries、Files、Vibe Work 和 Chat 均不在覆盖范围内。因此,名为 Agents 的产品不能作为严格 ZDR 智能体的托管层。应在自有编排器下调用无状态 API,并把记忆、文档和任务状态存放在其他位置。

Mistral 还明确区分 ZDR 与退出训练。客户若只是希望符合条件的数据不被用于模型训练,并不一定需要 ZDR;同样,选择“不训练”也不会自动实现零留存。这种表述有助于采购团队准确撰写要求。

Mistral API 定价显示,Mistral Large 每 100 万个 token 的输入和输出价格为 $0.50 与 $1.50。Batch 可让 token 价格降低 50%,缓存输入最多可降低 90%,但 Batch files 不在 ZDR 范围内。用户产品层级包括:Free 每月含 $10 API 额度,Pro 每月 $14.99 并含 $30 月度 API 额度,Team 每位用户每月 $24.99,Enterprise 通过销售购买。这些产品层级不会让托管 Agents 功能获得 ZDR 资格。ZDR 组织需要付费方案并通过审批。

Mistral 排名最后,是因为目标查询明确指向企业智能体。它的无状态 API 具有竞争力,价格透明,覆盖清单也很实用;但产品名称与实际范围不一致,管理层买家很容易选错层级。

**最适合:**在客户自建、客户自存的智能体架构中调用 Mistral 模型。
**突出优势:**无状态 API 覆盖文本、OCR、分类和音频等广泛场景。
**价格:**Mistral Large 每 100 万个 token 的输入和输出价格为 $0.50 与 $1.50。Batch 低 50%,缓存输入最多低 90%,但 Batch files 不在 ZDR 范围内。用户产品包括:Free 每月含 $10 API 额度,Pro 每月 $14.99 并含 $30 月度额度,Team 每位用户每月 $24.99,Enterprise 通过销售购买;ZDR 仍需付费方案和审批。
**免费试用:**Free 产品方案不符合 ZDR 条件。

优势
做得好的地方
8 points

  • 支持的无状态端点清单明确。
  • Mistral Large 的 token 价格具有竞争力。
  • 覆盖范围从文本延伸到 OCR 和音频 API。
  • 文档将 ZDR 与退出训练明确区分。
  • 托管 Agents 产品不符合 ZDR。
  • Batch、Files、Conversations 和 Libraries 均被排除。
  • Labs 模型被排除。
  • 必须使用付费方案并获得审批。

月度推理预算不等于全部隐私预算

企业智能体会从检索文档、工具结果和重复记忆中产生数十亿个输入 token,因此 token 费率确实重要,但它仍不能衡量模型质量。下方对比只统一计算一种工作负载:10 亿个输入 token 和 2 亿个输出 token,不考虑缓存、工具、区域加价或用量折扣。

五级成本阶梯,对比 Fireworks 或 Groq、OpenAI、Google、Mistral 与 Anthropic 的已发布月度 token 费率
同一种 token 规模下的公开价目表对比。这是预算比较,不是质量基准。

运行 GPT OSS 120B 的 Fireworks 或 Groq 成本为 $270;OpenAI GPT-5.6 Luna 为 $440;Google Gemini 3.1 Flash-Lite 为 $550;Mistral Large 为 $800;Anthropic Sonnet 5 为 $4,000。价格更低,并不代表模型能以相同准确率、延迟或重试次数完成同一任务。

更合理的采购测算应包含三项:

  1. **推理:**模型 token、工具、grounding、区域处理和网关费用。
  2. **状态所有权:**数据库、对象存储、密钥、加密、删除作业、追踪和备份。
  3. **控制运营:**审批证据、回归测试、厂商监控、事件复盘和人员时间。

只有这三项之和低于会留存数据的托管工作流所带来的成本与风险,私有智能体才真正划算。结果取决于数据敏感度:处理公开帮助中心内容的客服智能体可能不需要 ZDR,而读取并购文件的尽调智能体往往需要。

如需进一步比较不同提供商的 token 经济性,可查看最便宜的 AI API 对比。质量基准应始终与价目表分开评估。

不同企业该如何选择 AI 智能体平台

正在打造医疗或金融产品、且已获融资的创始人,如果前沿能力很重要,并且公司能够获得 ZDR 批准,应先考虑 OpenAI API。患者、客户或交易记忆应保存在公司的自有数据层。如果产品规划高度依赖 OpenAI 不符合条件的资源,就应在采购签署模型合同前先调整架构。

已有成熟 AWS 控制平面的中型企业 CTO,如果安全目标是组织级强制执行,应选择 Amazon Bedrock。如果必需模型不允许 none,而业务又无法接受替代模型,选择就应从 Bedrock 转向其他平台。

如果 IAM、数据存储和运维都已部署在 Google Cloud,企业应选择 Gemini Enterprise Agent Platform。如果工作流依赖 Google Search grounding、Maps grounding、CodeMender 会话持久化,或其他无法满足策略的 Advanced AI 功能,则应改选其他方案。

希望使用 Claude 的资深平台开发者,如果团队可以调用符合条件的 Messages,并使用客户端工具,应选择 Anthropic API。如果 Fable 5、Mythos 5、Managed Agents、托管代码执行或 MCP Connector 属于不可妥协的要求,就不应选择这条路径。

开放模型团队应同时把 Fireworks AI 与 GroqCloud 列入候选。适合 ZDR 默认行为及其服务目录时选 Fireworks;更重视低延迟、自助式 ZDR 和其容量模型时选 Groq。作出选择前,必须用确切模型和真实工作负载进行基准测试。

已经以 Azure 为标准的企业,应在修改后的滥用监控获批、且可验证 ContentLogging:false 时使用 Microsoft Foundry。如果组织需要一份跨云通用的 ZDR 合同,而不是 Azure 专属控制体系,则应改选其他平台。

当模型选择、故障回退和提供商多样性都是硬性要求时,可以使用 OpenRouter;但不要把它当作隐私捷径。每个插件、工具和剩余的提供商端点仍需审批。

当 Mistral 模型适合任务,且企业能够自建智能体状态时,可使用 Mistral 的无状态 API。严格 ZDR 场景不要选择托管 Agents 产品。

严格 ZDR 场景应避开的选择

除非组织正式接受 30 天留存,否则应避开 Claude Fable 5 和 Claude Mythos 5。除非账户获得特定 ZDR 资格,否则这项排除同样适用于第一方 API 和云市场中的相关模型。

如果工作流要求明确写着零数据保留,应避开 Mistral Agents。Mistral 的无状态 API 可以符合条件,但其托管 Agents 产品不行。

严格路径应避开 Google Search grounding 和 Google Maps grounding。Search 存在无法关闭的最长 3 天留存,Maps 会将相关内容存储 30 天。如果 Web Grounding for Enterprise 符合用例与合同,应改用它。

应避开会默认存储的对话设置。Fireworks Responses 的默认值为 store=True,Google Interactions 的 store 同样默认为 true。生产策略应明确设置隐私行为,并拒绝缺少该设置的部署。

未另行批准留存前,应避开有状态便捷端点。其中包括 OpenAI Conversations、Assistants、Threads、Files、Vector Stores 和 Batch;Anthropic Managed Agents、Batch、Files、代码执行和 MCP Connector;Groq Batch 与微调状态;Microsoft Responses 历史、Assistants Threads、Files 和 Batch;以及 Mistral Conversations、Libraries、Files 和 Batch。

应避开只审查网关的隐私方案。OpenRouter 可以阻止推理路由进入非 ZDR 端点,却无法治理在模型调用后接收内容的网页搜索插件、MCP 服务器、CRM、浏览器、分析工具或数据库。

周一就做:运行一次留存演练

不要一开始就发起九家厂商的采购评估。周一先选一条敏感工作流,证明它的边界。

  1. 选择一条记录

    创建一条与智能体将处理的敏感数据相似的合成记录。加入唯一的金丝雀字符串,确保每一份副本都可以被搜索到。

  2. 画出每一跳

    列出客户端、网关、模型端点、缓存、记忆数据库、文件存储、可观测系统、工具和人工审查路径,并为每一项标注负责人和留存规则。

  3. 启用严格控制

    在组织或项目层级开启平台的 ZDR 或无状态配置。即使厂商表示 ZDR 会覆盖请求设置,也要明确配置请求存储标志。

  4. 故意破坏工作流

    调用一项不兼容功能。有效的控制应将其拦截、禁用或触发警报。如果调用成功并存储了金丝雀,架构就还需要另一层策略执行。

  5. 搜索、删除并签字

    在每个获批系统中搜索金丝雀,运行删除流程,保存证据,并由安全团队和产品负责人在架构图上签字。每当模型、工具或智能体功能变化后,都要重复演练。

最终产物不是一份 40 页的策略,而是一张请求路径图、一套证据包和一个决定:保留工作流、更换功能,或更换提供商。这样,ZDR 才会成为日常运行的控制,而不只是采购文案中的形容词。

常见问题

哪种 AI 智能体平台最适合企业?

对于需要前沿能力的大多数企业,OpenAI API 是最佳 ZDR 模型平台;如果留存策略必须在整个 AWS 组织内失败即关闭,Amazon Bedrock 更合适。已有 Google Cloud 技术栈的企业则最适合 Google Gemini Enterprise Agent Platform。一旦所需的记忆、文件、搜索或托管智能体功能不在 ZDR 范围内,最佳选择也会随之改变。

2026 年最好的 AI 智能体是什么?

没有一个智能体可以在所有企业工作流中都称为最佳。对于严格 ZDR,应围绕受支持的无状态模型端点构建智能体,并把持久状态留在客户控制的系统内。前沿 ZDR 首选 OpenAI,策略执行首选 Bedrock,开放模型推理首选 Fireworks 或 Groq。

2026 年企业 AI 有哪些关键趋势?

一个重要趋势是模型访问与状态所有权分离。前沿模型的留存规则开始直接影响模型资格;与此同时,为了保护敏感智能体工作流,企业越来越需要自行掌控记忆、文件、追踪和工具治理。

2026 年最好的 AI 平台是什么?

对于通用企业 AI 项目,最佳平台应匹配公司的云控制、模型要求、数据边界和运营团队。若需求收窄到 ZDR,OpenAI API、Amazon Bedrock 和 Google Gemini Enterprise Agent Platform 是领先选择,但三者在能力覆盖和策略执行上各有取舍。

想用一页图快速匹配 AI 工具、业务工作流和风险?可通过邮件通讯获取 AI Tools Map for Business Owners

最近更新

2026年9月2日

分类AI

在 Google 中优先显示本站

将 omidsaffari.com 添加为 Google 搜索的优先来源

把 omidsaffari.com 设为优先来源,Google 会在 Top Stories、AI Overviews 和 AI Mode 中为您优先展示。

更多 AI 文章

查看全部 AI 文章
订阅通讯

每周日,一封信。 写运转中的系统,不写热评。

来自一组 AI 项目组合运营的构建日志、生产系统与一线笔记。

每周一期。无垃圾邮件。随时退订。