2026 年最佳 AI 沙箱安全工具:7 款产品深度对比
2026 年 AI 沙箱怎么选?本文对比 Vercel、Docker、Cloudflare、E2B、Daytona、Northflank 与 Modal 的隔离机制、密钥保护、出站控制和真实成本,结合 10,000 次运行的统一模型,帮你为本地编码 Agent、云端任务与 GPU 工作负载找到更安全、更合适的执行环境。

Vercel Sandbox 是 2026 年大多数云端智能体团队最稳妥的 AI 沙箱选择。不过,真正拉开差距的并不是价格:按本文统一的工作负载计算,各托管方案每月成本介于 $55.55 和 $288 之间。上线时最该确认的是,模型生成的代码是否同时拥有独立的执行内核,以及一条绝不会暴露真实凭证的出站通道。
AI 沙箱工具速览
以下价格和产品限制均核验于 2026 年 8 月 19 日。这 7 款工具同时覆盖本地编码智能体与云端托管智能体,因为两类工作负载面对的风险与成本模型并不相同。
这个排序并非单纯从便宜到昂贵。Northflank 在模型测算中以 $55.55 成为成本最低的托管云方案,但 Vercel 仍然位居第一:Firecracker 隔离边界、运行时出站策略和凭证代理组合在一起,更适合希望快速发布智能体、又不想自行维护集群的产品团队。Docker 排名第二,是因为它以 $0 厂商费用提供了少见的完整本地隔离边界;但它并不是面向客户任务的托管运行时。
选择规则很简单:**在真正适配自身工作负载的前提下,选择能同时通过两道边界测试的最低成本工具。**第一道边界把不可信代码关在独立内核之后,或置于强度相当的系统调用隔离层中;第二道边界则让生产凭证和出站权限始终留在代码之外。把明文 API key 交给廉价 VM 的方案不合格;隔离做得很好、却允许随意访问公网的 VM 同样不合格。
这些 AI 安全沙箱是如何筛选的
OpenAI 目前对安全运营人员的建议是:高风险工作流不应接触敏感生产系统或开放互联网;要定期测试沙箱边界、监控智能体行为,并明确授权范围。其 Agents SDK 指南说得更直接:默认会出现提示词注入和数据外泄尝试,把编排层与计算层分离,并让生成代码的运行环境接触不到凭证。这些不是理论上的极端情况,而是实际运维要求。OpenAI 于 8 月 10 日发布了当前指南。
因此,本文用下面这套双边界测试评估每款产品:
- **执行边界:**每个恶意任务是否拥有独立内核、microVM、VM,或有明确文档说明的系统调用隔离?某个用户的进程或文件系统能否触达其他用户?
- **出站与凭证边界:**网络能否默认拒绝,只放行指定目标,并在流量离开沙箱后再注入凭证?
- **控制边界:**策略、日志、配额和身份是否位于模型可能重写的代码之外?
- **运维适配:**产品究竟面向本地、API 优先、边缘原生、GPU,还是完整平台?即使边界选对了,运维模式不匹配,产品最终也只会被闲置。
- **持续成本:**促销额度用完后,同一工作负载究竟要花多少钱?
这是一份带价格测算与架构分析的对比,并不声称做过渗透测试。所有价格、限制与能力都来自当时可访问的第一方页面。入选产品必须提供足够的第一方细节,让我们能判断隔离与出站两道边界,而且必须真正具备恶意代码隔离能力,而不只是普通开发环境。
统一测算采用每月 10,000 次运行。每次持续 5 分钟,申请 2 vCPU 和 4 GiB 内存;其中 CPU 活跃 1 分钟,余下 4 分钟由智能体等待文件、软件包或网络任务。这个差异很关键:Vercel 和 Cloudflare 对活跃 CPU 与已配置内存采用不同计费方式,而 E2B、Daytona、Northflank 和 Modal 会按整个运行时段收取计算费用。

现代智能体工作流有两个不同侧面。如果编码助手在笔记本电脑上运行,可以参考 Codex、Claude Code 与 Cursor 对比中的工作流;如果智能体负责操作浏览器,浏览器会话本身也成为边界的一部分,最佳 AI 智能体浏览器对比对此有详细说明。沙箱不能替代正确的智能体选型,能力再强的智能体也不能替代工具隔离。
1. Vercel Sandbox:云端智能体团队的综合首选
Vercel Sandbox 适合需要托管 API、强计算隔离,又不想让密钥进入生成代码的产品团队,是本次对比的综合首选。

每个沙箱都运行在 Firecracker microVM 中。内置环境支持 Node.js 22、24 和 26,以及 Python 3.13;自定义运行时则可使用 OCI 镜像。Pro 和 Enterprise 会话最长可运行 24 小时,Hobby 为 45 分钟;资源上限也从 Hobby 的 4 vCPU,提高到 Pro 的 8 和 Enterprise 的 32。内存固定为每个 vCPU 2 GB,因此本文 2-vCPU 的工作负载恰好获得 4 GB 内存。
真正的安全优势出现在 VM 启动之后。Vercel 的网络防火墙可以在进程运行期间调整策略,只在出站请求离开时注入凭证,还能把指定请求转发到自有代理。这样便可安全地分两阶段执行:安装依赖时放行软件包仓库,随后撤销宽泛访问权限,再让模型生成的代码仅能连接一小份目标清单。沙箱能拿到完成任务所需的工具,却不会同时继承访问 GitHub、模型 API 或对象存储的密钥。
这里的短板在配置,而不是隔离。Vercel 防火墙文档明确指出,默认策略是 allow-all,新建沙箱可以不受限地访问公网。Vercel 推荐的做法是:安装依赖时暂时开放访问,在不可信代码执行前切换到用户定义的允许列表。如果编排流程漏掉第二步,Firecracker 仍能保护宿主机,但沙箱可能把放入其中的任何数据发送出去。凭证代理能阻止沙箱直接复制明文密钥,却无法阻止生成代码在任务运行期间通过获准请求滥用这把密钥。
7 月 7 日上线的可观测性更新,让策略真正变成可执行的运维控制。团队可以跟踪活跃 CPU、已配置内存、数据传输、运行中的沙箱与会话,并按 Sandbox Name 和 Sandbox Session ID 聚合指标。Vercel 的所有套餐都包含 Sandbox 可观测性,Pro 和 Enterprise 还支持手动查询。这对预算管理很直接:给每类任务打标签、归属成本,并调查出站流量或存活时间偏离正常范围的会话。
**最适合:**Vercel 技术栈上的托管编码智能体、代码解释器、预览构建器和面向客户的执行任务。
**突出优势:**一款产品内同时提供 Firecracker、运行时出站策略、凭证代理和可选请求代理。
**价格:**Hobby 为 $0。Pro 为 $20/月,内含 $20 用量额度;超出后,Active CPU 每小时 $0.128,已配置内存每 GB-hour $0.0212,每 1 million 次创建 $0.60,网络每 GB $0.15,快照每 GB-month $0.08。Enterprise 定制定价。
**免费试用:**Hobby 包含 5 Active CPU hours、420 GB-hours 内存、5,000 次创建、20 GB 网络、10 个并发沙箱和 15 GB 快照存储;另有 Pro 试用。
- 每个沙箱都有独立的 Firecracker microVM。
- 凭证可在出站时注入,不必存入沙箱。
- 任务运行期间可以收紧网络策略。
- Pro 和 Enterprise 会话最长可达 24 小时。
- 活跃 CPU 计费适合 I/O 密集型智能体任务。
- 安全的初始化流程依赖于在不可信执行前撤销宽泛网络权限。
- 进入不可信阶段前,必须替换默认的 allow-all 出站策略。
- Hobby 用完内含额度后无法购买额外用量。
- 每个 vCPU 固定 2 GB 内存,内存密集型任务可能被迫额外购买 CPU。
Vercel 的安全部署流程
编写威胁模型
列清楚生成代码可以读取、写入、调用和暴露什么。默认把代码仓库凭证、生产数据库、云元数据和内部管理 API 排除在沙箱之外。
构建干净镜像
从内置运行时或 OCI 镜像开始,只保留任务必需的工具。客户数据与长期凭证都不要写入镜像或任何快照。
短暂开放初始化出站
只放行初始化所需的软件包仓库、代码源或制品库。若确实需要临时开放宽泛访问,应把策略切换写成明确的编排步骤,而不是口头约定。
关闭网络
在模型生成代码启动前,切换到指定目标并拒绝其他一切流量。如果稳定策略需要经过代理,就把高风险请求转发到自有代理。
逐项代理凭证
凭证只应针对获准的主机和请求形态注入。不要仅仅因为有 microVM 隔离,就把原始凭证复制进环境变量。
观测并销毁
流式收集日志,限制运行时长与资源,只保留真正需要的输出,随后销毁沙箱。定期执行测试,尝试访问被拦截的主机和还原被代理的密钥。
**结论:**如果既想减少基础设施决策,又不愿牺牲隔离强度,Vercel 是默认答案。只有当本地执行、自有云部署或 GPU 能力成为更硬的要求时,才应转向其他方案。
2. Docker Sandboxes:本地编码智能体首选
Docker Sandboxes 是本文最强的本地方案,因为它是真正独立的 microVM 产品,而不是给普通容器换了一个听起来安全的名字。

microVM 是最主要的信任边界。每个沙箱都有独立内核和自己的 Docker Engine,也不存在通往宿主 Docker daemon 的路径。出站 TCP 会经过宿主侧代理,并采用默认拒绝策略;直接对外的 UDP 和 ICMP 会被拦截;API 凭证还能注入 HTTP header,无须把原始值放入 VM。对于无人值守的 Codex、Claude Code、Copilot CLI、OpenCode 或 Kiro 会话,这是一套严肃可靠的本地架构。
厂商价格同样清楚:sbx CLI 为 $0,不按席位收费,也允许商业使用。统一的组织治理——包括托管网络、文件系统和 MCP 策略以及审计日志——需要另行购买订阅。实际计算成本转移到了笔记本电脑或工作站,因此合理的比较不是 Docker 的 $0 对 Northflank 的 $55.55,而是本地硬件与运维人力对托管服务。
薄弱点恰好位于本地工作与宿主机的交界处。Direct mode 会以读写方式挂载工作区,智能体因此可以修改 Git hooks、CI 配置、IDE tasks、Makefile targets、package scripts,以及开发者之后可能在 VM 外执行的其他文件。--clone 会把宿主代码库设为只读,并给智能体一份私有 clone,更适合未知代码库或自主运行。Docker 还提醒用户:默认允许列表中可能保留范围很大的 wildcard domains;如果不禁用,共享 agent skills 会成为跨沙箱的读写存储;本地 stdio MCP servers 则运行在宿主机,而不是 microVM 内。
Docker Sandboxes 0.38.0 于 8 月 6 日发布,带来 Kit spec v2、原生 MCP 管理、保留在宿主侧的 OAuth 凭证、组织级 Cedar 策略,以及每个沙箱可用的 --deny-network HOST 控制,同时修复了 CVE-2026-17106。这里真正重要的不是版本亮点,而是维护纪律:本地隔离软件必须强制定期更新;即使 MCP 接口刚被集中管理,任何离开 VM、通向宿主的桥接面仍然需要同等严格的信任审查。
因此,Docker Sandboxes 非常适合开发者工作站,却不适合作为即插即用的云端后端。它能隔离智能体大部分行为,但工作区、共享 skills 与宿主侧 MCP 集成仍是明确存在的桥梁,每一条都必须单独评估。
**最适合:**需要安装软件包、执行 Docker build 和无人值守运行,又不应广泛接触宿主机的本地编码智能体。
**突出优势:**microVM 隔离、默认拒绝的代理网络,以及宿主侧凭证注入,厂商费用为 $0。
**价格:**CLI 为 $0,不按席位收费;组织治理采用定制定价。
**免费试用:**核心 CLI 与隔离的本地沙箱均免费。
- 独立的 microVM 与内核,不是共享宿主内核的容器。
- 沙箱内有私有 Docker Engine,不存在访问宿主 daemon 的路径。
- 默认拒绝的出站策略与宿主侧凭证注入。
- 核心 CLI 不收厂商用量费或席位费。
- Clone mode 可让宿主代码库保持只读。
- 运行在本机,而不是面向客户的托管服务。
- Direct mode 会直接修改宿主工作树。
- 除非禁用,否则共享 skills 可能跨越沙箱边界。
- 本地 stdio MCP servers 在宿主机执行,需要单独建立信任。
**结论:**本地智能体应选择 Docker Sandboxes;高风险任务启用 clone mode,缩减宽泛网络规则,并把每个宿主侧 MCP server 都视为特权组件。在算清它所替代的硬件与运维成本前,不要直接拿它与托管 API 比价。
3. Cloudflare Sandbox SDK:策略原生的边缘侧首选
如果控制面本就运行在 Workers 上,而智能体需要一条受严格编程控制的公网路径,Cloudflare Sandbox SDK 最为合适。

Cloudflare Containers 会把每个沙箱放进独立 VM,提供文件系统、进程和网络隔离,并为每个沙箱设置资源配额。其安全页面对多租户边界说得很具体:同一沙箱中的进程共享文件、进程和 localhost 网络,因此每个用户应使用独立沙箱。这句话比笼统的“完全隔离”更有价值,因为架构师可以据此明确身份边界应该画在哪里。
第二道边界自然延伸自 Workers。默认允许访问公网,但将 enableInternet = false 后,除非 allowedHosts 或出站处理程序明确放行,否则一律拒绝。出站处理程序在沙箱外受信任的 Workers 运行时中运行,可以注入 Authorization 请求头,也能按沙箱实例限定凭证范围。沙箱永远拿不到真实令牌。关闭 Internet 后,非 HTTP 流量会被拒绝,DNS 也只能使用 Cloudflare 的服务器,从而堵住一条容易被利用的数据外泄路径。
两个明确的短板分别是暴露面与成熟度。Quick Tunnel 使用随机的 trycloudflare.com 主机名,却没有独立访问令牌;任何知道 URL 的人都能访问,因此敏感预览仍需应用层身份验证。8 月 13 日更新的概览页面建议新项目使用 @cloudflare/sandbox@next,并把 SDK 1.0 定义为预览版。对于影响范围受控的早期产品,这可以接受;但要求依赖项必须为稳定版的受监管采购方,可能需要等待,或固定当前稳定版软件包并接受功能较少的现实。
Cloudflare 的固定实例规格也会改变价格比较。统一任务申请 2 vCPU 和 4 GiB,但满足要求的最小实例是 standard-3,配置为 2 vCPU、8 GiB 和 16 GB 磁盘。平台内存单价虽低,这个示例中仍有一半已配置内存没有被使用。
**最适合:**基于 Workers 的智能体、边缘应用、浏览器终端、代码上下文,以及需要可编程出站策略的 HTTP 密集型负载。
**突出优势:**凭证和出站逻辑可放在沙箱外的 Workers 中,并按目标和实例限定范围。
**价格:**Workers Free 不包含 Containers 或 Sandbox SDK。Workers Paid 为 $5/月,内含 375 vCPU-minutes、25 GiB-hours 内存和 200 GB-hours disk。超出后,vCPU 每秒 $0.000020,GiB 内存每秒 $0.0000025,GB 磁盘每秒 $0.00000007。
**免费试用:**无专项 Sandbox 试用;Containers 需要 Workers Paid。
- 每个沙箱使用独立 VM,并有明确的“一用户一沙箱”指南。
- Workers 侧注入凭证,让令牌留在生成代码之外。
- 支持默认拒绝 Internet、主机允许列表、出站处理程序和受限 DNS。
- 活跃 CPU 计费与 scale-to-sleep 适合突发式智能体任务。
- 北美和欧洲出站费较低,为 $0.025/GB,并内含 1 TB。
- 主动关闭前,Internet 访问默认开放。
- Quick Tunnel 主机名不能替代身份验证。
- SDK 1.0 仍被定位为预览版。
- 固定实例规格可能迫使用户购买多余的内存和磁盘。
**结论:**如果 Workers 已是受信任控制层,HTTP 策略又是主要控制面,Cloudflare 就是最好的 Vercel 替代方案。务必先关闭 Internet 访问,为每条 tunnel 添加应用身份验证,并把固定实例规格纳入预算。
4. E2B:可移植智能体运行时的最佳 microVM API
对于希望使用独立于大型部署平台的智能体沙箱、并坚持 API 优先的团队,E2B 是本文最专注的 microVM 方案。

每个 E2B 沙箱都运行在 Firecracker microVM 中,拥有独立内核、内存与页缓存。独立内核很重要:即使某个沙箱内部出现内核漏洞,攻击者仍需逃逸 Firecracker 才能触达宿主。SDK v2.0.0 及更高版本还默认启用安全 controller 访问,controller 调用必须携带创建沙箱时返回的访问令牌。较早的自定义模板可能需要重新构建,才能适配这一安全姿态。
API 提供了必要的网络控制原语:allow_internet_access、allowOut、denyOut 和出站代理。将 Internet access 设为 false,相当于拒绝 0.0.0.0/0。当前创建请求会直接暴露这些控制项,但与 Vercel、Cloudflare、Daytona 或 Docker 相比,E2B 在本文引用的产品页面上并未提供同等一等公民式的凭证代理。如果生成代码需要生产令牌,应在 E2B 外部署受信任代理,由代理注入凭证,而不是通过沙箱环境变量传入。
当部署控制权是刚性要求时,E2B 更具吸引力。目前 Enterprise BYOC 支持 AWS 和 GCP;公司表示,模板、快照、运行时日志和敏感流量都会留在客户 VPC 内。反过来,如果采购方只想要价格低廉的 4 GiB 自定义实例,E2B 就没那么合适:定价页将自定义 CPU 与 RAM 放在 Pro,使用前需先支付 $150/月。
Hobby 很适合评估。它采用 $0 加用量费的模式,内含一次性 $100 用量额度,无需信用卡;会话最长 1 小时,并支持 20 个并发沙箱。Pro 将会话上限延长至 24 小时,并发提升至 100,还可付费扩展到 1,100。升级能提高限制,但不会产生每月循环的用量额度。
**最适合:**API 优先的智能体、代码解释器、评测工作负载,以及需要 AWS 或 GCP BYOC 的企业。
**突出优势:**每个沙箱都有独立 Firecracker 内核,并由简洁、专为智能体设计的 API 管理。
**价格:**Hobby 为 $0 加用量费。Pro 为 $150/月加用量费。Enterprise 为定制基础价格加用量费。CPU 每 vCPU-second $0.000014,即每 vCPU-hour $0.0504;内存每 GiB-second $0.0000045,即每 GiB-hour $0.0162。Hobby 包含 10 GiB 存储,Pro 包含 20 GiB。
**免费试用:**Hobby 提供一次性 $100 用量额度,无需信用卡。
- 每个沙箱都有独立内核、内存与页缓存的 Firecracker microVM。
- SDK v2.0.0 及更高版本默认启用安全 controller 访问。
- 提供清晰的允许、拒绝和禁用 Internet 网络控制。
- Pro 会话最长 24 小时,并发可付费扩展至 1,100。
- Enterprise 支持 AWS 与 GCP BYOC。
- 自定义 CPU 与 RAM 需求可能迫使用户选择 $150/月的 Pro 层级。
- 引用的公开第一方页面没有同等醒目的凭证代理原语。
- $100 额度是一次性的,而不是按月发放。
- BYOC 仅限 Enterprise,目前未列出 Azure。
**结论:**E2B 是本组最干净利落的独立 microVM API。若可移植性或 BYOC 比 Pro 基础费用更重要,就选它;同时应把受信任的外部凭证代理作为初始架构的一部分,而不是事后加固。
5. Daytona:凭证代理与灵活运行时的最佳组合
Daytona 提供了本组文档最清晰的凭证代理,还允许在高速默认容器与独立 Linux 或 Windows VM 之间选择。

它的密钥设计非常具体。Daytona 保存加密后的组织凭证,在沙箱里只放置不透明占位符,再由代理将真实值替换到出站 HTTPS 请求头中。代理只会向允许的主机发送凭证;若响应中回显密钥,还会在交给沙箱前清除。生成代码可以使用令牌,却永远无法读取它。
这一设计有一个危险的退出开关:若省略密钥的 hosts 字段,它就不受限制,代理可能为任何目标替换真实值。文档建议为每个密钥都配置允许列表。替换也仅适用于 HTTPS 请求头,不支持请求体、查询字符串、明文 HTTP,或经过 Base64-encoded Basic Auth 等转换后的值。如果某个服务商只接受请求体中的密钥,Daytona 的代理便无法保护这次调用。
网络控制包括域名和 CIDR 允许列表、完全阻断出站,以及上游代理。Tier 1 和 Tier 2 的组织级限制优先级更高,不能按沙箱放宽;Tier 3 与 Tier 4 默认允许完整 Internet 访问,恶意任务必须主动收紧。采购时真正该问的不是 Daytona 有没有允许列表,而是组织层级与沙箱配置叠加后,最终策略是否符合预期。
运行时选择是另一个决定性特性。Linux 容器是默认方案,启动很快。Daytona 还提供独立 Linux VM 与 Windows VM 类型,以及配备 H100、H200、RTX PRO 6000、RTX 5090 和 RTX 4090 的 GPU 沙箱。对可信构建任务而言,容器类型可能是更合适的速度取舍;面对恶意多租户代码,则应明确选择 VM 类型,不能因为产品名里有 sandbox 就默认它拥有最强边界。
**最适合:**需要调用外部 API、又不能读取凭证的智能体;混合 Linux 与 Windows 工作负载;以及 GPU 加速执行。
**突出优势:**在沙箱外完成占位符密钥替换、限定 HTTPS 主机注入和响应清洗。
**价格:**公共服务基础费用为 $0,按量付费。CPU 每 vCPU-hour $0.0504,内存每 GiB-hour $0.0162;超过首个 5 GiB 后,存储每 GiB-hour $0.000108。客户自管计算由销售主导。
**免费试用:**赠送 $200 计算额度,无需信用卡。
- 文档清晰的强凭证代理能力,并支持响应清洗。
- 支持域名、CIDR、block-all 和上游代理网络控制。
- 除默认容器外,还提供 Linux VM、Windows VM 和 GPU 类型。
- 按量付费方式简单,无持续平台费用。
- 当前 GPU 价格公开,从 RTX 4090 的 $0.99/hour 到 H200 的 $4.54/hour。
- 省略 hosts 会让密钥不受限制。
- 密钥替换仅适用于 HTTPS 请求头。
- 较高网络层级默认允许完整 Internet 访问。
- 最快的默认类型是 Linux 容器,需要主动选择 VM 才能获得更强隔离。
**结论:**如果安全交付密钥比创建沙箱更难,Daytona 是最佳选择。务必配置 hosts,对真正恶意的租户代码选择 VM,并把最终生效的组织网络层级纳入上线评审。
6. Northflank:BYOC 与平台控制首选
如果沙箱必须运行在自有云账号中,并与服务、数据库、任务和策略共用更完整的应用平台,Northflank 是最合适的选择。

Northflank 提供 Kata Container microVM 或 gVisor,以实现 VM 级工作负载隔离。当前基础设施页面表示,每个容器都有独立内核,并由命名空间、资源、存储和网络边界包围。服务网格在工作负载之间加入双向 TLS,项目级网络策略与私有网络则减少意外的跨项目访问。
它的部署面比本文所有 API 优先执行器都更广。Northflank 既可使用自有托管云,也能连接 AWS、GCP、Azure 或 Civo 账号;同时支持部署在本地、裸机或公有云上的客户 Kubernetes。对于启用 microVM 的 BYOC 节点池,工作负载默认获得 microVM 隔离。这非常适合数据驻留、既有云合同、私有服务访问,以及希望统一治理应用基础设施与沙箱基础设施的企业团队。
同样的广度也构成了它的短板。小型智能体产品未必真的需要集群、项目、服务网格、部署模板、数据库和平台控制平面。Northflank 即使给出本次对比中最低的资源估算,若组织里没有平台负责人,总体组织成本仍可能更高。正确的采购方本就需要 BYOC 或其周边平台;其他团队在为低单价庆祝前,应先把工程工时与 Vercel 或 E2B 对比。
免费 Sandbox 层级适合熟悉平台,包含 2 个免费服务、1 个免费数据库和 2 个免费 cron jobs。生产计算按秒计费:每 vCPU-hour $0.01667,每 GB-hour $0.00833。出站每 GB $0.06,SSD 存储每 GB-month $0.15。
**最适合:**BYOC、私有服务、数据驻留要求,以及希望用同一平台管理沙箱和应用基础设施的团队。
**突出优势:**在托管云或客户自有云部署中提供 Kata 或 gVisor 隔离。
**价格:**Sandbox 免费。按量付费从 $0/月起,vCPU 每小时 $0.01667,内存每 GB-hour $0.00833,出站每 GB $0.06,SSD 每 GB-month $0.15。Enterprise 定制定价。
**免费试用:**免费 Sandbox 层级包含 2 个服务、1 个数据库和 2 个 cron jobs。
- Kata microVM 或 gVisor 隔离,每个工作负载拥有内核边界。
- 支持托管云、主流公有云 BYOC,以及客户 Kubernetes 部署。
- 提供双向 TLS、网络策略、命名空间和私有网络。
- 公开且较低的资源单价,按秒计费。
- 应用服务与沙箱工作负载可纳入同一个受治理平台。
- 比单一沙箱 API 更宽的控制面会带来更多运维工作。
- 较低的计算估算未包含集群开销与平台所有权成本。
- 小型智能体产品很容易购买并不需要的平台能力。
- 采购方必须确认所选节点池和运行时类型落实了预期的 microVM 策略。
**结论:**如果自有云部署或统一平台是硬性要求,Northflank 就是正确答案。但它并非两人产品团队理所当然的低价选择,因为最低的计量单价也可能带来最重的平台工作。
7. Modal:Python、ML 与 GPU 重型任务首选
如果生成代码与 Python、notebooks、model inference 或突发 GPU 工作紧密相连,Modal 是本文最合适的沙箱。

Modal Sandboxes 使用 gVisor,在沙箱工作负载与宿主内核之间拦截并限制系统调用。默认 Sandbox 既不能接受入站网络连接,也不能访问其他 Modal 资源。这限制了平台内部的影响范围,并使其成为数据分析和模型密集型任务的强执行原语。
其出站策略没有那么保守。Sandboxes 默认可以连接任何公网 IP。Modal 支持彻底阻断网络、CIDR 允许列表,以及用于 TLS 流量的 beta 域名允许列表,但这些控制都需要主动开启。运行期间调整策略还有初始化前提:若要稍后收紧域名或 CIDR 列表,创建沙箱时就必须启用相应的允许列表类型。block_network=True 无法通过相同的动态路径修改,所以只在初始化阶段开放网络的智能体必须预先设计好生命周期。
Modal 的经济优势来自周边 serverless ML 平台,而不是最低的沙箱计费。1 个物理核心相当于 2 vCPU,价格为每 core-second $0.00003942;内存每 GiB-second $0.00000667。Starter 为 $0 加计算费,每月包含 $30 额度、3 个工作区席位,以及 100 个容器和 10 个 GPU 的并发。Team 为 $250/月加计算费,每月返还 $100 额度,并提供不限量席位、5,000 个容器并发、50 个 GPU 并发、静态 IP 代理、环境预算、自定义域名和部署回滚。
如果同一平台还要承载模型、定时函数和 GPU 任务,Modal 很容易证明其价值;若只是普通代码解释器,核心要求是 microVM 隔离与凭证代理,它就较难成立。当前 Sandbox 安全页面记录了网络控制与平台隔离,却没有像 Daytona 或 Cloudflare 那样明确的外部密钥注入机制。
**最适合:**Python 智能体、notebook、数据分析、ML 流水线,以及 GPU 密集的生成代码工作。
**突出优势:**gVisor Sandboxes 与 Modal 的 serverless CPU 和 GPU 平台深度集成。
**价格:**Starter 为 $0 加计算费,每月含 $30 额度。Team 为 $250/月加计算费,每月含 $100 额度。Enterprise 定制定价。Sandbox CPU 每 physical core-second $0.00003942,其中 1 core 等于 2 vCPU;内存每 GiB-second $0.00000667。
**免费试用:**Starter 每月循环提供 $30 额度。
- gVisor 在运行时边界限制危险的系统调用。
- 默认 Sandbox 无法访问其他 Modal 资源,也不能接受入站连接。
- 支持 block-all、CIDR、beta 域名允许列表和运行时策略更新。
- 非常适合 Python、notebook、定时函数和 GPU 工作负载。
- Starter 每月循环提供 $30 额度。
- 默认允许访问公共网络。
- 域名允许列表仍为 beta。
- 动态策略变更要求在创建时已存在相应的允许列表类型。
- 模型测算的沙箱成本高于大多数托管替代方案。
**结论:**当沙箱只是 ML 或 GPU 系统的一部分时,Modal 胜出。若只需要一个恶意代码 API,Vercel、Cloudflare、E2B 或 Daytona 能给安全采购方更直接的路径。
月度账单究竟说明什么
托管方案最低估算为 $55.55,最高为 $288,每月相差 $232.45。规模扩大后,这笔差额值得关注;但与安排 1 名工程师维护内部执行器,或因生产令牌泄露引发 1 次安全事件相比,它仍然很小。对安全决策而言,团队不该为了省下每月低三位数金额,就接受明文密钥或开放出站。
这些只是对比估算,不是实际账单。Vercel 的总额假设 $20 Pro 基础费与内含的 $20 用量额度相抵。Cloudflare 必须分配 8-GiB、16-GB-disk 的 standard-3 实例,才能满足 2-vCPU 要求。E2B 因统一对比采用自定义 4-GiB 内存而计入 $150 Pro 套餐。Modal 则扣除了每月循环的 $30 Starter 额度。Daytona 的 $200 和 E2B 的 $100 都是一次性额度,因此不会降低稳定运行时的表格数字。
计费方式会颠倒排名。Vercel 与 Cloudflare 按活跃 CPU 计费,所以 I/O-bound 智能体等待时花得更少。如果 CPU 在完整 5 分钟内持续工作,Vercel 会从 $113.34 上升到 $284.01,Cloudflare 会从 $91.63 上升到 $187.63。编译密集型编码智能体应按繁忙场景建模;等待页面响应的浏览器智能体,可能更接近 CPU 活跃 1 分钟的假设。
在这个模型中,Vercel 与 Daytona 的实际盈亏平衡点是:5 分钟任务中 1.58 分钟的活跃 CPU 时间,也就是约 95 秒。低于该点,Vercel 的活跃 CPU 计费更划算;高于该点,在网络和存储费用之前,Daytona 的固定运行时费率更便宜。看似价格问题,实则取决于工作流:预算应依据智能体实际计算时长,而不是仅看 wall time。
更大的预算项是所有权。Northflank 的 $55.55 估算看起来非常亮眼,直到团队把集群、策略、部署模板、事件响应,以及真正懂这套系统的工程师纳入成本。E2B 的 $288 看似昂贵,但 BYOC 可能省去另建平台的投入。合理采购必须比较整体运维负担,而不只是 vCPU 单价。
不同团队该选哪款 AI 沙箱
如果需要最稳妥的托管默认方案,并且愿意在不可信阶段开始前收紧网络策略,选择 Vercel Sandbox。一旦 BYOC、本地执行或 GPU 能力成为硬性条件,决策就应从 Vercel 转向其他产品。
如果开发者要在本地运行 Codex、Claude Code、Copilot CLI、OpenCode 或 Kiro,选择 Docker Sandboxes。高风险代码库应启用 clone mode。当需求出现客户任务、高并发、集中式可用性或远程 API 时,则应改用托管工具。
如果 Workers 已经是受信任控制面,且大多数获准调用都走 HTTP,选择 Cloudflare Sandbox SDK。如果 pre-1.0 SDK 的成熟度或固定 Container 规格带来的风险大于收益,则应转向其他方案。
如果需要独立的 Firecracker API,或 AWS 与 GCP BYOC,选择 E2B。当自定义内存让 $150 Pro 基础费难以成立,或团队不想自行搭建外部凭证代理时,应放弃这一选择。
如果智能体必须使用自己无法读取的密钥调用外部服务,或希望一个 API 同时管理 Linux VM、Windows VM 与 GPU 类型,选择 Daytona。如果所有任务都只是简单 Linux microVM,而额外运行时选项没有价值,则应选择更专一的产品。
如果沙箱必须与私有服务并排部署在自有云账号中,选择 Northflank。若组织为了节省计算单价而不得不新建平台团队,这个决策便不成立。
如果执行层离不开 Python、notebook、模型推理、定时函数或 GPU,选择 Modal。如果任务只是执行恶意代码,安全导向更明确的 API 可以用更少策略工作完成任务,就应转向该方案。
如果还在沙箱之前选择智能体,可以阅读最佳 AI 编码助手对比。两项决策务必分开:助手决定工作如何生成;沙箱决定生成的工作可以触达什么。
这些方案应该避开
**安全文档止步于“已隔离”的执行器:**采购需要对内核边界、租户隔离、默认出站、凭证位置、日志与更新责任获得书面答案。如果厂商无法完整回答这 6 项,就不要把生产数据或密钥放进沙箱。
把普通 Docker Engine container 误当成 Docker Sandboxes:docker run 并不是 sbx microVM 产品,也不会继承后者的独立内核、宿主侧网络代理、凭证注入或 clone-mode 工作区边界。名称不能代表架构。
**为未知代码库使用 direct mode 的 Docker Sandboxes:**VM 能保护宿主机的大部分区域,但智能体会直接修改工作树。被改动的 Git hook 或 package script 之后可能在宿主机执行。使用 --clone,并检查所有离开 VM 的桥接面。
**没有应用身份验证的 Cloudflare quick tunnel:**随机 hostname 没有独立 access token。应把 URL 视为可被发现,并在暴露任何敏感预览前,为服务加入身份验证。
**未配置 hosts 的 Daytona 密钥:**省略该字段会让密钥不受限制。只有明确指定获准目标,代理才真正有价值。
**任何始终停留在 allow-all 的初始化阶段:**Vercel 清楚记录了正确模式——初始化时开放宽泛访问,随后在执行阶段收紧。如果策略从不收紧,microVM 虽能限制宿主机被攻破,却无法阻止代码把数据发送出去。

最后一点正是整个品类的分界线。隔离回答的是:“代码能否逃逸?”出站与凭证策略回答的是:“不逃逸时,代码又能做什么?”两种失守都可能带来同一个业务结果:生产数据流出公司。
周一就能执行的安全清单
周一不要先约厂商演示。第一步应是一页清单,列出模型生成代码的所有运行位置。
- **命名每条执行路径。**包括本地编码智能体、CI 任务、浏览器智能体、数据分析 notebook、代码解释器和客户预览构建器。
- **画出当前边界。**记录内核或运行时隔离、已挂载文件、可访问网络,以及沙箱能拿到的每项凭证。
- **把密钥移到外部。**将 API key 放入受信任编排器、Worker、宿主代理或厂商凭证代理。沙箱环境变量仍然能被代码读取。
- **让出站默认拒绝。**初始化时放行软件包主机,在生成代码启动前切换到最小目标清单。
- **执行两次故障演练。**先尝试读取其他租户的文件或进程,再尝试把预置 token 发往未经批准的主机。结果必须同时满足两点:操作被阻断,并留下可用日志。
- **指定负责人并设置上限。**必须有人审查策略变更、失败的边界测试、镜像、日志和支出。在流量增长前,为运行时长、并发数、CPU、内存和月度预算设置限制。
这页清单完成后,再决定是否采购。只有本地风险的团队,最终可能只需要 Docker Sandboxes 加 clone mode。Vercel 产品团队也许只需调整网络策略并启用凭证代理。受监管的平台则可能发现 Northflank 或 E2B BYOC 确有必要。周一的交付物是边界决策,而不是一份新订阅。
常见问题
哪款 AI 工具的安全性最好?
在本次对比中,Vercel Sandbox 是综合最强的托管选择,因为它同时提供 Firecracker microVM、运行时出站策略和凭证代理。本地编码智能体更适合 Docker Sandboxes;必须部署在自有云时,Northflank 或 E2B 才是更好的答案。最终胜者取决于所需的信任边界。
2026 年 AI 安全有哪些趋势?
真正落地的趋势包括独立内核、在 Guest 外注入凭证、默认拒绝出站,以及定期重复边界测试。OpenAI 8 月 10 日的指南明确给出运维要求:让高能力智能体远离生产系统与开放互联网,并监控它们尝试执行的操作。
2026 年有哪些免费的 AI 沙箱工具?
有。Docker Sandboxes CLI 为 $0,不按席位收费。Vercel 有额度受限的 Hobby 套餐,E2B 提供一次性 $100 额度,Daytona 提供 $200 计算额度,Northflank 有免费 Sandbox 层级,Modal 的 Starter 每月循环提供 $30 额度。Cloudflare Sandbox 则需要 $5/月的 Workers Paid 套餐。
什么是 AI 沙箱?
AI 沙箱是一种隔离执行环境,让智能体可以运行生成代码,却不会继承对宿主机、其他用户、生产系统、密钥或不受限网络路径的宽泛访问权限。生产级沙箱必须同时拥有执行边界,以及独立的出站与凭证边界。
下载 AI 业务工作流审计清单,把沙箱选型转化为有明确范围的工作流、负责人、控制清单与复查周期。
2026年9月3日







