2026 年最佳 AI 沙箱安全工具:7 款产品深度对比

2026 年 AI 沙箱怎么选?本文对比 Vercel、Docker、Cloudflare、E2B、Daytona、Northflank 与 Modal 的隔离机制、密钥保护、出站控制和真实成本,结合 10,000 次运行的统一模型,帮你为本地编码 Agent、云端任务与 GPU 工作负载找到更安全、更合适的执行环境。

Thursday, September 3, 2026Omid Saffari
2026 年最佳 AI 沙箱安全工具:7 款产品深度对比

Vercel Sandbox 是 2026 年大多数云端智能体团队最稳妥的 AI 沙箱选择。不过,真正拉开差距的并不是价格:按本文统一的工作负载计算,各托管方案每月成本介于 $55.55 和 $288 之间。上线时最该确认的是,模型生成的代码是否同时拥有独立的执行内核,以及一条绝不会暴露真实凭证的出站通道。

AI 沙箱工具速览

以下价格和产品限制均核验于 2026 年 8 月 19 日。这 7 款工具同时覆盖本地编码智能体与云端托管智能体,因为两类工作负载面对的风险与成本模型并不相同。

工具最适合起步价免费试用或额度
1. Vercel Sandbox托管云端场景的默认首选Hobby $0;Pro $20/月 + 用量费Hobby + Pro 试用
2. Docker Sandboxes本地编码智能体厂商费用 $0免费 CLI
3. Cloudflare Sandbox SDK边缘侧策略控制$5/月 + 用量费无专项试用
4. E2B可移植的 microVM API$0 + 用量费;Pro $150/月 + 用量费一次性 $100 额度
5. Daytona凭证代理与混合运行时按量付费$200 计算额度
6. NorthflankBYOC 与平台控制Sandbox $0;按量付费免费 Sandbox 层级
7. ModalPython、ML 与 GPU 工作负载$0 + 计算费每月 $30 额度

这个排序并非单纯从便宜到昂贵。Northflank 在模型测算中以 $55.55 成为成本最低的托管云方案,但 Vercel 仍然位居第一:Firecracker 隔离边界、运行时出站策略和凭证代理组合在一起,更适合希望快速发布智能体、又不想自行维护集群的产品团队。Docker 排名第二,是因为它以 $0 厂商费用提供了少见的完整本地隔离边界;但它并不是面向客户任务的托管运行时。

选择规则很简单:**在真正适配自身工作负载的前提下,选择能同时通过两道边界测试的最低成本工具。**第一道边界把不可信代码关在独立内核之后,或置于强度相当的系统调用隔离层中;第二道边界则让生产凭证和出站权限始终留在代码之外。把明文 API key 交给廉价 VM 的方案不合格;隔离做得很好、却允许随意访问公网的 VM 同样不合格。

这些 AI 安全沙箱是如何筛选的

OpenAI 目前对安全运营人员的建议是:高风险工作流不应接触敏感生产系统或开放互联网;要定期测试沙箱边界、监控智能体行为,并明确授权范围。其 Agents SDK 指南说得更直接:默认会出现提示词注入和数据外泄尝试,把编排层与计算层分离,并让生成代码的运行环境接触不到凭证。这些不是理论上的极端情况,而是实际运维要求。OpenAI 于 8 月 10 日发布了当前指南

因此,本文用下面这套双边界测试评估每款产品:

  1. **执行边界:**每个恶意任务是否拥有独立内核、microVM、VM,或有明确文档说明的系统调用隔离?某个用户的进程或文件系统能否触达其他用户?
  2. **出站与凭证边界:**网络能否默认拒绝,只放行指定目标,并在流量离开沙箱后再注入凭证?
  3. **控制边界:**策略、日志、配额和身份是否位于模型可能重写的代码之外?
  4. **运维适配:**产品究竟面向本地、API 优先、边缘原生、GPU,还是完整平台?即使边界选对了,运维模式不匹配,产品最终也只会被闲置。
  5. **持续成本:**促销额度用完后,同一工作负载究竟要花多少钱?

这是一份带价格测算与架构分析的对比,并不声称做过渗透测试。所有价格、限制与能力都来自当时可访问的第一方页面。入选产品必须提供足够的第一方细节,让我们能判断隔离与出站两道边界,而且必须真正具备恶意代码隔离能力,而不只是普通开发环境。

统一测算采用每月 10,000 次运行。每次持续 5 分钟,申请 2 vCPU 和 4 GiB 内存;其中 CPU 活跃 1 分钟,余下 4 分钟由智能体等待文件、软件包或网络任务。这个差异很关键:Vercel 和 Cloudflare 对活跃 CPU 与已配置内存采用不同计费方式,而 E2BDaytona、Northflank 和 Modal 会按整个运行时段收取计算费用。

按本地、边缘、自有云以及 ML 或 GPU 工作负载分流 AI 沙箱采购决策的流程图
先确定代码必须在哪里运行,再进行双边界测试。

现代智能体工作流有两个不同侧面。如果编码助手在笔记本电脑上运行,可以参考 Codex、Claude Code 与 Cursor 对比中的工作流;如果智能体负责操作浏览器,浏览器会话本身也成为边界的一部分,最佳 AI 智能体浏览器对比对此有详细说明。沙箱不能替代正确的智能体选型,能力再强的智能体也不能替代工具隔离。

1. Vercel Sandbox:云端智能体团队的综合首选

Vercel Sandbox 适合需要托管 API、强计算隔离,又不想让密钥进入生成代码的产品团队,是本次对比的综合首选。

Vercel Sandbox 产品页展示如何隔离执行 AI 生成的代码
Vercel Sandbox

每个沙箱都运行在 Firecracker microVM 中。内置环境支持 Node.js 22、24 和 26,以及 Python 3.13;自定义运行时则可使用 OCI 镜像。Pro 和 Enterprise 会话最长可运行 24 小时,Hobby 为 45 分钟;资源上限也从 Hobby 的 4 vCPU,提高到 Pro 的 8 和 Enterprise 的 32。内存固定为每个 vCPU 2 GB,因此本文 2-vCPU 的工作负载恰好获得 4 GB 内存。

真正的安全优势出现在 VM 启动之后。Vercel 的网络防火墙可以在进程运行期间调整策略,只在出站请求离开时注入凭证,还能把指定请求转发到自有代理。这样便可安全地分两阶段执行:安装依赖时放行软件包仓库,随后撤销宽泛访问权限,再让模型生成的代码仅能连接一小份目标清单。沙箱能拿到完成任务所需的工具,却不会同时继承访问 GitHub、模型 API 或对象存储的密钥。

这里的短板在配置,而不是隔离。Vercel 防火墙文档明确指出,默认策略是 allow-all,新建沙箱可以不受限地访问公网。Vercel 推荐的做法是:安装依赖时暂时开放访问,在不可信代码执行前切换到用户定义的允许列表。如果编排流程漏掉第二步,Firecracker 仍能保护宿主机,但沙箱可能把放入其中的任何数据发送出去。凭证代理能阻止沙箱直接复制明文密钥,却无法阻止生成代码在任务运行期间通过获准请求滥用这把密钥。

7 月 7 日上线的可观测性更新,让策略真正变成可执行的运维控制。团队可以跟踪活跃 CPU、已配置内存、数据传输、运行中的沙箱与会话,并按 Sandbox Name 和 Sandbox Session ID 聚合指标。Vercel 的所有套餐都包含 Sandbox 可观测性,Pro 和 Enterprise 还支持手动查询。这对预算管理很直接:给每类任务打标签、归属成本,并调查出站流量或存活时间偏离正常范围的会话。

**最适合:**Vercel 技术栈上的托管编码智能体、代码解释器、预览构建器和面向客户的执行任务。
**突出优势:**一款产品内同时提供 Firecracker、运行时出站策略、凭证代理和可选请求代理。
**价格:**Hobby 为 $0。Pro 为 $20/月,内含 $20 用量额度;超出后,Active CPU 每小时 $0.128,已配置内存每 GB-hour $0.0212,每 1 million 次创建 $0.60,网络每 GB $0.15,快照每 GB-month $0.08。Enterprise 定制定价。
**免费试用:**Hobby 包含 5 Active CPU hours、420 GB-hours 内存、5,000 次创建、20 GB 网络、10 个并发沙箱和 15 GB 快照存储;另有 Pro 试用。

优势
做得好的地方
9 points

  • 每个沙箱都有独立的 Firecracker microVM。
  • 凭证可在出站时注入,不必存入沙箱。
  • 任务运行期间可以收紧网络策略。
  • Pro 和 Enterprise 会话最长可达 24 小时。
  • 活跃 CPU 计费适合 I/O 密集型智能体任务。
  • 安全的初始化流程依赖于在不可信执行前撤销宽泛网络权限。
  • 进入不可信阶段前,必须替换默认的 allow-all 出站策略。
  • Hobby 用完内含额度后无法购买额外用量。
  • 每个 vCPU 固定 2 GB 内存,内存密集型任务可能被迫额外购买 CPU。

Vercel 的安全部署流程

  1. 编写威胁模型

    列清楚生成代码可以读取、写入、调用和暴露什么。默认把代码仓库凭证、生产数据库、云元数据和内部管理 API 排除在沙箱之外。

  2. 构建干净镜像

    从内置运行时或 OCI 镜像开始,只保留任务必需的工具。客户数据与长期凭证都不要写入镜像或任何快照。

  3. 短暂开放初始化出站

    只放行初始化所需的软件包仓库、代码源或制品库。若确实需要临时开放宽泛访问,应把策略切换写成明确的编排步骤,而不是口头约定。

  4. 关闭网络

    在模型生成代码启动前,切换到指定目标并拒绝其他一切流量。如果稳定策略需要经过代理,就把高风险请求转发到自有代理。

  5. 逐项代理凭证

    凭证只应针对获准的主机和请求形态注入。不要仅仅因为有 microVM 隔离,就把原始凭证复制进环境变量。

  6. 观测并销毁

    流式收集日志,限制运行时长与资源,只保留真正需要的输出,随后销毁沙箱。定期执行测试,尝试访问被拦截的主机和还原被代理的密钥。

**结论:**如果既想减少基础设施决策,又不愿牺牲隔离强度,Vercel 是默认答案。只有当本地执行、自有云部署或 GPU 能力成为更硬的要求时,才应转向其他方案。

2. Docker Sandboxes:本地编码智能体首选

Docker Sandboxes 是本文最强的本地方案,因为它是真正独立的 microVM 产品,而不是给普通容器换了一个听起来安全的名字。

Docker Sandboxes 产品页展示在本地 microVM 中运行编码智能体
Docker Sandboxes

microVM 是最主要的信任边界。每个沙箱都有独立内核和自己的 Docker Engine,也不存在通往宿主 Docker daemon 的路径。出站 TCP 会经过宿主侧代理,并采用默认拒绝策略;直接对外的 UDP 和 ICMP 会被拦截;API 凭证还能注入 HTTP header,无须把原始值放入 VM。对于无人值守的 Codex、Claude Code、Copilot CLI、OpenCode 或 Kiro 会话,这是一套严肃可靠的本地架构。

厂商价格同样清楚:sbx CLI 为 $0,不按席位收费,也允许商业使用。统一的组织治理——包括托管网络、文件系统和 MCP 策略以及审计日志——需要另行购买订阅。实际计算成本转移到了笔记本电脑或工作站,因此合理的比较不是 Docker 的 $0 对 Northflank 的 $55.55,而是本地硬件与运维人力对托管服务。

薄弱点恰好位于本地工作与宿主机的交界处。Direct mode 会以读写方式挂载工作区,智能体因此可以修改 Git hooks、CI 配置、IDE tasks、Makefile targets、package scripts,以及开发者之后可能在 VM 外执行的其他文件。--clone 会把宿主代码库设为只读,并给智能体一份私有 clone,更适合未知代码库或自主运行。Docker 还提醒用户:默认允许列表中可能保留范围很大的 wildcard domains;如果不禁用,共享 agent skills 会成为跨沙箱的读写存储;本地 stdio MCP servers 则运行在宿主机,而不是 microVM 内。

Docker Sandboxes 0.38.0 于 8 月 6 日发布,带来 Kit spec v2、原生 MCP 管理、保留在宿主侧的 OAuth 凭证、组织级 Cedar 策略,以及每个沙箱可用的 --deny-network HOST 控制,同时修复了 CVE-2026-17106。这里真正重要的不是版本亮点,而是维护纪律:本地隔离软件必须强制定期更新;即使 MCP 接口刚被集中管理,任何离开 VM、通向宿主的桥接面仍然需要同等严格的信任审查。

因此,Docker Sandboxes 非常适合开发者工作站,却不适合作为即插即用的云端后端。它能隔离智能体大部分行为,但工作区、共享 skills 与宿主侧 MCP 集成仍是明确存在的桥梁,每一条都必须单独评估。

**最适合:**需要安装软件包、执行 Docker build 和无人值守运行,又不应广泛接触宿主机的本地编码智能体。
**突出优势:**microVM 隔离、默认拒绝的代理网络,以及宿主侧凭证注入,厂商费用为 $0。
**价格:**CLI 为 $0,不按席位收费;组织治理采用定制定价。
**免费试用:**核心 CLI 与隔离的本地沙箱均免费。

优势
做得好的地方
9 points

  • 独立的 microVM 与内核,不是共享宿主内核的容器。
  • 沙箱内有私有 Docker Engine,不存在访问宿主 daemon 的路径。
  • 默认拒绝的出站策略与宿主侧凭证注入。
  • 核心 CLI 不收厂商用量费或席位费。
  • Clone mode 可让宿主代码库保持只读。
  • 运行在本机,而不是面向客户的托管服务。
  • Direct mode 会直接修改宿主工作树。
  • 除非禁用,否则共享 skills 可能跨越沙箱边界。
  • 本地 stdio MCP servers 在宿主机执行,需要单独建立信任。

**结论:**本地智能体应选择 Docker Sandboxes;高风险任务启用 clone mode,缩减宽泛网络规则,并把每个宿主侧 MCP server 都视为特权组件。在算清它所替代的硬件与运维成本前,不要直接拿它与托管 API 比价。

3. Cloudflare Sandbox SDK:策略原生的边缘侧首选

如果控制面本就运行在 Workers 上,而智能体需要一条受严格编程控制的公网路径,Cloudflare Sandbox SDK 最为合适。

Cloudflare Sandbox SDK 文档展示如何从 Workers 隔离执行代码
Cloudflare Sandbox SDK

Cloudflare Containers 会把每个沙箱放进独立 VM,提供文件系统、进程和网络隔离,并为每个沙箱设置资源配额。其安全页面对多租户边界说得很具体:同一沙箱中的进程共享文件、进程和 localhost 网络,因此每个用户应使用独立沙箱。这句话比笼统的“完全隔离”更有价值,因为架构师可以据此明确身份边界应该画在哪里。

第二道边界自然延伸自 Workers。默认允许访问公网,但将 enableInternet = false 后,除非 allowedHosts 或出站处理程序明确放行,否则一律拒绝。出站处理程序在沙箱外受信任的 Workers 运行时中运行,可以注入 Authorization 请求头,也能按沙箱实例限定凭证范围。沙箱永远拿不到真实令牌。关闭 Internet 后,非 HTTP 流量会被拒绝,DNS 也只能使用 Cloudflare 的服务器,从而堵住一条容易被利用的数据外泄路径。

两个明确的短板分别是暴露面与成熟度。Quick Tunnel 使用随机的 trycloudflare.com 主机名,却没有独立访问令牌;任何知道 URL 的人都能访问,因此敏感预览仍需应用层身份验证。8 月 13 日更新的概览页面建议新项目使用 @cloudflare/sandbox@next,并把 SDK 1.0 定义为预览版。对于影响范围受控的早期产品,这可以接受;但要求依赖项必须为稳定版的受监管采购方,可能需要等待,或固定当前稳定版软件包并接受功能较少的现实。

Cloudflare 的固定实例规格也会改变价格比较。统一任务申请 2 vCPU 和 4 GiB,但满足要求的最小实例是 standard-3,配置为 2 vCPU、8 GiB 和 16 GB 磁盘。平台内存单价虽低,这个示例中仍有一半已配置内存没有被使用。

**最适合:**基于 Workers 的智能体、边缘应用、浏览器终端、代码上下文,以及需要可编程出站策略的 HTTP 密集型负载。
**突出优势:**凭证和出站逻辑可放在沙箱外的 Workers 中,并按目标和实例限定范围。
**价格:**Workers Free 不包含 Containers 或 Sandbox SDK。Workers Paid 为 $5/月,内含 375 vCPU-minutes、25 GiB-hours 内存和 200 GB-hours disk。超出后,vCPU 每秒 $0.000020,GiB 内存每秒 $0.0000025,GB 磁盘每秒 $0.00000007。
**免费试用:**无专项 Sandbox 试用;Containers 需要 Workers Paid。

优势
做得好的地方
9 points

  • 每个沙箱使用独立 VM,并有明确的“一用户一沙箱”指南。
  • Workers 侧注入凭证,让令牌留在生成代码之外。
  • 支持默认拒绝 Internet、主机允许列表、出站处理程序和受限 DNS。
  • 活跃 CPU 计费与 scale-to-sleep 适合突发式智能体任务。
  • 北美和欧洲出站费较低,为 $0.025/GB,并内含 1 TB。
  • 主动关闭前,Internet 访问默认开放。
  • Quick Tunnel 主机名不能替代身份验证。
  • SDK 1.0 仍被定位为预览版。
  • 固定实例规格可能迫使用户购买多余的内存和磁盘。

**结论:**如果 Workers 已是受信任控制层,HTTP 策略又是主要控制面,Cloudflare 就是最好的 Vercel 替代方案。务必先关闭 Internet 访问,为每条 tunnel 添加应用身份验证,并把固定实例规格纳入预算。

4. E2B:可移植智能体运行时的最佳 microVM API

对于希望使用独立于大型部署平台的智能体沙箱、并坚持 API 优先的团队,E2B 是本文最专注的 microVM 方案。

E2B 首页展示面向 AI 智能体的安全云沙箱
E2B

每个 E2B 沙箱都运行在 Firecracker microVM 中,拥有独立内核、内存与页缓存。独立内核很重要:即使某个沙箱内部出现内核漏洞,攻击者仍需逃逸 Firecracker 才能触达宿主。SDK v2.0.0 及更高版本还默认启用安全 controller 访问,controller 调用必须携带创建沙箱时返回的访问令牌。较早的自定义模板可能需要重新构建,才能适配这一安全姿态。

API 提供了必要的网络控制原语:allow_internet_accessallowOutdenyOut 和出站代理。将 Internet access 设为 false,相当于拒绝 0.0.0.0/0。当前创建请求会直接暴露这些控制项,但与 Vercel、Cloudflare、Daytona 或 Docker 相比,E2B 在本文引用的产品页面上并未提供同等一等公民式的凭证代理。如果生成代码需要生产令牌,应在 E2B 外部署受信任代理,由代理注入凭证,而不是通过沙箱环境变量传入。

当部署控制权是刚性要求时,E2B 更具吸引力。目前 Enterprise BYOC 支持 AWS 和 GCP;公司表示,模板、快照、运行时日志和敏感流量都会留在客户 VPC 内。反过来,如果采购方只想要价格低廉的 4 GiB 自定义实例,E2B 就没那么合适:定价页将自定义 CPU 与 RAM 放在 Pro,使用前需先支付 $150/月。

Hobby 很适合评估。它采用 $0 加用量费的模式,内含一次性 $100 用量额度,无需信用卡;会话最长 1 小时,并支持 20 个并发沙箱。Pro 将会话上限延长至 24 小时,并发提升至 100,还可付费扩展到 1,100。升级能提高限制,但不会产生每月循环的用量额度。

**最适合:**API 优先的智能体、代码解释器、评测工作负载,以及需要 AWS 或 GCP BYOC 的企业。
**突出优势:**每个沙箱都有独立 Firecracker 内核,并由简洁、专为智能体设计的 API 管理。
**价格:**Hobby 为 $0 加用量费。Pro 为 $150/月加用量费。Enterprise 为定制基础价格加用量费。CPU 每 vCPU-second $0.000014,即每 vCPU-hour $0.0504;内存每 GiB-second $0.0000045,即每 GiB-hour $0.0162。Hobby 包含 10 GiB 存储,Pro 包含 20 GiB。
**免费试用:**Hobby 提供一次性 $100 用量额度,无需信用卡。

优势
做得好的地方
9 points

  • 每个沙箱都有独立内核、内存与页缓存的 Firecracker microVM。
  • SDK v2.0.0 及更高版本默认启用安全 controller 访问。
  • 提供清晰的允许、拒绝和禁用 Internet 网络控制。
  • Pro 会话最长 24 小时,并发可付费扩展至 1,100。
  • Enterprise 支持 AWS 与 GCP BYOC。
  • 自定义 CPU 与 RAM 需求可能迫使用户选择 $150/月的 Pro 层级。
  • 引用的公开第一方页面没有同等醒目的凭证代理原语。
  • $100 额度是一次性的,而不是按月发放。
  • BYOC 仅限 Enterprise,目前未列出 Azure。

**结论:**E2B 是本组最干净利落的独立 microVM API。若可移植性或 BYOC 比 Pro 基础费用更重要,就选它;同时应把受信任的外部凭证代理作为初始架构的一部分,而不是事后加固。

5. Daytona:凭证代理与灵活运行时的最佳组合

Daytona 提供了本组文档最清晰的凭证代理,还允许在高速默认容器与独立 Linux 或 Windows VM 之间选择。

Daytona 首页展示面向 AI 智能体的安全沙箱
Daytona

它的密钥设计非常具体。Daytona 保存加密后的组织凭证,在沙箱里只放置不透明占位符,再由代理将真实值替换到出站 HTTPS 请求头中。代理只会向允许的主机发送凭证;若响应中回显密钥,还会在交给沙箱前清除。生成代码可以使用令牌,却永远无法读取它。

这一设计有一个危险的退出开关:若省略密钥的 hosts 字段,它就不受限制,代理可能为任何目标替换真实值。文档建议为每个密钥都配置允许列表。替换也仅适用于 HTTPS 请求头,不支持请求体、查询字符串、明文 HTTP,或经过 Base64-encoded Basic Auth 等转换后的值。如果某个服务商只接受请求体中的密钥,Daytona 的代理便无法保护这次调用。

网络控制包括域名和 CIDR 允许列表、完全阻断出站,以及上游代理。Tier 1 和 Tier 2 的组织级限制优先级更高,不能按沙箱放宽;Tier 3 与 Tier 4 默认允许完整 Internet 访问,恶意任务必须主动收紧。采购时真正该问的不是 Daytona 有没有允许列表,而是组织层级与沙箱配置叠加后,最终策略是否符合预期。

运行时选择是另一个决定性特性。Linux 容器是默认方案,启动很快。Daytona 还提供独立 Linux VM 与 Windows VM 类型,以及配备 H100、H200、RTX PRO 6000、RTX 5090 和 RTX 4090 的 GPU 沙箱。对可信构建任务而言,容器类型可能是更合适的速度取舍;面对恶意多租户代码,则应明确选择 VM 类型,不能因为产品名里有 sandbox 就默认它拥有最强边界。

**最适合:**需要调用外部 API、又不能读取凭证的智能体;混合 Linux 与 Windows 工作负载;以及 GPU 加速执行。
**突出优势:**在沙箱外完成占位符密钥替换、限定 HTTPS 主机注入和响应清洗。
**价格:**公共服务基础费用为 $0,按量付费。CPU 每 vCPU-hour $0.0504,内存每 GiB-hour $0.0162;超过首个 5 GiB 后,存储每 GiB-hour $0.000108。客户自管计算由销售主导。
**免费试用:**赠送 $200 计算额度,无需信用卡。

优势
做得好的地方
9 points

  • 文档清晰的强凭证代理能力,并支持响应清洗。
  • 支持域名、CIDR、block-all 和上游代理网络控制。
  • 除默认容器外,还提供 Linux VM、Windows VM 和 GPU 类型。
  • 按量付费方式简单,无持续平台费用。
  • 当前 GPU 价格公开,从 RTX 4090 的 $0.99/hour 到 H200 的 $4.54/hour。
  • 省略 hosts 会让密钥不受限制。
  • 密钥替换仅适用于 HTTPS 请求头。
  • 较高网络层级默认允许完整 Internet 访问。
  • 最快的默认类型是 Linux 容器,需要主动选择 VM 才能获得更强隔离。

**结论:**如果安全交付密钥比创建沙箱更难,Daytona 是最佳选择。务必配置 hosts,对真正恶意的租户代码选择 VM,并把最终生效的组织网络层级纳入上线评审。

6. Northflank:BYOC 与平台控制首选

如果沙箱必须运行在自有云账号中,并与服务、数据库、任务和策略共用更完整的应用平台,Northflank 是最合适的选择。

Northflank Sandboxes 产品页展示隔离工作负载与自带云能力
Northflank

Northflank 提供 Kata Container microVM 或 gVisor,以实现 VM 级工作负载隔离。当前基础设施页面表示,每个容器都有独立内核,并由命名空间、资源、存储和网络边界包围。服务网格在工作负载之间加入双向 TLS,项目级网络策略与私有网络则减少意外的跨项目访问。

它的部署面比本文所有 API 优先执行器都更广。Northflank 既可使用自有托管云,也能连接 AWS、GCP、Azure 或 Civo 账号;同时支持部署在本地、裸机或公有云上的客户 Kubernetes。对于启用 microVM 的 BYOC 节点池,工作负载默认获得 microVM 隔离。这非常适合数据驻留、既有云合同、私有服务访问,以及希望统一治理应用基础设施与沙箱基础设施的企业团队。

同样的广度也构成了它的短板。小型智能体产品未必真的需要集群、项目、服务网格、部署模板、数据库和平台控制平面。Northflank 即使给出本次对比中最低的资源估算,若组织里没有平台负责人,总体组织成本仍可能更高。正确的采购方本就需要 BYOC 或其周边平台;其他团队在为低单价庆祝前,应先把工程工时与 Vercel 或 E2B 对比。

免费 Sandbox 层级适合熟悉平台,包含 2 个免费服务、1 个免费数据库和 2 个免费 cron jobs。生产计算按秒计费:每 vCPU-hour $0.01667,每 GB-hour $0.00833。出站每 GB $0.06,SSD 存储每 GB-month $0.15。

**最适合:**BYOC、私有服务、数据驻留要求,以及希望用同一平台管理沙箱和应用基础设施的团队。
**突出优势:**在托管云或客户自有云部署中提供 Kata 或 gVisor 隔离。
**价格:**Sandbox 免费。按量付费从 $0/月起,vCPU 每小时 $0.01667,内存每 GB-hour $0.00833,出站每 GB $0.06,SSD 每 GB-month $0.15。Enterprise 定制定价。
**免费试用:**免费 Sandbox 层级包含 2 个服务、1 个数据库和 2 个 cron jobs。

优势
做得好的地方
9 points

  • Kata microVM 或 gVisor 隔离,每个工作负载拥有内核边界。
  • 支持托管云、主流公有云 BYOC,以及客户 Kubernetes 部署。
  • 提供双向 TLS、网络策略、命名空间和私有网络。
  • 公开且较低的资源单价,按秒计费。
  • 应用服务与沙箱工作负载可纳入同一个受治理平台。
  • 比单一沙箱 API 更宽的控制面会带来更多运维工作。
  • 较低的计算估算未包含集群开销与平台所有权成本。
  • 小型智能体产品很容易购买并不需要的平台能力。
  • 采购方必须确认所选节点池和运行时类型落实了预期的 microVM 策略。

**结论:**如果自有云部署或统一平台是硬性要求,Northflank 就是正确答案。但它并非两人产品团队理所当然的低价选择,因为最低的计量单价也可能带来最重的平台工作。

7. Modal:Python、ML 与 GPU 重型任务首选

如果生成代码与 Python、notebooks、model inference 或突发 GPU 工作紧密相连,Modal 是本文最合适的沙箱。

Modal Sandboxes 产品页展示 Python、GPU 和沙箱工作负载
Modal

Modal Sandboxes 使用 gVisor,在沙箱工作负载与宿主内核之间拦截并限制系统调用。默认 Sandbox 既不能接受入站网络连接,也不能访问其他 Modal 资源。这限制了平台内部的影响范围,并使其成为数据分析和模型密集型任务的强执行原语。

其出站策略没有那么保守。Sandboxes 默认可以连接任何公网 IP。Modal 支持彻底阻断网络、CIDR 允许列表,以及用于 TLS 流量的 beta 域名允许列表,但这些控制都需要主动开启。运行期间调整策略还有初始化前提:若要稍后收紧域名或 CIDR 列表,创建沙箱时就必须启用相应的允许列表类型。block_network=True 无法通过相同的动态路径修改,所以只在初始化阶段开放网络的智能体必须预先设计好生命周期。

Modal 的经济优势来自周边 serverless ML 平台,而不是最低的沙箱计费。1 个物理核心相当于 2 vCPU,价格为每 core-second $0.00003942;内存每 GiB-second $0.00000667。Starter 为 $0 加计算费,每月包含 $30 额度、3 个工作区席位,以及 100 个容器和 10 个 GPU 的并发。Team 为 $250/月加计算费,每月返还 $100 额度,并提供不限量席位、5,000 个容器并发、50 个 GPU 并发、静态 IP 代理、环境预算、自定义域名和部署回滚。

如果同一平台还要承载模型、定时函数和 GPU 任务,Modal 很容易证明其价值;若只是普通代码解释器,核心要求是 microVM 隔离与凭证代理,它就较难成立。当前 Sandbox 安全页面记录了网络控制与平台隔离,却没有像 Daytona 或 Cloudflare 那样明确的外部密钥注入机制。

**最适合:**Python 智能体、notebook、数据分析、ML 流水线,以及 GPU 密集的生成代码工作。
**突出优势:**gVisor Sandboxes 与 Modal 的 serverless CPU 和 GPU 平台深度集成。
**价格:**Starter 为 $0 加计算费,每月含 $30 额度。Team 为 $250/月加计算费,每月含 $100 额度。Enterprise 定制定价。Sandbox CPU 每 physical core-second $0.00003942,其中 1 core 等于 2 vCPU;内存每 GiB-second $0.00000667。
**免费试用:**Starter 每月循环提供 $30 额度。

优势
做得好的地方
9 points

  • gVisor 在运行时边界限制危险的系统调用。
  • 默认 Sandbox 无法访问其他 Modal 资源,也不能接受入站连接。
  • 支持 block-all、CIDR、beta 域名允许列表和运行时策略更新。
  • 非常适合 Python、notebook、定时函数和 GPU 工作负载。
  • Starter 每月循环提供 $30 额度。
  • 默认允许访问公共网络。
  • 域名允许列表仍为 beta。
  • 动态策略变更要求在创建时已存在相应的允许列表类型。
  • 模型测算的沙箱成本高于大多数托管替代方案。

**结论:**当沙箱只是 ML 或 GPU 系统的一部分时,Modal 胜出。若只需要一个恶意代码 API,Vercel、Cloudflare、E2B 或 Daytona 能给安全采购方更直接的路径。

月度账单究竟说明什么

托管方案最低估算为 $55.55,最高为 $288,每月相差 $232.45。规模扩大后,这笔差额值得关注;但与安排 1 名工程师维护内部执行器,或因生产令牌泄露引发 1 次安全事件相比,它仍然很小。对安全决策而言,团队不该为了省下每月低三位数金额,就接受明文密钥或开放出站。

工具持续成本估算计费方式未计入的重要项目
Docker Sandboxes厂商费用 $0本地硬件硬件与运维
Northflank$55.55运行时长,按秒集群开销、存储、出站
Cloudflare$91.63活跃 CPU、已配置 RAM/diskRequests、日志、出站
Vercel$113.34活跃 CPU、已配置 RAM网络与快照
Daytona$138.00运行时长存储与网络
Modal$168.30运行时长,已扣除 $30 额度其他平台资源
E2B$288.00运行时长加 Pro 基础费存储与网络

这些只是对比估算,不是实际账单。Vercel 的总额假设 $20 Pro 基础费与内含的 $20 用量额度相抵。Cloudflare 必须分配 8-GiB、16-GB-disk 的 standard-3 实例,才能满足 2-vCPU 要求。E2B 因统一对比采用自定义 4-GiB 内存而计入 $150 Pro 套餐。Modal 则扣除了每月循环的 $30 Starter 额度。Daytona 的 $200 和 E2B 的 $100 都是一次性额度,因此不会降低稳定运行时的表格数字。

计费方式会颠倒排名。Vercel 与 Cloudflare 按活跃 CPU 计费,所以 I/O-bound 智能体等待时花得更少。如果 CPU 在完整 5 分钟内持续工作,Vercel 会从 $113.34 上升到 $284.01,Cloudflare 会从 $91.63 上升到 $187.63。编译密集型编码智能体应按繁忙场景建模;等待页面响应的浏览器智能体,可能更接近 CPU 活跃 1 分钟的假设。

在这个模型中,Vercel 与 Daytona 的实际盈亏平衡点是:5 分钟任务中 1.58 分钟的活跃 CPU 时间,也就是约 95 秒。低于该点,Vercel 的活跃 CPU 计费更划算;高于该点,在网络和存储费用之前,Daytona 的固定运行时费率更便宜。看似价格问题,实则取决于工作流:预算应依据智能体实际计算时长,而不是仅看 wall time。

更大的预算项是所有权。Northflank 的 $55.55 估算看起来非常亮眼,直到团队把集群、策略、部署模板、事件响应,以及真正懂这套系统的工程师纳入成本。E2B 的 $288 看似昂贵,但 BYOC 可能省去另建平台的投入。合理采购必须比较整体运维负担,而不只是 vCPU 单价。

不同团队该选哪款 AI 沙箱

如果需要最稳妥的托管默认方案,并且愿意在不可信阶段开始前收紧网络策略,选择 Vercel Sandbox。一旦 BYOC、本地执行或 GPU 能力成为硬性条件,决策就应从 Vercel 转向其他产品。

如果开发者要在本地运行 Codex、Claude Code、Copilot CLI、OpenCode 或 Kiro,选择 Docker Sandboxes。高风险代码库应启用 clone mode。当需求出现客户任务、高并发、集中式可用性或远程 API 时,则应改用托管工具。

如果 Workers 已经是受信任控制面,且大多数获准调用都走 HTTP,选择 Cloudflare Sandbox SDK。如果 pre-1.0 SDK 的成熟度或固定 Container 规格带来的风险大于收益,则应转向其他方案。

如果需要独立的 Firecracker API,或 AWS 与 GCP BYOC,选择 E2B。当自定义内存让 $150 Pro 基础费难以成立,或团队不想自行搭建外部凭证代理时,应放弃这一选择。

如果智能体必须使用自己无法读取的密钥调用外部服务,或希望一个 API 同时管理 Linux VM、Windows VM 与 GPU 类型,选择 Daytona。如果所有任务都只是简单 Linux microVM,而额外运行时选项没有价值,则应选择更专一的产品。

如果沙箱必须与私有服务并排部署在自有云账号中,选择 Northflank。若组织为了节省计算单价而不得不新建平台团队,这个决策便不成立。

如果执行层离不开 Python、notebook、模型推理、定时函数或 GPU,选择 Modal。如果任务只是执行恶意代码,安全导向更明确的 API 可以用更少策略工作完成任务,就应转向该方案。

如果还在沙箱之前选择智能体,可以阅读最佳 AI 编码助手对比。两项决策务必分开:助手决定工作如何生成;沙箱决定生成的工作可以触达什么。

这些方案应该避开

**安全文档止步于“已隔离”的执行器:**采购需要对内核边界、租户隔离、默认出站、凭证位置、日志与更新责任获得书面答案。如果厂商无法完整回答这 6 项,就不要把生产数据或密钥放进沙箱。

把普通 Docker Engine container 误当成 Docker Sandboxes:docker run 并不是 sbx microVM 产品,也不会继承后者的独立内核、宿主侧网络代理、凭证注入或 clone-mode 工作区边界。名称不能代表架构。

**为未知代码库使用 direct mode 的 Docker Sandboxes:**VM 能保护宿主机的大部分区域,但智能体会直接修改工作树。被改动的 Git hook 或 package script 之后可能在宿主机执行。使用 --clone,并检查所有离开 VM 的桥接面。

**没有应用身份验证的 Cloudflare quick tunnel:**随机 hostname 没有独立 access token。应把 URL 视为可被发现,并在暴露任何敏感预览前,为服务加入身份验证。

**未配置 hosts 的 Daytona 密钥:**省略该字段会让密钥不受限制。只有明确指定获准目标,代理才真正有价值。

**任何始终停留在 allow-all 的初始化阶段:**Vercel 清楚记录了正确模式——初始化时开放宽泛访问,随后在执行阶段收紧。如果策略从不收紧,microVM 虽能限制宿主机被攻破,却无法阻止代码把数据发送出去。

剖面图展示内核边界后的代码,以及受控出站网关外的密钥
生产级沙箱既需要执行边界,也需要独立的凭证与出站边界。

最后一点正是整个品类的分界线。隔离回答的是:“代码能否逃逸?”出站与凭证策略回答的是:“不逃逸时,代码又能做什么?”两种失守都可能带来同一个业务结果:生产数据流出公司。

周一就能执行的安全清单

周一不要先约厂商演示。第一步应是一页清单,列出模型生成代码的所有运行位置。

  1. **命名每条执行路径。**包括本地编码智能体、CI 任务、浏览器智能体、数据分析 notebook、代码解释器和客户预览构建器。
  2. **画出当前边界。**记录内核或运行时隔离、已挂载文件、可访问网络,以及沙箱能拿到的每项凭证。
  3. **把密钥移到外部。**将 API key 放入受信任编排器、Worker、宿主代理或厂商凭证代理。沙箱环境变量仍然能被代码读取。
  4. **让出站默认拒绝。**初始化时放行软件包主机,在生成代码启动前切换到最小目标清单。
  5. **执行两次故障演练。**先尝试读取其他租户的文件或进程,再尝试把预置 token 发往未经批准的主机。结果必须同时满足两点:操作被阻断,并留下可用日志。
  6. **指定负责人并设置上限。**必须有人审查策略变更、失败的边界测试、镜像、日志和支出。在流量增长前,为运行时长、并发数、CPU、内存和月度预算设置限制。

这页清单完成后,再决定是否采购。只有本地风险的团队,最终可能只需要 Docker Sandboxes 加 clone mode。Vercel 产品团队也许只需调整网络策略并启用凭证代理。受监管的平台则可能发现 Northflank 或 E2B BYOC 确有必要。周一的交付物是边界决策,而不是一份新订阅。

常见问题

哪款 AI 工具的安全性最好?

在本次对比中,Vercel Sandbox 是综合最强的托管选择,因为它同时提供 Firecracker microVM、运行时出站策略和凭证代理。本地编码智能体更适合 Docker Sandboxes;必须部署在自有云时,Northflank 或 E2B 才是更好的答案。最终胜者取决于所需的信任边界。

2026 年 AI 安全有哪些趋势?

真正落地的趋势包括独立内核、在 Guest 外注入凭证、默认拒绝出站,以及定期重复边界测试。OpenAI 8 月 10 日的指南明确给出运维要求:让高能力智能体远离生产系统与开放互联网,并监控它们尝试执行的操作。

2026 年有哪些免费的 AI 沙箱工具?

有。Docker Sandboxes CLI 为 $0,不按席位收费。Vercel 有额度受限的 Hobby 套餐,E2B 提供一次性 $100 额度,Daytona 提供 $200 计算额度,Northflank 有免费 Sandbox 层级,Modal 的 Starter 每月循环提供 $30 额度。Cloudflare Sandbox 则需要 $5/月的 Workers Paid 套餐。

什么是 AI 沙箱?

AI 沙箱是一种隔离执行环境,让智能体可以运行生成代码,却不会继承对宿主机、其他用户、生产系统、密钥或不受限网络路径的宽泛访问权限。生产级沙箱必须同时拥有执行边界,以及独立的出站与凭证边界。

下载 AI 业务工作流审计清单,把沙箱选型转化为有明确范围的工作流、负责人、控制清单与复查周期。

最近更新

2026年9月3日

分类Build

在 Google 中优先显示本站

将 omidsaffari.com 添加为 Google 搜索的优先来源

把 omidsaffari.com 设为优先来源,Google 会在 Top Stories、AI Overviews 和 AI Mode 中为您优先展示。

更多 Build 文章

查看全部 Build 文章
订阅通讯

每周日,一封信。 写运转中的系统,不写热评。

来自一组 AI 项目组合运营的构建日志、生产系统与一线笔记。

每周一期。无垃圾邮件。随时退订。