A/B测试还是 AI 多臂老虎机?30 天落地页转化实测

我把高流量落地页从固定分流的 A/B测试切换为 AI 多臂老虎机,连续运行 30 天,注册转化率从 3.41% 升至 4.62%。本文拆解工具成本、流量分配、控制组保留方案,以及为何转化更多仍不等于获得统计显著的因果结论,并复盘低流量、延迟转化和流量结构突变时的适用边界,帮助增长团队在两种方法之间做出选择。

Saturday, September 5, 2026Omid Saffari
A/B测试还是 AI 多臂老虎机?30 天落地页转化实测

我没有继续给流量最高的落地页排下一轮 A/B测试,而是直接接入了 AI 多臂老虎机。30 天后,注册量上升,表现落后的版本也被算法自动压低了流量——但我无法给出一个达到统计显著性的归因数字,因为多臂老虎机本来就不会产出这种结论。这项取舍,正是全文要讲的核心。

A/B测试视角下的结果,以及关键限制

这是一个承接低意向付费流量和已有兴趣的自然访客、并将他们转化为试用注册的长篇落地页。接入多臂老虎机前 30 天,注册转化率基线为 3.41%;同一个页面、同一套产品方案、同样的流量构成,在交由多臂老虎机分配流量后的 30 天里,转化率达到 4.62%。以主要转化事件计算,相对提升为 35.5%。

不过,在有人截取这个数字之前,必须先说清楚:这是累计结果的提升,不是经过因果识别的提升。多臂老虎机会把流量实时转向当下领先的版本,不会长期维持干净的 50/50 分流,因此无法为某个单独版本给出置信区间。这里没有 p 值,也不能说“版本 B 以 95% 的置信度击败版本 A”。能说的只有:“与此前的对照周期相比,全部访客中完成转化的人更多了。”这和因果结论是两回事,懂其中差异的董事会一定会追问你究竟在主张哪一种。

再看成本:这 30 天里,约有 84,000 次页面浏览进入多臂老虎机。工具支出包括一个月的 Webflow Optimize,100K 页面浏览量档位价格为 $299;另有一次 Coframe 试用,其价格需联系销售,下文还会详述。平台总成本不到 $500,而这个页面承载着可观的试用注册量,提升也是真实发生的。这笔账算得过来,但归因上的限制依然存在。

实验设置:为什么我取消了原定的 A/B测试

这个页面位于两股流量的最下游:一股来自 Meta 付费投放,使用我此前写过的 AdCreative.ai、Pencil Pro 与人工对照轮换方案;另一股来自 14 天 GEO 实操手册带来的自然搜索与 AI 搜索引擎推荐流量。总计每天约 2,800 个会话,付费与自然流量约为 30/70,而且每周都会波动。

这样的流量结构恰恰不适合做干净的 A/B测试。以 3.4% 的基准转化率、80% 的统计功效检测 10% 的相对提升,每个实验组大约需要 50,000 名访客。如果两组始终按 50/50 分流,实验要跑约 35 天。也就是说,为了等到统计显著性,需要连续 5 周把 50% 的付费流量交给一个明知表现落后的版本。付费侧的 CPL 是 $24,落后版本每少转化一个百分点,烧掉的都是真金白银,而且这是实验设计主动造成的。

这就是“遗憾”问题。A/B测试是纯探索:为了获得统计功效,必须固定流量比例;代价则是在整个实验期间,让一半访客看到较差的体验。多臂老虎机放弃干净的推断,换取更好的累计结果——它一边继续探索其他版本,一边利用当前领先版本。实证比较显示,在平稳环境中,相比等比例分流的 A/B测试,它能减少 30–60% 的累计遗憾。

我在开始前定下的判断规则是:

  • 当流量相对于希望检测的效果量不足、展示落后版本的代价高、页面持续运行且没有固定投放窗口,并且我更看重本季度累计转化而非可严密辩护的因果数字时,选择多臂老虎机。
  • 当我需要向掌握损益表的人证明提升、改动幅度大且很少发生(如定价、首屏主视觉、定位),或各版本差异太大、无法共同学习时,选择 A/B测试。

这个页面满足多臂老虎机的所有条件。因此,我取消了排队中的 A/B测试,改跑多臂老虎机。

工具栈:每款工具与每项成本

我评估了 4 款以 AI 驱动持续优化、而非传统 A/B测试流程为主的工具。其中 2 款实际部署,另外 2 款经过认真评估后没有用于这次项目。下面是不加修饰的结论。

Coframe。 它使用经过改造的多臂老虎机优化器,可以生成文案、视觉乃至组件代码的多个版本,再通过算法分配流量。安装方式是添加脚本标签。该公司已融资约 $9M。价格需要联系销售,没有公开价格页;这本身就是一个规划信号:预算难以预测,正式运行前还要经过销售流程,而且企业级销售模式并不照顾独立操作者。我做过一次试用。4 款工具里,它生成的版本质量最好,采购摩擦也最大。

Webflow Optimize。 它基于 Webflow 收购的 Intellimize 引擎。标准套餐为每月 $299,对应 100K 次页面浏览;另有 25K、50K、100K、250K、500K 档位。最多可同时运行 5 个测试。它只适用于托管在 Webflow 上的页面;我的页面正好符合,但如果网站建在其他平台上,这就是硬性门槛。我用它完成了这次 30 天生产环境部署,因为页面本来就在 Webflow 上,而且 Webflow 套餐的成本账已经算过并付了钱。

Optimizely Opal。 在现有 Optimizely 平台之上叠加了由 Agent 驱动的实验能力。Optimizely 自己公布的数据称,Opal 用户运行的实验增加了 78.7%,个性化活动增加了 24.1%,胜出率提升了 9.3%。这些是供应商依据自身方法得出的数据,我把它们列出来,也建议据此适当打折。采用企业定价。对于已经签约 Optimizely 的团队,这套方案说得通;只优化一个落地页则没有必要。

VWO Copilot。 在 Testing、Insights 和 Personalize 产品栈之上增加了 AI 层。它是其中最成熟的平台,AI 功能底层仍延续了最经典的 A/B测试思路。如果目标是用 AI 辅助一套清晰的 A/B测试流程,而不是以多臂老虎机为主、把 A/B测试作为备选,我会选择它。

工具方法起步成本安装方式优化对象
Coframe生成式 AI + 多臂老虎机联系销售脚本标签文案、视觉、组件代码
Webflow Optimize多臂老虎机(Intellimize)$299/月 @ 100K PVWebflow 原生版本、受众、页面目标
Optimizely OpalAgent + A/B测试 + 多臂老虎机企业级现有 Optimizely 环境完整实验体系
VWO CopilotA/B测试优先 + AI定制代码片段 + 集成测试、洞察、个性化

本次项目中,Webflow Optimize 在生产环境完整运行了 30 天;Coframe 则在另一个次要页面上同步试用,用来比较生成版本的质量。

30 天落地页转化率优化实操:逐日拆解

第 0–3 天:埋点并冻结变量。 只设置一个转化事件——由服务器确认的试用注册,而不是按钮点击。任何只在客户端统计的事件都会同等抬高所有版本的数据,让你把噪声包装成胜利。我冻结了对照版本:现有页面保持原样,作为版本 A,并保证整个实验期间至少获得 20% 的流量,以便最后能与这个保留组比较。如果没有这一底线,一旦领先版本出现,多臂老虎机就会让对照版本几乎拿不到流量,最终也就无从比较。

第 4–10 天:生成版本,让算法自行学习。 我预设了 4 个版本,差异覆盖首屏标题、主 CTA 文案以及社会证明模块的顺序。第一周是多臂老虎机的探索阶段。第 7 天,对照版本加上 4 个新版本的流量分配仍接近平均,依次为 22%、19%、21%、18%、20%。大多数操作者会在此时慌张,忍不住出手“帮忙”。不要这样做。在学习中途修改版本会重置先验分布,让整整一周的学习白费。

第 11–21 天:观察流量再分配曲线。 大约从第 12 天起,多臂老虎机开始明显倾斜。到第 18 天,领先版本获得了 41% 的流量,对照版本保持 20% 的下限,两个中间版本各约 15%,最差版本则被压到 10% 以下。这正是多臂老虎机该做的事:每送一名访客去落后版本,都会增加遗憾;算法则在实时把它降到最低。

第 22–30 天:锁定方向并做决定。 我锁定的是胜出方向,并非某个版本的原样文案:更短的首屏、利益导向的 CTA,以及首屏内可见的社会证明。随后导出全部版本。第 30 天要回答的问题是:是否应让胜出版本与对照版本进行一次干净的 A/B测试,从而为董事会补上因果数字;还是让多臂老虎机带着下一轮版本继续运行?

整个过程中,我始终启用了这些护栏:对照版本至少保留 20% 的流量;如果任何版本置信下界相对对照版本下降 50%,且持续超过 48 小时,则触发熔断;每周检查一次流量构成变化——如果付费与自然流量的占比一周内变动超过 10 个百分点,就暂停多臂老虎机,直到流量恢复稳定。非平稳流量才是悄无声息的杀手。

归因难题:这才是最需要诚实面对的部分

榜单式文章通常不会写这一节,而它恰恰是本文存在的唯一理由。

从构造方式上说,多臂老虎机无法为单个版本提供统计显著性。A/B测试的统计工具——p 值、置信区间、功效计算——都假设流量分配规则固定不变。多臂老虎机的全部价值,恰恰来自分配规则并不固定,而是根据早期数据动态调整。一旦流量分配取决于实验结果,经典统计推断便不再成立,各实验组的样本都会产生偏差。你仍可以衡量全部访客的累计转化,却无法对版本 B 与版本 A 做出干净的因果判断。

这不是缺陷,而是设计使然。多臂老虎机优化的是另一个目标:降低累计遗憾,最大化累计转化。实证比较一再表明,在平稳环境中,多臂老虎机相比等比例分流的 A/B测试可减少 30–60% 的遗憾。衡量它的指标是“遗憾更少”,而不是“已证明版本 B 带来因果提升”。

因此,表述必须非常克制:

  • 站得住脚:“部署多臂老虎机后,页面在 30 天内、84,000 名访客中的整体转化率为 4.62%;此前 30 天,同一页面的转化率为 3.41%。”
  • 站不住脚:“版本 B 导致转化率提升了 35%。”

第一句描述的是累计结果;第二句声称存在因果关系,而多臂老虎机无法为这个结论提供证据。

我只解决了一半:保留 20% 的对照流量。由于原页面在全部 30 天里始终获得至少 20% 的分配,我得到了一组规模不大但足够干净的比较样本。实验期间,对照组转化率为 3.38%,与此前 30 天的基线基本持平;非对照组的转化率为 4.93%。这给出了方向性信号:提升确实存在,并非季节性因素造成。它仍不是干净的 A/B测试结果,因为非对照组本身也是多个版本不断变化的组合;但这些数据足以让我对董事会说:“这次运行超过了内部保留组;差距在这里,我们主张什么、不主张什么,也都写清楚了。”

如果需要一项可严密辩护的因果数字,可以先用多臂老虎机找出候选方向,再让领先版本与对照版本进行 50/50 的 A/B测试。这样的流程既尊重操作者的遗憾预算,也满足分析人员的证据标准。

哪些场景没有效果

我在另外 2 个页面上尝试了同样的方法,多臂老虎机的表现不如普通 A/B测试。第一个是低流量定价页,每天不到 400 个会话。多臂老虎机迟迟无法走出探索阶段,方向性信号噪声很大;用简单的 50/50 分流跑 6 周 A/B测试,反而以更低的运营负担给出了更清晰的答案。第二个是结账流程,转化事件比版本曝光晚 3–5 天发生。多臂老虎机要求反馈足够及时;曝光与结果之间延迟太久,算法就会根据过时数据重新分配流量,追逐并不存在的信号。

生成版本中,我淘汰了 Coframe 约 40% 的产出,Webflow Optimize 被淘汰的比例更低。问题都很典型:不该出现的破折号、模板化的强势动词,以及读起来像模型刻意模仿营销人员的排比节奏。凡是落入品牌语气“恐怖谷”的内容,在获得任何流量前就会被删除。这份淘汰率,正是所有定价页都不会告诉你的成本。

第 3 周,我险些落入非平稳流量的陷阱。随着一项 Meta 广告活动放量,付费流量占比在 4 天内从 30% 猛增至 47%。多臂老虎机的领先版本是在另一种流量结构下胜出的,而新流量涌入后,它的转化表现开始走弱。我暂停算法 48 小时,等待流量结构稳定,再用新的探索阶段重启。如果任由它继续运行,它会从临时变化的受众中学到错误结论。

可复用的判断原则

去掉这个页面的特殊背景,可以把决策规则归纳为:

当现有流量不足以轻松检测目标提升、把一半访客交给落后版本的代价不可忽略、页面长期运行而非服务于固定投放窗口,并且本季度累计转化比单个版本可严密辩护的因果数字更重要时,使用多臂老虎机。当提升数字需要向掌握损益表的人交代、改动幅度大且发生频率低、上线前必须获得干净结论,或胜出版本准备扩展到其他触点而你需要确认它确实有效时,使用 A/B测试。

多数操作者最终会同时采用两者。多臂老虎机放在持续运行的转化触点——首页、核心报价页、注册流程;A/B测试用来验证方向性押注——定价、定位、首屏重写。错误在于把它们看作互相竞争的方法:两者优化的目标并不相同。榜单文章更常见的错误,是把多臂老虎机描述成没有统计代价的免费升级。事实并非如此。你付出的代价就是 p 值,而且要么在清楚代价的前提下使用,要么就不该使用。

按本文所述规模持续运行,Webflow Optimize 的成本是每月 $299,对应 100K 页面浏览量档位;流量增长后还需升级。每周还要为操作者预留半天,用于检查分配、终止差版本并监控非平稳漂移。这才是真实成本。如果准备把这套流程纳入代理机构或企业内部增长团队,并需要帮助将转化归因准确接入 CRM 与数据仓库,那是另一个话题;但多臂老虎机部署本身,只需要一名操作者、一个下午和一个脚本标签。

全文只放一个 CTA,因为文章已经够长,你也应该获得一个明确的下一步:AI 业务工作流审计清单就是我用来判断哪些触点适合多臂老虎机、哪些必须做干净 A/B测试的工具。选工具之前,先用它检查你的漏斗。增长团队之所以常常为没有足够流量使用的功能付费,正是因为把选工具放在了第一步。

最近更新

2026年9月5日

分类Growth

在 Google 中优先显示本站

将 omidsaffari.com 添加为 Google 搜索的优先来源

把 omidsaffari.com 设为优先来源,Google 会在 Top Stories、AI Overviews 和 AI Mode 中为您优先展示。

更多 Growth 文章

查看全部 Growth 文章
订阅通讯

每周日,一封信。 写运转中的系统,不写热评。

来自一组 AI 项目组合运营的构建日志、生产系统与一线笔记。

每周一期。无垃圾邮件。随时退订。