A/B-тестирование лендинга или ИИ-бандит: 30 дней и цена выбора
Вместо A/B-тестирования лендинга я запустил ИИ-бандита: за 30 дней CVR вырос с 3.41% до 4.62%. Разбираю расходы, запуск и проблему статистической значимости.

Я отменил очередное A/B-тестирование лендинга с самым большим трафиком и вместо него подключил ИИ-алгоритм многорукого бандита. Тридцать дней спустя регистраций стало больше, алгоритм сам почти перестал направлять трафик на проигрывающий вариант — но статистически значимую оценку эффекта я назвать не мог. Бандиты для этого не предназначены. В этом компромиссе и заключается вся история.
Результат — и главное «но»
Речь идёт о длинном лендинге: холодный платный трафик и прогретые посетители из органики конвертируются на нём в регистрации на пробный период. За 30 дней до запуска бандита базовая конверсия в регистрацию составляла 3.41%. За следующие 30 дней — на той же странице, с тем же предложением и тем же составом трафика, но уже с распределением показов через бандита — она выросла до 4.62%. Относительный прирост по основному целевому действию составил 35.5%.
Но прежде чем кто-либо сделает скриншот этой цифры, важно оговориться: это прирост совокупного результата, а не установленный причинный эффект. Многорукий бандит перераспределяет трафик в пользу варианта, который выигрывает в данный момент. Он не сохраняет чистое распределение 50/50 достаточно долго, чтобы для отдельного варианта можно было построить доверительный интервал. Здесь нет p-value. Нет вывода «вариант B превзошёл вариант A с уверенностью 95%». Есть лишь факт: во всей совокупности посетителей конверсий оказалось больше, чем в предыдущем контрольном периоде. Это разные утверждения, и совет директоров, который понимает разницу, обязательно спросит, какое именно из них вы делаете.
Для контекста — затраты. За 30 дней через бандита прошло ~84,000 просмотров страницы. На инструменты ушло $299 за месяц Webflow Optimize на тарифе до 100K просмотров, плюс пилот Coframe с ценой по запросу — к нему ещё вернёмся. В сумме платформы обошлись менее чем в $500, а страница, которая приносит ощутимое число регистраций на пробный период, действительно выросла. Экономика сходится. Оговорка насчёт атрибуции никуда не исчезает.
Почему я отменил A/B-тестирование лендинга
Эта страница завершает две воронки трафика: платные кампании Meta с ротацией AdCreative.ai, Pencil Pro и человеческого контроля, о которой я писал раньше, а также органические переходы и рефералы из ИИ-поисковиков после внедрения 14-дневного плана по GEO. Всего — около 2,800 сессий в день. Соотношение платного и органического трафика составляет 30/70 и меняется от недели к неделе.
Для чистого A/B-теста такой профиль трафика подходит хуже всего. Чтобы обнаружить относительный прирост в 10% при мощности 80% и базовой конверсии 3.4%, мне требовалось примерно по 50,000 посетителей на каждую ветку — около 35 дней для теста из двух вариантов при неизменном распределении 50/50. Получается пять недель, в течение которых заведомо проигрывающий вариант получает 50% платного трафика, пока я жду статистической значимости. При CPL $24 на платном канале каждый процентный пункт его отставания — это деньги, которые эксперимент намеренно сжигает.
Так выглядит проблема сожаления. A/B-тест — это чистое исследование: распределение остаётся фиксированным ради статистической мощности, а расплачиваться приходится плохим опытом для половины посетителей на всём протяжении эксперимента. Бандит меняет чистоту вывода на совокупный результат: продолжает изучать остальные варианты, но уже направляет больше трафика лидеру. Эмпирические сравнения показывают, что в стационарных задачах это снижает совокупное сожаление на 30–60% по сравнению с A/B-тестом с равным распределением.
До запуска я сформулировал правило выбора:
- Бандит — когда трафика мало относительно эффекта, который нужно обнаружить; показывать проигравший вариант дорого; страница работает постоянно, без ограниченного окна кампании; а совокупное число конверсий в этом квартале важнее защищаемой оценки причинного эффекта.
- A/B-тест — когда прирост нужно обосновать перед человеком, отвечающим за P&L; изменение крупное и редкое, например цена, первый экран или позиционирование; либо варианты слишком различаются, чтобы учиться на них совместно.
Моя страница соответствовала всем условиям для бандита. Поэтому запланированный A/B-тест я отменил и запустил бандита.
Стек: все инструменты и все расходы
Я оценил четыре инструмента для непрерывной оптимизации на базе ИИ, а не классического A/B-тестирования. Два развернул в продакшене, ещё два подробно изучил, но для этого запуска отверг. Вот честные выводы.
Coframe. Оптимизатор на базе модифицированного алгоритма многорукого бандита: он генерирует варианты текста, визуальных элементов и даже кода компонентов, а затем сам распределяет между ними трафик. Установка через script tag. Компания привлекла около $9M. Цена предоставляется по запросу, публичной страницы с тарифами нет. Для планирования это уже важный сигнал: бюджет заранее непонятен, до запуска нужно пройти цикл продаж, а корпоративная модель плохо приспособлена к одиночному специалисту. Я провёл пилот. По качеству сгенерированных вариантов Coframe оказался лучшим из четырёх; по сложности закупки — худшим.
Webflow Optimize. Построен на движке Intellimize, который приобрела Webflow. Стандартный тариф стоит $299/month за 100K просмотров страницы; доступны уровни 25K, 50K, 100K, 250K и 500K. Одновременно можно вести до 5 тестов. Решение работает только со страницами на Webflow — в моём случае это не проблема, но для любого другого сайта ограничение становится непреодолимым. Именно Webflow Optimize я использовал в продакшене все 30 дней: страница уже работала на Webflow, а расходы на тариф Webflow были заложены в бюджет.
Optimizely Opal. Агентная система экспериментов поверх существующей платформы Optimizely. По опубликованным данным самой Optimizely, пользователи Opal проводят на 78.7% больше экспериментов и на 24.1% больше кампаний персонализации, а доля побед выросла на 9.3%. Это цифры поставщика, полученные по его собственной методологии; я привожу их, чтобы вы могли сделать соответствующую скидку. Цена корпоративная. Для команды с действующим контрактом Optimizely решение имеет смысл. Для одного лендинга — нет.
VWO Copilot. Связка Testing + Insights + Personalize с дополнительным слоем ИИ. Это самая зрелая из четырёх платформ, а под ИИ-функциями здесь по-прежнему лежит классическая логика A/B-тестов. Я выбрал бы VWO, если бы мне был нужен привычный процесс A/B-тестирования с помощью ИИ, а не бандит как основа и A/B-тест в качестве опции.
В этом запуске Webflow Optimize проработал в продакшене все 30 дней, а Coframe параллельно тестировался на второстепенной странице для сравнения качества вариантов.
План на 30 дней: что делать по этапам
Дни 0–3: настройка аналитики и фиксация условий. Целевое действие только одно — подтверждённая сервером регистрация на пробный период, а не клик по кнопке. Если считать события на стороне клиента, показатель каждого варианта окажется одинаково завышен: шум будет выглядеть как победа. Контроль я зафиксировал без изменений: исходная страница стала вариантом A и получила гарантированный минимум в 20% на весь запуск, чтобы позднее результат можно было сопоставить с отложенной контрольной группой. Без этого ограничения после появления лидера бандит лишил бы контроль трафика, и сравнивать было бы не с чем.
Дни 4–10: генерация и обучение. Я задал четыре варианта, в которых менялись заголовок первого экрана, текст основного CTA и порядок блока с социальными доказательствами. Первая неделя — исследовательская фаза бандита. Распределение было почти равным: на 7-й день контроль и четыре варианта получали соответственно 22%, 19%, 21%, 18% и 20%. Именно здесь большинство специалистов начинают паниковать и «помогать» алгоритму. Не стоит. Любое изменение вариантов во время обучения сбрасывает априорные распределения, и неделя пропадает зря.
Дни 11–21: перераспределение трафика. Примерно на 12-й день перекос стал заметен. К 18-му дню лидер получал 41% трафика, контроль сохранял минимальные 20%, два средних варианта держались примерно на ~15% каждый, а худший опустился ниже 10%. Так бандит и должен работать: каждый посетитель, отправленный проигравшему варианту, увеличивает сожаление, а алгоритм минимизирует его в реальном времени.
Дни 22–30: фиксация и решение. Я зафиксировал победившее направление, а не конкретный вариант: более короткий первый экран, CTA с акцентом на выгоду и социальные доказательства выше линии сгиба. Затем экспортировал варианты. На 30-й день нужно ответить на вопрос: перевести ли победителя в чистый A/B-тест против контроля, чтобы получить для совета директоров причинную оценку, или оставить бандита и запустить следующий набор вариантов?
На всём протяжении запуска действовали защитные ограничения: минимум 20% трафика для контроля; аварийная остановка, если нижняя доверительная граница какого-либо варианта показывала относительное падение на 50% к контролю дольше 48 часов; еженедельная проверка состава трафика. Если доля платного и органического трафика менялась более чем на 10 пунктов за неделю, я должен был заморозить бандита до стабилизации. Нестационарный трафик — тихий убийца таких экспериментов.
Проблема атрибуции — неудобная, но главная
Этого раздела нет в подборках инструментов, и только ради него стоило писать весь материал.
По самой своей конструкции многорукий бандит не позволяет получить статистическую значимость для отдельного варианта. Статистический аппарат A/B-тестирования — p-value, доверительные интервалы, расчёты мощности — предполагает фиксированное правило распределения трафика. Ценность бандита как раз в том, что это правило не фиксировано: оно меняется в зависимости от первых результатов. Как только распределение начинает зависеть от исходов, классический статистический вывод перестаёт работать. Выборки во всех ветках становятся смещёнными. Совокупное число конверсий по всей аудитории измерить всё ещё можно. Сделать чистый причинный вывод о варианте B по сравнению с вариантом A — нельзя.
Это не ошибка, а принцип работы. Бандит оптимизирует другую цель: сокращает совокупное сожаление и увеличивает совокупное число конверсий. Эмпирические сравнения стабильно показывают снижение сожаления на 30–60% по сравнению с A/B-тестом с равным распределением в стационарных задачах. Метрика здесь — «меньше сожаления», а не «доказанный причинный прирост варианта B».
Поэтому особенно важны точные формулировки:
- Обоснованно: «После запуска бандита конверсия страницы составила 4.62% на 84,000 посетителей за 30 дней против 3.41% на той же странице за предыдущие 30 дней».
- Необоснованно: «Вариант B вызвал рост конверсии на 35%».
Первое утверждение описывает совокупный результат. Второе заявляет о причинности, которую бандит доказать не может.
Частично решить проблему помогли 20% трафика, гарантированно оставленные контролю. Поскольку исходная страница получала гарантированные 20% все 30 дней, у меня сохранилась небольшая, но чистая группа для сравнения. За время запуска контроль показал конверсию 3.38% — практически столько же, сколько базовый период за предыдущие 30 дней. У остальных посетителей конверсия составила 4.93%. Это даёт понимание направления: прирост реален и не объясняется сезонностью. Полноценным результатом A/B-теста сравнение всё равно не становится, ведь группа без контроля сама состоит из постоянно меняющейся смеси вариантов. Но этого достаточно, чтобы сказать совету директоров: «Запуск превзошёл собственную внутреннюю контрольную группу; вот разница, вот что мы утверждаем, а чего не утверждаем».
Если нужна защищаемая причинная оценка, используйте бандита, чтобы найти перспективное направление, а затем переведите ведущий вариант в A/B-тест с распределением 50/50 против контроля. Такой процесс учитывает и допустимый для оператора уровень сожаления, и требования аналитика к доказательности.
Где метод не сработал
Тот же подход я проверил ещё на двух страницах, где бандит уступил обычному A/B-тесту. Первая — малопосещаемая страница с ценами, менее 400 сессий в день. Бандит слишком долго не мог выйти из исследовательской фазы, а выводы о направлении оставались зашумлёнными. Простой A/B-тест 50/50 за шесть недель дал более ясный ответ при меньших операционных затратах. Второй была воронка оформления заказа, где между показом варианта и конверсией проходило 3–5 дней. Бандитам нужна достаточно быстрая обратная связь; при большой задержке между показом и результатом алгоритм перераспределяет трафик по устаревшим данным и гоняется за призраками.
Среди сгенерированных вариантов я отклонил около 40% предложений Coframe и меньшую долю предложений Webflow Optimize. Признаки были привычными: неуместные длинные тире, дежурные «сильные» глаголы, ритмичные параллельные списки, в которых модель слишком старается звучать как маркетолог. Всё, что попадало в зловещую долину фирменного стиля, отсеивалось до встречи с реальным трафиком. Уровень брака — те самые расходы, о которых не пишут на страницах с тарифами.
На третьей неделе меня едва не поймала ловушка нестационарности. За четыре дня доля платного трафика выросла с 30% до 47% из-за масштабирования кампании Meta. Ведущий вариант бандита побеждал при одном составе трафика, но теперь приходила другая аудитория, и его конверсия начала снижаться. Я заморозил бандита на 48 часов, дождался стабилизации и заново запустил исследовательскую фазу. Если бы алгоритм продолжил работу, он сделал бы неверный вывод по временно изменившейся аудитории.
Правило, которое можно повторить
Если убрать особенности моей страницы, правило выбора выглядит так.
Запускайте бандита, когда трафика мало относительно прироста, который нужно обнаружить; цена показа проигравшего варианта половине посетителей ощутима; страница работает постоянно, без ограниченного окна кампании; а совокупные конверсии в этом квартале важнее защищаемой причинной оценки отдельного варианта. Запускайте A/B-тест, когда прирост нужно обосновать перед человеком, отвечающим за P&L; изменение достаточно крупное и редкое, поэтому перед внедрением нужен чистый результат; либо победивший вариант предстоит масштабировать на другие поверхности и необходимо убедиться, что сработал именно он.
Большинству специалистов понадобятся оба подхода. Бандит — на постоянно работающих конверсионных поверхностях: главной странице, основном лендинге, воронке регистрации. A/B-тест — для стратегических ставок: цены, позиционирования, переработки первого экрана. Ошибка — считать эти методы конкурентами. Они оптимизируют разные цели. Ещё одна ошибка типичных подборок — представлять бандита бесплатным улучшением без статистического компромисса. Это не так. Цена — ваш p-value, и платить её стоит только осознанно.
При описанном масштабе непрерывная работа обойдётся в $299/month за Webflow Optimize на тарифе до 100K просмотров страницы; с ростом трафика понадобятся более дорогие уровни. Добавьте к бюджету ещё полдня работы специалиста в неделю: проверять распределение, отключать плохие варианты и отслеживать нестационарные сдвиги. Вот реальная стоимость. Если вы внедряете такой процесс в агентстве или внутренней growth-команде и хотите аккуратно связать атрибуцию конверсий с CRM и хранилищем данных, это уже отдельный разговор. Но для самого развёртывания бандита нужны один специалист, один послеобеденный рабочий блок и один script tag.
Один CTA — после такого длинного материала следующий шаг должен быть предельно ясным. Чек-лист аудита бизнес-процессов для ИИ помогает мне определить, где уместен бандит, а где необходим чистый A/B-тест. Проверьте по нему свою воронку до выбора инструмента. Когда growth-команда начинает с инструмента, она часто платит за возможности, для которых у неё не хватает трафика.
5 сент. 2026 г.







