AI 밴딧 vs A/B 테스트: 30일 전환율 데이터와 선택의 대가
A/B 테스트 대신 AI 멀티암드 밴딧을 랜딩페이지에 30일간 적용했습니다. 가입 전환율은 3.41%에서 4.62%로 올랐지만 p-value는 얻지 못했습니다. 실제 운영비와 20% 대조군 설계, 어트리뷰션의 한계, 다시 A/B 테스트로 전환해야 할 판단 기준까지 공개합니다.

트래픽이 가장 많은 랜딩페이지에 다음 A/B 테스트를 걸어두는 대신, AI 멀티암드 밴딧에 운영을 맡겼습니다. 30일 뒤 가입은 늘었고 밴딧은 성과가 낮은 변형에 보내는 트래픽을 자동으로 줄였습니다. 하지만 통계적으로 유의한 어트리뷰션 수치는 제시할 수 없었습니다. 밴딧은 애초에 그런 결과를 만드는 도구가 아니기 때문입니다. 이 맞교환이 이 글의 핵심입니다.
전환율 최적화 성과와 반드시 알아야 할 함정
대상은 콜드 유료 트래픽과 이미 관심이 형성된 오가닉 방문자를 체험판 가입으로 전환하는 장문의 오퍼 랜딩페이지입니다. 밴딧을 적용하기 전 30일간 가입 전환율 기준선은 3.41%였습니다. 같은 페이지, 같은 오퍼, 같은 트래픽 구성에서 배분을 밴딧에 맡긴 뒤 30일간 전환율은 4.62%였습니다. 핵심 전환 이벤트가 상대적으로 35.5% 상승한 셈입니다.
이 수치를 캡처해 인용하기 전에 함정부터 짚겠습니다. 이는 누적 결과 기준의 상승이지, 인과관계가 식별된 상승이 아닙니다. 멀티암드 밴딧은 그 순간 앞서는 변형에 더 많은 트래픽을 배분합니다. 어느 한 변형의 신뢰구간을 계산할 만큼 깔끔한 50/50 분할을 오래 유지하지 않습니다. p-value도 없고, “변형 B가 95% 신뢰수준으로 변형 A를 이겼다”는 결론도 없습니다. 말할 수 있는 것은 “이전 대조 기간보다 전체 방문자 집단에서 더 많은 사람이 전환했다”는 사실뿐입니다. 이 둘은 서로 다른 주장입니다. 그 차이를 아는 이사회라면 어느 쪽을 주장하는지 반드시 묻습니다.
비용도 함께 보겠습니다. 30일 동안 약 84,000회의 페이지 조회를 밴딧으로 처리했습니다. 툴 비용은 100K 조회 요금제의 Webflow Optimize 한 달 이용료 $299와 Coframe 파일럿 비용이었습니다. Coframe은 영업 문의 방식으로 가격을 책정하며, 자세한 내용은 아래에서 다룹니다. 플랫폼 비용은 모두 합쳐 $500 미만이었고, 의미 있는 체험판 가입을 만드는 페이지에서 실제 상승을 얻었습니다. 비용 계산은 성립했습니다. 다만 어트리뷰션의 한계는 그대로 남습니다.
실험 설계: A/B 테스트를 접은 이유
이 페이지는 두 트래픽 흐름의 마지막 지점에 있습니다. 하나는 앞서 다룬 AdCreative.ai / Pencil Pro / 사람 제작 소재 로테이션을 거친 Meta 유료 트래픽이고, 다른 하나는 14일 GEO 플레이북에서 유입되는 오가닉 및 AI 검색엔진 추천 트래픽입니다. 하루 세션은 총 약 2,800회이며, 유료와 오가닉의 비중은 30/70이지만 주마다 조금씩 달라집니다.
이런 트래픽 형태는 깔끔한 A/B 테스트에 정확히 맞지 않습니다. 기준 전환율 3.4%에서 상대적 상승률 10%를 검출력 80%로 확인하려면 각 실험군에 약 50,000명의 방문자가 필요했습니다. 50/50 배분을 유지하는 2개 실험군 테스트라면 약 35일입니다. 통계적 유의성을 기다리는 5주 동안 이미 성과가 낮다고 드러난 변형에도 유료 트래픽의 50%를 계속 보내야 합니다. 유료 채널의 CPL이 $24인 상황에서 패배 변형의 성과가 퍼센트포인트 단위로 낮아질 때마다, 설계상 실제 비용을 태우게 됩니다.
이것이 후회 비용 문제입니다. A/B 테스트는 순수 탐색 방식입니다. 통계적 검정력을 얻기 위해 배분을 고정하고, 그 대가로 테스트가 끝날 때까지 방문자의 절반에게 나쁜 경험을 제공합니다. 밴딧은 이처럼 깔끔한 추론을 포기하는 대신 누적 성과를 택합니다. 다른 변형을 계속 탐색하면서도 앞선 변형을 활용하며, 실증 비교에서는 정상성이 유지되는 문제에서 균등 배분 A/B 테스트보다 누적 후회를 30–60% 줄이는 것으로 나타납니다.
시작 전 세운 판단 기준은 다음과 같습니다.
- 확인하려는 효과에 비해 트래픽이 부족하고, 패배 변형을 노출하는 비용이 크며, 정해진 캠페인 기간 없이 페이지가 상시 운영되고, 방어 가능한 인과 수치보다 이번 분기의 누적 전환이 더 중요하다면 밴딧을 선택합니다.
- 손익을 책임지는 사람에게 상승 폭을 입증해야 하거나, 변경이 크고 드문 결정이거나(가격, 히어로 영역, 포지셔닝), 변형 간 차이가 너무 커서 함께 학습하기 어렵다면 A/B 테스트를 선택합니다.
이 페이지는 모든 밴딧 조건에 해당했습니다. 그래서 예정했던 A/B 테스트를 접고 밴딧을 가동했습니다.
랜딩페이지 최적화 툴과 실제 비용
전통적인 A/B 워크플로가 아니라 AI 기반의 지속 최적화를 제공하는 툴 4개를 검토했습니다. 2개는 실제 환경에 배포했고, 나머지 2개도 진지하게 검토했지만 이번 실행에서는 제외했습니다. 솔직한 평가는 다음과 같습니다.
Coframe. 카피, 비주얼, 컴포넌트 코드까지 변형을 생성한 뒤 수정된 멀티암드 밴딧으로 트래픽을 배분하는 최적화 툴입니다. 스크립트 태그로 설치합니다. 이 회사는 약 $9M을 투자받았습니다. 가격은 영업 문의 방식이며 공개된 가격 페이지가 없습니다. 이것만으로도 계획 단계에서 예산을 예측하기 어렵고, 실행 전에 영업 절차를 거쳐야 하며, 단독 운영자와 잘 맞지 않는 엔터프라이즈 영업 모델이라는 신호입니다. 파일럿을 진행해 보니 4개 중 생성형 변형의 품질은 가장 좋았고, 구매 절차의 마찰은 가장 컸습니다.
Webflow Optimize. Webflow가 인수한 Intellimize 엔진을 기반으로 합니다. 스탠더드 요금제는 페이지 조회 100K에 월 $299이며, 25K, 50K, 100K, 250K, 500K 티어가 있습니다. 동시에 최대 5개 테스트를 실행할 수 있습니다. Webflow에서 호스팅되는 페이지만 지원하므로 제 환경에는 문제가 없었지만, 다른 플랫폼에서 사이트를 운영한다면 선택할 수 없습니다. 페이지가 이미 Webflow에 있고 Webflow 요금제 비용 계산도 끝난 상태였기 때문에, 30일 실제 배포에는 이 툴을 사용했습니다.
Optimizely Opal. 기존 Optimizely 플랫폼 위에 에이전트 기반 실험 기능을 더한 제품입니다. Optimizely가 직접 공개한 수치에 따르면 Opal 사용자는 실험을 78.7% 더 많이 실행하고, 개인화 캠페인을 24.1% 더 많이 운영하며, 승률은 9.3% 상승합니다. 공급사가 자체 방법론으로 산출한 수치이므로 그 점을 감안할 수 있도록 그대로 인용합니다. 가격은 엔터프라이즈 방식입니다. 이미 Optimizely 계약이 있는 팀에는 타당하지만, 랜딩페이지 하나를 위해서는 맞지 않았습니다.
VWO Copilot. Testing + Insights + Personalize 스택 위에 AI 레이어를 올린 제품입니다. 가장 오래 자리 잡은 플랫폼이며, AI 기능의 바탕에도 가장 전통적인 A/B 사고방식이 깔려 있습니다. 밴딧을 우선하되 A/B도 선택할 수 있는 워크플로보다, AI 지원을 받는 정석적인 A/B 워크플로가 필요하다면 이 제품을 고르겠습니다.
이번 실행에서는 Webflow Optimize를 실제 환경에서 30일 내내 가동했고, Coframe은 변형 품질을 비교하기 위해 보조 페이지에서 동시에 파일럿으로 운영했습니다.
30일 실행 플레이북
0–3일차: 계측하고 고정합니다. 전환 이벤트는 단 하나, 서버에서 확인된 체험판 가입으로 정했습니다. 버튼 클릭이 아닙니다. 클라이언트에서 집계하면 모든 변형의 수치가 똑같이 부풀고, 실제로는 잡음을 세탁하면서 성과가 난다고 착각하게 됩니다. 대조군도 고정했습니다. 기존 페이지를 손대지 않은 채 변형 A로 두고, 전체 실행 기간 동안 최소 20%의 트래픽을 보장해 나중에 비교할 홀드백 집단을 확보했습니다. 이 하한선이 없으면 선두가 나타난 순간 밴딧이 대조군의 트래픽을 고갈시켜 비교 대상이 사라집니다.
4–10일차: 변형을 만들고 학습을 기다립니다. 히어로 헤드라인과 핵심 CTA 카피, 소셜 프루프 블록의 순서를 바꾼 변형 4개를 초기값으로 넣었습니다. 첫 주는 밴딧의 탐색 단계입니다. 7일차 배분은 대조군과 변형 4개에 각각 22%, 19%, 21%, 18%, 20%로 거의 균등했습니다. 많은 운영자가 이 시점에 불안해하며 알고리즘을 “도와주려” 합니다. 그러지 않아야 합니다. 학습 도중 변형을 건드리면 사전분포가 초기화되어 한 주를 낭비합니다.
11–21일차: 재배분 곡선을 지켜봅니다. 12일차 무렵부터 밴딧의 기울기가 눈에 띄기 시작했습니다. 18일차에는 선두 변형이 트래픽의 41%를 가져갔고, 대조군은 하한선인 20%를 유지했습니다. 중간 변형 2개는 각각 약 15%, 최하위 변형은 10% 미만으로 제한됐습니다. 이것이 밴딧의 역할입니다. 패배 변형에 보내는 방문자는 모두 후회 비용이므로, 알고리즘은 이를 실시간으로 최소화합니다.
22–30일차: 고정하고 결정합니다. 문자 그대로의 변형이 아니라 승리한 방향을 고정했습니다. 더 짧은 히어로, 효익 중심 CTA, 첫 화면에 배치한 소셜 프루프라는 패턴입니다. 변형도 내보냈습니다. 30일차에 답해야 할 질문은 이것입니다. 승리 변형을 대조군과의 깔끔한 50/50 A/B 테스트로 승격해 이사회에 제시할 인과 수치를 확보할 것인가, 아니면 다음 변형 묶음에도 밴딧을 계속 돌릴 것인가?
전체 기간에 적용한 가드레일은 다음과 같습니다. 대조군에는 최소 20%의 트래픽을 보장했습니다. 어떤 변형이든 신뢰구간 하한이 대조군 대비 상대적으로 50% 낮은 상태를 48시간 넘게 보이면 중단하는 킬 스위치를 뒀습니다. 또한 트래픽 구성 변화를 매주 확인해 유료/오가닉 비율이 전주 대비 10포인트 넘게 움직이면 안정될 때까지 밴딧을 멈추기로 했습니다. 정상성이 깨진 트래픽은 소리 없이 실험을 망칩니다.
어트리뷰션 문제: 숨기지 말아야 할 핵심
목록형 글들이 다루지 않는 대목이며, 이 글을 쓴 유일한 이유입니다.
멀티암드 밴딧은 구조상 단일 변형에 대한 통계적 유의성을 제공할 수 없습니다. A/B 테스트의 통계적 장치인 p-value, 신뢰구간, 검정력 계산은 고정된 배분 규칙을 전제로 합니다. 반면 밴딧의 핵심 가치는 배분 규칙이 고정되지 않는다는 데 있습니다. 초기 데이터가 알려주는 방향에 맞춰 스스로 적응합니다. 결과에 따라 배분이 달라지는 순간 고전적 추론은 무너지고, 각 실험군의 표본에는 편향이 생깁니다. 전체 집단의 누적 전환은 여전히 측정할 수 있지만, 변형 B와 변형 A의 인과관계를 깔끔하게 주장할 수는 없습니다.
결함이 아니라 설계입니다. 밴딧은 다른 목표를 최적화합니다. 누적 후회를 최소화하고 누적 전환을 극대화하는 것입니다. 실증 비교에서는 정상성이 유지되는 문제에서 밴딧이 균등 배분 A/B 테스트보다 후회를 30–60% 줄이는 결과가 일관되게 나타납니다. 지표는 “더 적은 후회”이지, “변형 B에서 입증된 인과적 상승”이 아닙니다.
따라서 표현도 엄격히 구분해야 합니다.
- 방어 가능한 주장: “밴딧 배포 후 30일 동안 84,000명의 방문자를 기준으로 페이지 전환율은 4.62%였고, 같은 페이지의 직전 30일 전환율은 3.41%였다.”
- 방어할 수 없는 주장: “변형 B가 전환율을 35% 끌어올렸다.”
첫 문장은 누적 결과에 관한 설명입니다. 두 번째는 인과관계 주장인데, 밴딧만으로는 이를 입증할 수 없습니다.
절반쯤 해결한 방법은 20% 대조군 홀드백이었습니다. 원래 페이지에 30일 내내 최소 20%의 배분을 보장했기 때문에, 규모는 작지만 깔끔한 비교 집단이 남았습니다. 실행 기간 중 대조군 전환율은 3.38%로, 직전 30일의 기준선과 사실상 같았습니다. 비대조군의 전환율은 4.93%였습니다. 덕분에 상승이 계절성에 따른 착시가 아니라 실제라는 방향성은 확인할 수 있습니다. 물론 완전한 A/B 결과는 아닙니다. 비대조군 자체가 계속 달라지는 변형의 조합이기 때문입니다. 그래도 이사회에 “실행 결과가 내부 홀드백보다 좋았고, 격차는 이만큼이며, 여기까지는 주장할 수 있지만 그 이상은 아니다”라고 말하기에는 충분합니다.
방어 가능한 인과 수치가 필요하다면, 밴딧으로 유력한 방향을 찾은 다음 선두 변형을 대조군과의 50/50 A/B 테스트로 승격해야 합니다. 운영자의 후회 비용과 분석가의 증명 기준을 모두 존중하는 워크플로입니다.
효과가 없었던 사례
같은 플레이북을 적용했지만 일반 A/B 테스트보다 성과가 낮았던 페이지도 2개 있었습니다. 첫 번째는 트래픽이 적은 가격 페이지로, 하루 세션이 400회 미만이었습니다. 밴딧이 탐색 단계를 벗어나는 데 너무 오래 걸렸고 방향성 데이터도 잡음이 많았습니다. 6주간 단순한 50/50 A/B 테스트를 진행하니 운영 부담은 더 적고 답은 더 명확했습니다. 두 번째는 변형 노출 후 전환 이벤트가 3–5일 뒤에 발생하는 결제 흐름이었습니다. 밴딧은 피드백이 비교적 빨리 들어온다고 가정합니다. 노출과 결과 사이의 시차가 길면 오래된 데이터를 바탕으로 재배분하며 실체 없는 신호를 쫓게 됩니다.
생성된 변형 중에서는 Coframe 결과물의 약 40%를 제외했고, Webflow Optimize는 그보다 적은 비율을 제외했습니다. 문제의 징후는 익숙했습니다. 어울리지 않는 곳에 들어간 em dash, 상투적인 힘 있는 동사, 모델이 마케터처럼 들리려고 애쓰는 듯한 병렬 목록의 리듬이었습니다. 브랜드 보이스에서 미묘하게 이질적인 결과물은 트래픽에 노출되기 전에 모두 잘라냈습니다. 이 탈락률이 가격 페이지에서는 누구도 언급하지 않는 비용입니다.
3주차에는 트래픽의 비정상성이라는 함정에 빠질 뻔했습니다. Meta 캠페인이 확장되면서 4일 동안 유료 트래픽 비중이 30%에서 47%로 뛰었습니다. 밴딧의 선두 변형은 지금 유입되는 것과 다른 트래픽 구성에서 이기고 있었고, 선두의 전환율이 약해지기 시작했습니다. 밴딧을 48시간 멈추고 구성이 안정되기를 기다린 뒤 새로운 탐색으로 다시 시작했습니다. 계속 돌렸다면 일시적으로 달라진 오디언스에서 잘못된 교훈을 학습했을 것입니다.
반복해서 적용할 수 있는 원칙
이 페이지의 구체적인 맥락을 걷어내고 판단 기준만 일반화하면 다음과 같습니다.
확인하려는 상승 폭에 비해 트래픽이 부족하고, 방문자의 절반에게 패배 변형을 보여주는 비용이 무시할 수 없으며, 정해진 캠페인 기간 없이 페이지가 상시 운영되고, 단일 변형에 대한 방어 가능한 인과 수치보다 이번 분기의 누적 전환이 더 중요하다면 밴딧을 사용합니다. 손익을 책임지는 사람에게 상승 수치를 입증해야 하거나, 변경이 충분히 크고 드물어 적용 전에 명확한 결론이 필요하거나, 승리 변형을 다른 접점으로 확장할 계획이라 실제 효과를 확인해야 한다면 A/B 테스트를 사용합니다.
대부분의 운영자는 결국 둘 다 사용하게 됩니다. 홈페이지, 핵심 오퍼 페이지, 가입 흐름처럼 상시 운영되는 전환 접점에는 밴딧을 적용합니다. 가격, 포지셔닝, 히어로 개편처럼 방향을 결정하는 큰 승부에는 A/B 테스트를 적용합니다. 둘을 경쟁하는 방법론으로 취급하는 것이 잘못입니다. 최적화하는 목표가 서로 다릅니다. 목록형 글의 더 큰 오류는 밴딧을 통계적 대가가 없는 무료 업그레이드처럼 설명하는 것입니다. 그렇지 않습니다. 그 대가는 p-value이며, 알고도 지불하거나 아예 선택하지 않아야 합니다.
앞서 설명한 규모로 계속 운영할 때 드는 비용은 페이지 조회 100K 티어의 Webflow Optimize 월 $299입니다. 트래픽이 늘면 더 높은 티어가 필요합니다. 여기에 매주 운영자 반나절을 추가로 잡아 배분을 검토하고, 나쁜 변형을 중단하며, 정상성을 깨뜨리는 변화를 감시해야 합니다. 이것이 실제 비용입니다. 이 워크플로를 에이전시나 사내 그로스 조직에 도입하면서 CRM과 데이터 웨어하우스에 전환 어트리뷰션을 깔끔하게 연결하는 데 도움이 필요하다면 별도의 논의가 필요합니다. 하지만 밴딧 배포 자체는 운영자 한 명, 오후 한 번, 스크립트 태그 하나면 됩니다.
긴 글을 읽은 만큼 다음 단계도 하나만 제안합니다. AI 비즈니스 워크플로 감사 체크리스트는 어떤 접점에 밴딧을 적용할 수 있고, 어디에는 깔끔한 A/B 테스트가 필요한지 판단할 때 제가 쓰는 자료입니다. 툴을 고르기 전에 퍼널에 먼저 적용해 보세요. 툴부터 고르면 그로스 팀은 활용할 트래픽도 없는 기능에 비용을 내게 됩니다.
2026년 9월 5일







