Калькулятор A/B-тестов Mindbox: как спланировать эксперимент до запуска
Почему «победитель» теста испаряется после раскатки на всю базу и как 20 минут с калькулятором до запуска спасают эксперимент — с расчетами и разбором ошибок.
Знакомая картина: запустили в Mindbox тест темы письма, на второй день вариант Б показал +27% к открытиям, тест остановили, победителя раскатали на всю базу. Через месяц смотрите на цифры — открываемость та же, выручка та же. Куда делся прирост? Никуда. Его не существовало: на выборке в пару тысяч человек +27% — это шум, а не эффект.
Такие истории мы разбираем чуть ли не каждую неделю, и почти всегда корень один: эксперимент не был спланирован. Проблема решается за 20 минут до запуска, если заранее посчитать выборку и длительность. Как это сделать с помощью калькулятора A/B-тестов Mindbox и где при настройке эксперимента поджидают грабли, рассказывает Дарья Касаткина, CRM-маркетолог ClientCore.
ЧИТАЙТЕ ТАКЖЕ
«Вариант B выиграл на третий день теста — можно раскатывать? Скорее всего, вы смотрите на шум. Разбираем, как считать статистическую значимость A/B-теста и когда выводу можно верить.»
Классическая история: победитель, которого не было
Механика ложной победы простая. На малых числах случайность правит балом: в ветке А 1 200 человек и 28 заказов, в ветке Б 1 200 человек и 34 заказа. Разница выглядит внушительно — плюс 21% к конверсии. Но по факту это шесть лишних заказов. Шесть человек, которые могли купить в любом случае: день недели, зарплата, настроение.
Реальный эффект в email-экспериментах обычно скромнее — 5–15% относительных. Чтобы отличить такой эффект от шума, нужна выборка, которую почти никто не считает заранее. Отсюда главный симптом нездоровой культуры тестирования: «победители» находятся быстро и регулярно, а накопленный эффект за год — около нуля.
Самый частый разговор с новым клиентом: „мы тестировали, у нас ничего не работает“. Открываем историю экспериментов — там тесты на 1 500–3 000 человек, остановленные на второй-третий день. Для такой конверсии честный тест требует порядка десяти тысяч в каждой ветке. То есть выводов из этих экспериментов не было в принципе — только иллюзия выводов».
Дарья Касаткина
CRM-маркетолог, ClientCore
Что считает калькулятор A/B-тестов Mindbox и где его взять
Калькулятор A/B-тестов в Mindbox — инструмент планирования: вы вводите текущую конверсию метрики, прирост, который хотите уловить, и уровень значимости — а он отвечает, сколько человек должно попасть в каждую ветку эксперимента. Калькулятор доступен в базе знаний платформы, а та же логика встроена в сам mindbox аб тест: при запуске платформа следит за статистической значимостью и не объявляет победителя раньше времени — если не вмешиваться руками.
Зачем считать до запуска, если платформа сама покажет значимость? Затем, что калькулятор отвечает на вопрос, который интерфейс не задает: стоит ли вообще начинать. Если для ловли эффекта нужно 40 000 человек, а в живом сегменте их 8 000, эксперимент обречен. Лучше узнать это до недели работы, чем после.
Три цифры, которые калькулятор ждет от вас
Первая — базовая конверсия метрики. Берите из отчетов по кампаниям за последние 2–3 месяца: конверсия из доставленных в целевое действие. Если метрика плавает от 1,2% до 3,5% в зависимости от акций, тестируйте на обычной кампании; распродажа искривит базу для сравнения.
Вторая — минимальный детектируемый эффект, MDE. Здесь главная ловушка: чем тоньше эффект, тем больше нужна выборка, и зависимость квадратичная. Пример: конверсия в заказ 2%, вы хотите надежно заметить рост до 2,6% — калькулятор потребует примерно 10 000 человек в каждой ветке, 20 000 на весь тест. Хотите различить рост до 2,2%? Готовьте уже около 40 000. Именно на этом шаге половина затей с тестами честно умирает. И это хорошо — дешевле, чем умереть после месяца эксперимента.
Третья — уровни значимости и мощности. Стандарт индустрии: значимость 95%, мощность 80%. Опустить значимость до 90% ради скорости — значит согласиться, что каждый десятый «победитель» будет случайным. Для решений, которые раскатываются на всю базу, это дорогое согласие.
Как перевести выборку в длительность теста
Дальше арифметика. Для массовых рассылок: поделите нужный размер ветки на число людей, которые реально получат кампанию. Сегмент 12 000, сплит 50/50 — 6 000 на ветку за одну отправку. Нужно 10 000 — значит, тестовая механика должна прожить минимум две кампании. Для триггеров считают дневной поток: если через ветку брошенной корзины проходит 150 человек в день, на 10 000 уйдет больше двух месяцев. Это нормально — триггер тем временем продолжает продавать.
Два жестких правила. Дата остановки фиксируется до запуска и не переносится. И тест должен прожить полный недельный цикл: поведение базы во вторник и в субботу различается, короткий тест срежет эту разницу в случайную сторону.
Подглядывание убивает больше экспериментов, чем плохие гипотезы. Если проверять результаты каждый день и останавливаться, как только появилась значимость, реальный шанс ошибки вырастает с заявленных 5% до 20–30%. У нас правило: смотреть на цифры можно, останавливать — нельзя, пока не набрана выборка. Ругаемся, но держимся».
Дарья Касаткина
CRM-маркетолог, ClientCore
Норма
дата и условия остановки зафиксированы до старта
тест живет минимум один полный недельный цикл
решение принимается один раз — после набора выборки
Red flag
«во вторник было значимо, давайте остановим»
тест идет «пока не надоест»
победитель выбран по кликам, а что случилось с покупками — не проверили
Как настроить A/B-тест в Mindbox, когда расчет готов
Порядок работы в интерфейсе:
1. Создайте кампанию и включите A/B-тест. В массовых рассылках это штатный режим: база делится на тестовые ветки, победитель может автоматически уйти остальным. 2. Задайте размер веток. Сплит 50/50 набирает выборку быстрее всего. Если гипотеза рискованная — агрессивный оффер, новая механика — тестовую группу можно ужать до 20–30%. Помните: меньше ветка, длиннее тест. 3. Выберите метрику победителя до старта. Одну. Если цель — выручка, метрика должна стоять максимально близко к деньгам: конверсия в заказ. Открытия для этого не годятся. 4. Время теста берите из расчета — цифра из калькулятора, деленная на ваш трафик. 5. Заранее решите, что будет после: авторассылка победителя или ручной разбор. Для дорогих решений ручной разбор честнее — посмотрите срезы по сегментам, прежде чем раскатывать.
И отдельно про триггеры. В цепочках A/B-тест тоже настраивается, плюс там нужна контрольная группа — люди, которые не получают коммуникацию вообще. Без нее вы измеряете разницу между ветками, но вклад самого триггера в выручку остается неизвестным.
Ошибки, которые мы находим на аудитах
Когда мы проводим аудит CRM-маркетинга — для Tripster, например, разбирали весь контур в Mindbox, чтобы найти, где теряется выручка (кейс) — эксперименты всегда в списке проверок. И типовой набор проблем повторяется с завидной стабильностью.
Ошибка первая: в одном тесте меняют все сразу — тему, дизайн, время отправки. Разница между ветками есть, а понимания, чем она вызвана, нет. Следующий тест начинается с чистого листа.
Ошибка вторая: смешанные сегменты. В ветки попадают и активные покупатели, и «спящие» полтора года. Средний результат близок к нулю, и гипотезу хоронят — хотя внутри активного сегмента она могла дать двузначный прирост.
Ошибка третья: победителя выбирают по открытиям. После того как Apple включила Mail Privacy Protection, часть открытий на iOS «нарисованная» — клиент письмо не видел, а открытие засчитано. Для выводов годятся клики и конверсии.
Болезненный случай из практики: клиент тестировал оффер на всей базе, получил ноль и отключил механику. Когда мы пересчитали результаты по RFM-сегментам, выяснилось: у активных прирост был +18%, а спящие все съели в минус. Механику вернули — на правильном сегменте она продолжает зарабатывать».
Дарья Касаткина
CRM-маркетолог, ClientCore
Норма
один тест — одно изменение
метрика победителя близка к деньгам
у триггеров есть контрольная группа
Red flag
новая тема, новый дизайн и новое время отправки в одном тесте
победитель определен «по тому, что выросло»
вклад триггеров в выручку неизвестен, потому что контрольной группы нет
Базы мало: четыре рабочих хода
Если калькулятор показал 30 000 на тест, а в базе 9 000, это не приговор.
Поднимите MDE. Согласитесь ловить только крупные эффекты — 30–40% относительных. Слабые гипотезы отсеются сами, и это полезный фильтр: микрооптимизации темы письма редко стоят недели эксперимента.
Идите выше по воронке. Кликов в письме в разы больше, чем заказов, значит, выборка набирается быстрее. Но вывод по кликам проверяйте на конверсии, хотя бы вручную на больших числах: рост кликов с падением покупок встречается чаще, чем хотелось бы.
Копите выборку. Одинаковая механика теста в нескольких подряд кампаниях складывается в общую выборку — если сегмент и условия одинаковые, результаты агрегируются.
Переносите гипотезу туда, где трафик. Попапы и пуши часто дают заметно больше событий, чем email. Когда мы пересобирали логику рассылок для MINIDINO, ставку сделали на точность: гипотезы проверялись на конкретных сегментах вместо всей базы разом — и эффективность email выросла на 110% за квартал (кейс).
А если база совсем маленькая — честно признайте: количественные тесты вам пока недоступны. Тогда работают последовательные изменения с замером до/после и здравый смысл. Это слабее статистики, но сильнее, чем тест с ложным выводом.
ЧИТАЙТЕ ТАКЖЕ
«Без контрольной группы вы не знаете, сколько денег приносит CRM на самом деле. Разбираем, как настроить holdout и перестать приписывать себе чужую выручку.»
Какой минимальный размер базы нужен для A/B-теста в Mindbox?
Зависит от конверсии метрики и эффекта, который хотите поймать. Ориентир: при конверсии в заказ около 2% и желаемом приросте 20–30% относительных нужно порядка 20 000 контактов на эксперимент. База меньше — тестируйте крупные эффекты или метрики выше по воронке.
Можно ли остановить тест раньше, если один вариант явно лидирует?
Почти всегда — нет. Разрыв на второй-третий день обычно шум, и ранняя остановка ведет к ложному победителю. Исключения: вариант вредит бизнесу прямо сейчас (битые ссылки, ошибка в цене) или эффект в 2–3 раза превышает MDE и держится несколько дней подряд.
Что тестировать в первую очередь: тему, время отправки или оффер?
Оффер и механику — они ближе всего к выручке. Тема влияет на открытия, а открытия после введения MPP у Apple — зашумленная метрика. Порядок, который мы используем: оффер, затем структура и контент письма, тема — в последнюю очередь.
Работают ли A/B-тесты в триггерных цепочках Mindbox?
Да, в цепочках доступны тесты веток и контрольные группы. Разница с массовыми рассылками в скорости: выборка копится дневным потоком, поэтому длительность считайте в неделях и месяцах. Зато триггерный тест не требует отдельных кампаний — он крутится в фоне и не отвлекает команду.