ClientCoreБлогНа сайт

Калькулятор A/B-тестов Mindbox: как спланировать эксперимент до запуска

Почему «победитель» теста испаряется после раскатки на всю базу и как 20 минут с калькулятором до запуска спасают эксперимент — с расчетами и разбором ошибок.

Знакомая картина: запустили в Mindbox тест темы письма, на второй день вариант Б показал +27% к открытиям, тест остановили, победителя раскатали на всю базу. Через месяц смотрите на цифры — открываемость та же, выручка та же. Куда делся прирост? Никуда. Его не существовало: на выборке в пару тысяч человек +27% — это шум, а не эффект.

Такие истории мы разбираем чуть ли не каждую неделю, и почти всегда корень один: эксперимент не был спланирован. Проблема решается за 20 минут до запуска, если заранее посчитать выборку и длительность. Как это сделать с помощью калькулятора A/B-тестов Mindbox и где при настройке эксперимента поджидают грабли, рассказывает Дарья Касаткина, CRM-маркетолог ClientCore.

ЧИТАЙТЕ ТАКЖЕ

«Вариант B выиграл на третий день теста — можно раскатывать? Скорее всего, вы смотрите на шум. Разбираем, как считать статистическую значимость A/B-теста и когда выводу можно верить.»

Статистическая значимость A/B-теста: как не принять решение по шуму

Классическая история: победитель, которого не было

Механика ложной победы простая. На малых числах случайность правит балом: в ветке А 1 200 человек и 28 заказов, в ветке Б 1 200 человек и 34 заказа. Разница выглядит внушительно — плюс 21% к конверсии. Но по факту это шесть лишних заказов. Шесть человек, которые могли купить в любом случае: день недели, зарплата, настроение.

Реальный эффект в email-экспериментах обычно скромнее — 5–15% относительных. Чтобы отличить такой эффект от шума, нужна выборка, которую почти никто не считает заранее. Отсюда главный симптом нездоровой культуры тестирования: «победители» находятся быстро и регулярно, а накопленный эффект за год — около нуля.

Самый частый разговор с новым клиентом: „мы тестировали, у нас ничего не работает“. Открываем историю экспериментов — там тесты на 1 500–3 000 человек, остановленные на второй-третий день. Для такой конверсии честный тест требует порядка десяти тысяч в каждой ветке. То есть выводов из этих экспериментов не было в принципе — только иллюзия выводов».
Дарья Касаткина

Дарья Касаткина

CRM-маркетолог, ClientCore

Что считает калькулятор A/B-тестов Mindbox и где его взять

Калькулятор A/B-тестов в Mindbox — инструмент планирования: вы вводите текущую конверсию метрики, прирост, который хотите уловить, и уровень значимости — а он отвечает, сколько человек должно попасть в каждую ветку эксперимента. Калькулятор доступен в базе знаний платформы, а та же логика встроена в сам mindbox аб тест: при запуске платформа следит за статистической значимостью и не объявляет победителя раньше времени — если не вмешиваться руками.

Зачем считать до запуска, если платформа сама покажет значимость? Затем, что калькулятор отвечает на вопрос, который интерфейс не задает: стоит ли вообще начинать. Если для ловли эффекта нужно 40 000 человек, а в живом сегменте их 8 000, эксперимент обречен. Лучше узнать это до недели работы, чем после.

Тесты регулярно находят «победителей», а выручка стоит на месте?

Посмотрим ваши прошлые эксперименты и покажем, какие выводы из них были шумом

🇷🇺

Три цифры, которые калькулятор ждет от вас

Первая — базовая конверсия метрики. Берите из отчетов по кампаниям за последние 2–3 месяца: конверсия из доставленных в целевое действие. Если метрика плавает от 1,2% до 3,5% в зависимости от акций, тестируйте на обычной кампании; распродажа искривит базу для сравнения.

Вторая — минимальный детектируемый эффект, MDE. Здесь главная ловушка: чем тоньше эффект, тем больше нужна выборка, и зависимость квадратичная. Пример: конверсия в заказ 2%, вы хотите надежно заметить рост до 2,6% — калькулятор потребует примерно 10 000 человек в каждой ветке, 20 000 на весь тест. Хотите различить рост до 2,2%? Готовьте уже около 40 000. Именно на этом шаге половина затей с тестами честно умирает. И это хорошо — дешевле, чем умереть после месяца эксперимента.

Третья — уровни значимости и мощности. Стандарт индустрии: значимость 95%, мощность 80%. Опустить значимость до 90% ради скорости — значит согласиться, что каждый десятый «победитель» будет случайным. Для решений, которые раскатываются на всю базу, это дорогое согласие.

Как перевести выборку в длительность теста

Дальше арифметика. Для массовых рассылок: поделите нужный размер ветки на число людей, которые реально получат кампанию. Сегмент 12 000, сплит 50/50 — 6 000 на ветку за одну отправку. Нужно 10 000 — значит, тестовая механика должна прожить минимум две кампании. Для триггеров считают дневной поток: если через ветку брошенной корзины проходит 150 человек в день, на 10 000 уйдет больше двух месяцев. Это нормально — триггер тем временем продолжает продавать.

Два жестких правила. Дата остановки фиксируется до запуска и не переносится. И тест должен прожить полный недельный цикл: поведение базы во вторник и в субботу различается, короткий тест срежет эту разницу в случайную сторону.

Подглядывание убивает больше экспериментов, чем плохие гипотезы. Если проверять результаты каждый день и останавливаться, как только появилась значимость, реальный шанс ошибки вырастает с заявленных 5% до 20–30%. У нас правило: смотреть на цифры можно, останавливать — нельзя, пока не набрана выборка. Ругаемся, но держимся».
Дарья Касаткина

Дарья Касаткина

CRM-маркетолог, ClientCore

Норма
  • дата и условия остановки зафиксированы до старта
  • тест живет минимум один полный недельный цикл
  • решение принимается один раз — после набора выборки
Red flag
  • «во вторник было значимо, давайте остановим»
  • тест идет «пока не надоест»
  • победитель выбран по кликам, а что случилось с покупками — не проверили

Как настроить A/B-тест в Mindbox, когда расчет готов

Порядок работы в интерфейсе:

1. Создайте кампанию и включите A/B-тест. В массовых рассылках это штатный режим: база делится на тестовые ветки, победитель может автоматически уйти остальным. 2. Задайте размер веток. Сплит 50/50 набирает выборку быстрее всего. Если гипотеза рискованная — агрессивный оффер, новая механика — тестовую группу можно ужать до 20–30%. Помните: меньше ветка, длиннее тест. 3. Выберите метрику победителя до старта. Одну. Если цель — выручка, метрика должна стоять максимально близко к деньгам: конверсия в заказ. Открытия для этого не годятся. 4. Время теста берите из расчета — цифра из калькулятора, деленная на ваш трафик. 5. Заранее решите, что будет после: авторассылка победителя или ручной разбор. Для дорогих решений ручной разбор честнее — посмотрите срезы по сегментам, прежде чем раскатывать.

И отдельно про триггеры. В цепочках A/B-тест тоже настраивается, плюс там нужна контрольная группа — люди, которые не получают коммуникацию вообще. Без нее вы измеряете разницу между ветками, но вклад самого триггера в выручку остается неизвестным.

Ошибки, которые мы находим на аудитах

Когда мы проводим аудит CRM-маркетинга — для Tripster, например, разбирали весь контур в Mindbox, чтобы найти, где теряется выручка (кейс) — эксперименты всегда в списке проверок. И типовой набор проблем повторяется с завидной стабильностью.

Ошибка первая: в одном тесте меняют все сразу — тему, дизайн, время отправки. Разница между ветками есть, а понимания, чем она вызвана, нет. Следующий тест начинается с чистого листа.

Ошибка вторая: смешанные сегменты. В ветки попадают и активные покупатели, и «спящие» полтора года. Средний результат близок к нулю, и гипотезу хоронят — хотя внутри активного сегмента она могла дать двузначный прирост.

Ошибка третья: победителя выбирают по открытиям. После того как Apple включила Mail Privacy Protection, часть открытий на iOS «нарисованная» — клиент письмо не видел, а открытие засчитано. Для выводов годятся клики и конверсии.

Болезненный случай из практики: клиент тестировал оффер на всей базе, получил ноль и отключил механику. Когда мы пересчитали результаты по RFM-сегментам, выяснилось: у активных прирост был +18%, а спящие все съели в минус. Механику вернули — на правильном сегменте она продолжает зарабатывать».
Дарья Касаткина

Дарья Касаткина

CRM-маркетолог, ClientCore

Норма
  • один тест — одно изменение
  • метрика победителя близка к деньгам
  • у триггеров есть контрольная группа
Red flag
  • новая тема, новый дизайн и новое время отправки в одном тесте
  • победитель определен «по тому, что выросло»
  • вклад триггеров в выручку неизвестен, потому что контрольной группы нет

Базы мало: четыре рабочих хода

Если калькулятор показал 30 000 на тест, а в базе 9 000, это не приговор.

Поднимите MDE. Согласитесь ловить только крупные эффекты — 30–40% относительных. Слабые гипотезы отсеются сами, и это полезный фильтр: микрооптимизации темы письма редко стоят недели эксперимента.

Идите выше по воронке. Кликов в письме в разы больше, чем заказов, значит, выборка набирается быстрее. Но вывод по кликам проверяйте на конверсии, хотя бы вручную на больших числах: рост кликов с падением покупок встречается чаще, чем хотелось бы.

Копите выборку. Одинаковая механика теста в нескольких подряд кампаниях складывается в общую выборку — если сегмент и условия одинаковые, результаты агрегируются.

Переносите гипотезу туда, где трафик. Попапы и пуши часто дают заметно больше событий, чем email. Когда мы пересобирали логику рассылок для MINIDINO, ставку сделали на точность: гипотезы проверялись на конкретных сегментах вместо всей базы разом — и эффективность email выросла на 110% за квартал (кейс).

А если база совсем маленькая — честно признайте: количественные тесты вам пока недоступны. Тогда работают последовательные изменения с замером до/после и здравый смысл. Это слабее статистики, но сильнее, чем тест с ложным выводом.

ЧИТАЙТЕ ТАКЖЕ

«Без контрольной группы вы не знаете, сколько денег приносит CRM на самом деле. Разбираем, как настроить holdout и перестать приписывать себе чужую выручку.»

Holdout-группа: зачем намеренно не отправлять письма части базы

Калькулятор говорит, что выборки не хватает?

Спланируем эксперименты под ваш реальный трафик: какие гипотезы брать, на каких сегментах и с какой длительностью

🇷🇺

Часто задаваемые вопросы

Какой минимальный размер базы нужен для A/B-теста в Mindbox?

Зависит от конверсии метрики и эффекта, который хотите поймать. Ориентир: при конверсии в заказ около 2% и желаемом приросте 20–30% относительных нужно порядка 20 000 контактов на эксперимент. База меньше — тестируйте крупные эффекты или метрики выше по воронке.

Можно ли остановить тест раньше, если один вариант явно лидирует?

Почти всегда — нет. Разрыв на второй-третий день обычно шум, и ранняя остановка ведет к ложному победителю. Исключения: вариант вредит бизнесу прямо сейчас (битые ссылки, ошибка в цене) или эффект в 2–3 раза превышает MDE и держится несколько дней подряд.

Что тестировать в первую очередь: тему, время отправки или оффер?

Оффер и механику — они ближе всего к выручке. Тема влияет на открытия, а открытия после введения MPP у Apple — зашумленная метрика. Порядок, который мы используем: оффер, затем структура и контент письма, тема — в последнюю очередь.

Работают ли A/B-тесты в триггерных цепочках Mindbox?

Да, в цепочках доступны тесты веток и контрольные группы. Разница с массовыми рассылками в скорости: выборка копится дневным потоком, поэтому длительность считайте в неделях и месяцах. Зато триггерный тест не требует отдельных кампаний — он крутится в фоне и не отвлекает команду.

Над проектом работали

Дарья Касаткина

Дарья Касаткина

CRM-маркетолог, ClientCore