Как настроить A/B-тест в Mindbox: пошаговая инструкция и подводные камни платформы

Пошаговая настройка A/B-теста в Mindbox: массовые рассылки и сценарии. Разбираем, где платформа режет выборку и искажает результат, и как это компенсировать в дизайне эксперимента.

Два конверта на расходящейся дорожке, воронка с карточками, дорожный знак и график. 3D-иллюстрация

Тема письма B победила с отрывом в 18% по открытиям. Через две недели ее раскатали на всю базу — и получили цифры хуже, чем у старой версии. С командами, которые запускают mindbox ab тестирование «по инструкции платформы», такое случается регулярно. Инструмент считает честно. Ломается все раньше — на дизайне эксперимента.

Ниже — как настроить ab тест в mindbox по шагам: и в массовой рассылке, и в триггерном сценарии. И отдельно — места, где платформа сама, без предупреждения, сужает и смещает вашу выборку, плюс способы это компенсировать. Разбирает Екатерина Чернова, CRM-маркетолог ClientCore: она ведет CRM-проекты на Mindbox и не раз переделывала эксперименты, чьи результаты не сходились при повторном запуске.

ЧИТАЙТЕ ТАКЖЕ

«Скидка 10%, бонусы или подарок к заказу — что принесет больше маржи? Разбираем методику A/B-теста промокодов: от гипотезы и выборки до подсчета uplift по деньгам.»

A/B-тест промокодов: как выбрать механику акции и не раздать маржу

Что умеет A/B-тестирование в Mindbox

Тесты живут в двух местах, и логика работы с ними разная.

Первое место — массовые рассылки. Внутри кампании создаются варианты письма: другая тема, другой контент, другое имя отправителя. Платформа отправляет варианты части аудитории, ждет заданное время, определяет победителя по выбранной метрике и докатывает его на остаток базы.

Второе — сценарии. В триггерную цепочку добавляется блок А/Б-теста: он случайно делит поток клиентов на ветки в заданной пропорции. Здесь тестируют уже цепочки целиком — разные серии писем, каналы, паузы между касаниями.

Отдельно стоит глобальная контрольная группа. Она отвечает на другой вопрос — сколько денег приносит CRM-канал сам по себе. Путать ее с тестом вариантов не стоит.

Настройка теста в массовой рассылке: шесть шагов

1. Сформулируйте гипотезу в одну переменную. «Новая тема поднимет открытия» — годится. «Новая тема и пересобранный баннер поднимут продажи» — нет: если сработает, вы не узнаете, что именно. 2. Соберите рассылку и включите А/Б-тест в настройках кампании. 3. Добавьте варианты. Вариант A — текущая версия, она же контроль. Вариант B — копия с одним изменением. 4. Задайте долю тестовой группы. Рабочий стандарт — 20–30% базы на тест, остаток получит победителя. 5. Выберите метрику победителя и длительность теста. Для темы письма — клики и 4 часа минимум. Для оффера — конверсия и сутки. 6. Запустите и до конца теста не трогайте ничего: ни варианты, ни сегмент, ни время отправки.

Чаще всего тест ломается на первом шаге: меняют тему, прехедер и главный баннер разом. Вариант B выигрывает по кликам — и никто не понимает, что из этого переиспользовать в следующей кампании. Одна переменная за тест, иначе эксперимент ничему не учит.
Екатерина Чернова

Екатерина Чернова

CRM-маркетолог, ClientCore

Тест в сценарии: настройка и две особенности

Порядок действий простой:

1. Откройте сценарий и добавьте блок А/Б-теста в нужной точке цепочки. 2. Задайте пропорцию веток — для двух вариантов это 50/50. 3. Постройте ветки. Например, в A — серия из двух писем, в B — одно письмо и пуш. 4. Запустите сценарий и ждите, пока через блок пройдет достаточно клиентов.

Дальше начинаются особенности. Первая: поток через триггер идет медленно. Если брошенную корзину оставляют 300 человек в день, каждая ветка набирает по 150 — до статистически честного вывода пройдут недели. Вторая: правки сценария на лету смешивают когорты. Клиенты, прошедшие блок до изменения и после, попадают в один отчет, и разделить их уже нельзя.

Триггеры при этом отличный полигон для экспериментов: поток стабильный, когорты сопоставимые. Когда мы перезапускали email-маркетинг для AR Fashion, именно триггерные рассылки дали +1063% к выручке канала (кейс) — на таком объеме тесты внутри сценариев набирают значимость за вменяемый срок.

Норма
  • ветки отличаются одним изменением, пропорция 50/50
  • сценарий не правят, пока не набран объем
  • решение принимают по заранее заданному числу наблюдений
Red flag
  • в ветках различаются и оффер, и канал, и число касаний
  • сценарий меняют «по ходу», а отчет смотрят суммарно
  • выводы делают по паре сотен прохождений на ветку

Где Mindbox режет выборку

Теперь главное — что платформа делает с экспериментом без вашего ведома.

Живой сегмент. Массовая рассылка пересчитывает сегмент перед каждой отправкой. Между тестом и докаткой проходят часы, и состав остатка уже другой: кто-то вошел в сегмент, кто-то вышел. Сравнивать «тест» и «остаток» как единую выборку некорректно.

Случайное деление без выравнивания. Платформа раскидывает клиентов по вариантам случайно, но не балансирует группы по признакам. На больших объемах все выровняется само. На сегменте в 2 000 человек в вариант B легко попадет лишняя доля «горячих» клиентов — и он победит незаслуженно.

Докатка в другое время. Победитель уходит остатку через 4–24 часа после старта. Утренний тест и вечерняя докатка живут в разном контексте: другая открываемость, другое настроение аудитории. Метрика победителя на остатке почти всегда отличается от тестовой, и причина тут — время отправки.

Открытия как метрика. После Apple Mail Privacy Protection открытия у заметной части базы фиксируются автоматически, без реального просмотра. Тест тем по open rate сегодня измеряет не интерес читателя, а долю Apple-почты в сегменте.

Отчет без статистики. Mindbox покажет цифры по вариантам и подсветит лидера, но не скажет, значима ли разница. 52% против 48% на выборке в 400 человек — это шум, а в отчете будет «победитель».

Нет нарезки по сегментам. Отчет по тесту — одна таблица на всю аудиторию. Выиграл ли вариант у новых клиентов, но проиграл постоянным — отсюда не видно. Придется смотреть через выгрузки и ручное сравнение сегментов.

Классика: тест на 15% базы в четверг в 10:00, докатка победителя в пятницу утром. Команда смотрит суммарную конверсию кампании и удивляется, почему она ниже обычной рассылки. Пятничная докатка съела эффект, а вывод сделали про вариант письма. Теперь мы докатку всегда оцениваем отдельной строкой.
Екатерина Чернова

Екатерина Чернова

CRM-маркетолог, ClientCore

Результаты тестов не воспроизводятся от рассылки к рассылке?

Найдём, где в вашем Mindbox ломается выборка, и соберём дизайн эксперимента, которому можно верить

🇷🇺

Сколько людей нужно для чистого результата

Считается без статистических пакетов, хватает правила 16: n = 16 · p · (1 − p) / Δ², где p — базовая конверсия, а Δ — минимальный эффект, который хотите разглядеть.

Пример. Конверсия рассылки в заказ — 5%, нужно заметить рост до 6%. Считаем: 16 · 0,05 · 0,95 / 0,01² = 7 600 человек на ветку, то есть около 15 тысяч на тест. Если в сегменте 3 000 контактов, ответ честный: такой эффект вы здесь не увидите. Варианты — расширить сегмент, тестировать более грубое изменение (сильный оффер против слабого) или копить наблюдения в триггере несколько недель.

Отсюда следует и правило про число вариантов. Каждый дополнительный делит выборку и умножает шанс случайного победителя. Три варианта при той же базе требуют уже около 23 тысяч человек — плюс поправка на множественные сравнения.

Мой рабочий порог — 300–400 целевых действий на ветку. При конверсии 2% это 15–20 тысяч контактов на тест. Меньшая база — не приговор: переносим эксперимент в триггер и копим месяц. Зато вывод один и честный, а не три „победителя“ за квартал, где каждый опровергает предыдущего.
Екатерина Чернова

Екатерина Чернова

CRM-маркетолог, ClientCore

Как компенсировать ограничения: чек-лист дизайна

Что реально работает поверх платформы:

  • Заморозьте аудиторию. Перед тестом выгрузите сегмент в статический список и запускайте кампанию на нем. Пересчет живого сегмента перестанет плыть.
  • Проверьте раскладку. Сравните ветки по доле активных клиентов, среднему чеку, RFM-составу. Перекос виден до запуска, а не после.
  • Метрика — клики или конверсия. Открытия оставьте вспомогательным сигналом.
  • Зафиксируйте длительность до старта. «Останавливаемся в среду в 12:00, что бы ни показал отчет». Подглядывание и остановка «когда стало красиво» — частый источник ложных побед.
  • Оценивайте докатку отдельно. Тест — одна строка в отчете, докатка — другая. Средняя по кампании прячет обе.
  • Реплицируйте крупные выводы. Новый шаблон или механику подтвердите повторным тестом на другой неделе, прежде чем раскатывать на всю базу.

Отдельный пункт — однородность аудитории. Чем понятнее сегмент, тем меньше шума в выборке. Мы видели это на проекте MINIDINO: рассылки уходили всей базе разом, мы пересобрали логику вокруг точных сегментов — эффективность email выросла на 110% за квартал без роста числа отправок (кейс). Для экспериментов вывод прямой: узкий однородный сегмент дает чистый сигнал, а «вся база сразу» — грязный.

ЧИТАЙТЕ ТАКЖЕ

«Блок рекомендаций дал +20% к кликам в тесте, а выручка не сдвинулась? Разбираем, как отделить эффект данных от эффекта шаблона в A/B-тестах персонализации.»

A/B-тест персонализации: как отделить эффект контента от эффекта шаблона

Тесты есть, а роста выручки от них нет?

Выстроим A/B-тестирование в вашем Mindbox как систему: гипотезы, статистика, регулярные циклы

🇷🇺

Часто задаваемые вопросы

Сколько вариантов можно добавить в mindbox аб тест?

Технически — несколько. Практически — держите два. Каждый лишний вариант дробит выборку и повышает шанс, что победит случайный. Три варианта оправданы на базе от 30–50 тысяч контактов и с поправкой на множественные сравнения.

Можно ли тестировать время отправки?

Можно, но аккуратно. Делите всю аудиторию 50/50 и отправляйте варианты в один день в разные часы. Схема «тест на части базы, потом докатка победителя» здесь не работает: докатка сама является отправкой в другое время, сравнивать просто нечего.

Что делать, если база меньше 10 тысяч контактов?

Переносить тесты из массовых рассылок в триггерные сценарии и копить наблюдения неделями. Тестировать грубые изменения: оффер, механику, число касаний — разница в 30–50% видна и на малых объемах. Тонкие эффекты вроде «+0,3 п.п. к конверсии» малой базе недоступны, с этим лучше смириться до старта.

Чем A/B-тест отличается от контрольной группы?

A/B-тест сравнивает варианты коммуникации между собой: какая тема, оффер или цепочка работает лучше. Контрольная группа части клиентов не отправляет ничего и отвечает на вопрос, сколько выручки канал приносит сверх органики. В Mindbox это разные механики, и настраиваются они отдельно.

Над проектом работали

Екатерина Чернова

Екатерина Чернова

CRM-маркетолог, ClientCore