# Как настроить A/B-тест в Mindbox: пошаговая инструкция и подводные камни платформы

> Пошаговая настройка A/B-теста в Mindbox: массовые рассылки и сценарии. Разбираем, где платформа режет выборку и искажает результат, и как это компенсировать в дизайне эксперимента.

**Рубрика:** Статьи  
**Автор:** Екатерина Чернова, CRM-маркетолог, ClientCore  
**Дата:** 2026-09-19

Тема письма B победила с отрывом в 18% по открытиям. Через две недели ее раскатали на всю базу — и получили цифры хуже, чем у старой версии. С командами, которые запускают mindbox ab тестирование «по инструкции платформы», такое случается регулярно. Инструмент считает честно. Ломается все раньше — на дизайне эксперимента.

Ниже — как настроить ab тест в mindbox по шагам: и в массовой рассылке, и в триггерном сценарии. И отдельно — места, где платформа сама, без предупреждения, сужает и смещает вашу выборку, плюс способы это компенсировать. Разбирает Екатерина Чернова, CRM-маркетолог ClientCore: она ведет CRM-проекты на Mindbox и не раз переделывала эксперименты, чьи результаты не сходились при повторном запуске.

> **Читайте также:** [A/B-тест промокодов: как выбрать механику акции и не раздать маржу](https://clientcore.ru/blog/articles/a-b-test-promokodov-kak-vybrat-mehaniku-akcii-i-ne-razdat-marzhu)

## Что умеет A/B-тестирование в Mindbox

Тесты живут в двух местах, и логика работы с ними разная.

Первое место — массовые рассылки. Внутри кампании создаются варианты письма: другая тема, другой контент, другое имя отправителя. Платформа отправляет варианты части аудитории, ждет заданное время, определяет победителя по выбранной метрике и докатывает его на остаток базы.

Второе — сценарии. В триггерную цепочку добавляется блок А/Б-теста: он случайно делит поток клиентов на ветки в заданной пропорции. Здесь тестируют уже цепочки целиком — разные серии писем, каналы, паузы между касаниями.

Отдельно стоит глобальная контрольная группа. Она отвечает на другой вопрос — сколько денег приносит CRM-канал сам по себе. Путать ее с тестом вариантов не стоит.

## Настройка теста в массовой рассылке: шесть шагов

1. Сформулируйте гипотезу в одну переменную. «Новая тема поднимет открытия» — годится. «Новая тема и пересобранный баннер поднимут продажи» — нет: если сработает, вы не узнаете, что именно. 2. Соберите рассылку и включите А/Б-тест в настройках кампании. 3. Добавьте варианты. Вариант A — текущая версия, она же контроль. Вариант B — копия с одним изменением. 4. Задайте долю тестовой группы. Рабочий стандарт — 20–30% базы на тест, остаток получит победителя. 5. Выберите метрику победителя и длительность теста. Для темы письма — клики и 4 часа минимум. Для оффера — конверсия и сутки. 6. Запустите и до конца теста не трогайте ничего: ни варианты, ни сегмент, ни время отправки.

> Чаще всего тест ломается на первом шаге: меняют тему, прехедер и главный баннер разом. Вариант B выигрывает по кликам — и никто не понимает, что из этого переиспользовать в следующей кампании. Одна переменная за тест, иначе эксперимент ничему не учит.
>
> — Екатерина Чернова, CRM-маркетолог, ClientCore

## Тест в сценарии: настройка и две особенности

Порядок действий простой:

1. Откройте сценарий и добавьте блок А/Б-теста в нужной точке цепочки. 2. Задайте пропорцию веток — для двух вариантов это 50/50. 3. Постройте ветки. Например, в A — серия из двух писем, в B — одно письмо и пуш. 4. Запустите сценарий и ждите, пока через блок пройдет достаточно клиентов.

Дальше начинаются особенности. Первая: поток через триггер идет медленно. Если брошенную корзину оставляют 300 человек в день, каждая ветка набирает по 150 — до статистически честного вывода пройдут недели. Вторая: правки сценария на лету смешивают когорты. Клиенты, прошедшие блок до изменения и после, попадают в один отчет, и разделить их уже нельзя.

Триггеры при этом отличный полигон для экспериментов: поток стабильный, когорты сопоставимые. Когда мы перезапускали email-маркетинг для AR Fashion, именно триггерные рассылки дали +1063% к выручке канала ([кейс](https://clientcore.ru/blog/articles/keis-ar-fashion-rost-vyruchki-email)) — на таком объеме тесты внутри сценариев набирают значимость за вменяемый срок.

**Норма**

- ветки отличаются одним изменением, пропорция 50/50
- сценарий не правят, пока не набран объем
- решение принимают по заранее заданному числу наблюдений

**Red flag**

- в ветках различаются и оффер, и канал, и число касаний
- сценарий меняют «по ходу», а отчет смотрят суммарно
- выводы делают по паре сотен прохождений на ветку

## Где Mindbox режет выборку

Теперь главное — что платформа делает с экспериментом без вашего ведома.

**Живой сегмент.** Массовая рассылка пересчитывает сегмент перед каждой отправкой. Между тестом и докаткой проходят часы, и состав остатка уже другой: кто-то вошел в сегмент, кто-то вышел. Сравнивать «тест» и «остаток» как единую выборку некорректно.

**Случайное деление без выравнивания.** Платформа раскидывает клиентов по вариантам случайно, но не балансирует группы по признакам. На больших объемах все выровняется само. На сегменте в 2 000 человек в вариант B легко попадет лишняя доля «горячих» клиентов — и он победит незаслуженно.

**Докатка в другое время.** Победитель уходит остатку через 4–24 часа после старта. Утренний тест и вечерняя докатка живут в разном контексте: другая открываемость, другое настроение аудитории. Метрика победителя на остатке почти всегда отличается от тестовой, и причина тут — время отправки.

**Открытия как метрика.** После Apple Mail Privacy Protection открытия у заметной части базы фиксируются автоматически, без реального просмотра. Тест тем по open rate сегодня измеряет не интерес читателя, а долю Apple-почты в сегменте.

**Отчет без статистики.** Mindbox покажет цифры по вариантам и подсветит лидера, но не скажет, значима ли разница. 52% против 48% на выборке в 400 человек — это шум, а в отчете будет «победитель».

**Нет нарезки по сегментам.** Отчет по тесту — одна таблица на всю аудиторию. Выиграл ли вариант у новых клиентов, но проиграл постоянным — отсюда не видно. Придется смотреть через выгрузки и ручное сравнение сегментов.

> Классика: тест на 15% базы в четверг в 10:00, докатка победителя в пятницу утром. Команда смотрит суммарную конверсию кампании и удивляется, почему она ниже обычной рассылки. Пятничная докатка съела эффект, а вывод сделали про вариант письма. Теперь мы докатку всегда оцениваем отдельной строкой.
>
> — Екатерина Чернова, CRM-маркетолог, ClientCore

## Сколько людей нужно для чистого результата

Считается без статистических пакетов, хватает правила 16: n = 16 · p · (1 − p) / Δ², где p — базовая конверсия, а Δ — минимальный эффект, который хотите разглядеть.

Пример. Конверсия рассылки в заказ — 5%, нужно заметить рост до 6%. Считаем: 16 · 0,05 · 0,95 / 0,01² = 7 600 человек на ветку, то есть около 15 тысяч на тест. Если в сегменте 3 000 контактов, ответ честный: такой эффект вы здесь не увидите. Варианты — расширить сегмент, тестировать более грубое изменение (сильный оффер против слабого) или копить наблюдения в триггере несколько недель.

Отсюда следует и правило про число вариантов. Каждый дополнительный делит выборку и умножает шанс случайного победителя. Три варианта при той же базе требуют уже около 23 тысяч человек — плюс поправка на множественные сравнения.

> Мой рабочий порог — 300–400 целевых действий на ветку. При конверсии 2% это 15–20 тысяч контактов на тест. Меньшая база — не приговор: переносим эксперимент в триггер и копим месяц. Зато вывод один и честный, а не три „победителя“ за квартал, где каждый опровергает предыдущего.
>
> — Екатерина Чернова, CRM-маркетолог, ClientCore

## Как компенсировать ограничения: чек-лист дизайна

Что реально работает поверх платформы:

- **Заморозьте аудиторию.** Перед тестом выгрузите сегмент в статический список и запускайте кампанию на нем. Пересчет живого сегмента перестанет плыть.
- **Проверьте раскладку.** Сравните ветки по доле активных клиентов, среднему чеку, RFM-составу. Перекос виден до запуска, а не после.
- **Метрика — клики или конверсия.** Открытия оставьте вспомогательным сигналом.
- **Зафиксируйте длительность до старта.** «Останавливаемся в среду в 12:00, что бы ни показал отчет». Подглядывание и остановка «когда стало красиво» — частый источник ложных побед.
- **Оценивайте докатку отдельно.** Тест — одна строка в отчете, докатка — другая. Средняя по кампании прячет обе.
- **Реплицируйте крупные выводы.** Новый шаблон или механику подтвердите повторным тестом на другой неделе, прежде чем раскатывать на всю базу.

Отдельный пункт — однородность аудитории. Чем понятнее сегмент, тем меньше шума в выборке. Мы видели это на проекте MINIDINO: рассылки уходили всей базе разом, мы пересобрали логику вокруг точных сегментов — эффективность email выросла на 110% за квартал без роста числа отправок ([кейс](https://clientcore.ru/blog/articles/keis-minidino-rost-effektivnosti-email)). Для экспериментов вывод прямой: узкий однородный сегмент дает чистый сигнал, а «вся база сразу» — грязный.

> **Читайте также:** [A/B-тест персонализации: как отделить эффект контента от эффекта шаблона](https://clientcore.ru/blog/articles/a-b-test-personalizacii-kak-otdelit-effekt-kontenta-ot-effekta-shablona)

---

[Открыть статью на сайте](https://clientcore.ru/blog/articles/kak-nastroit-a-b-test-v-mindbox-poshagovaya-instrukciya-i-podvodnye-kamni-platformy)
