# Калькулятор A/B-тестов Mindbox: как спланировать эксперимент до запуска

> Почему «победитель» теста испаряется после раскатки на всю базу и как 20 минут с калькулятором до запуска спасают эксперимент — с расчетами и разбором ошибок.

**Рубрика:** Статьи  
**Дата:** 2026-08-28

Знакомая картина: запустили в Mindbox тест темы письма, на второй день вариант Б показал +27% к открытиям, тест остановили, победителя раскатали на всю базу. Через месяц смотрите на цифры — открываемость та же, выручка та же. Куда делся прирост? Никуда. Его не существовало: на выборке в пару тысяч человек +27% — это шум, а не эффект.

Такие истории мы разбираем чуть ли не каждую неделю, и почти всегда корень один: эксперимент не был спланирован. Проблема решается за 20 минут до запуска, если заранее посчитать выборку и длительность. Как это сделать с помощью калькулятора A/B-тестов Mindbox и где при настройке эксперимента поджидают грабли, рассказывает Дарья Касаткина, CRM-маркетолог ClientCore.

> **Читайте также:** [Статистическая значимость A/B-теста: как не принять решение по шуму](https://clientcore.ru/blog/articles/statisticheskaya-znachimost-a-b-testa-kak-ne-prinyat-reshenie-po-shumu)

## Классическая история: победитель, которого не было

Механика ложной победы простая. На малых числах случайность правит балом: в ветке А 1 200 человек и 28 заказов, в ветке Б 1 200 человек и 34 заказа. Разница выглядит внушительно — плюс 21% к конверсии. Но по факту это шесть лишних заказов. Шесть человек, которые могли купить в любом случае: день недели, зарплата, настроение.

Реальный эффект в email-экспериментах обычно скромнее — 5–15% относительных. Чтобы отличить такой эффект от шума, нужна выборка, которую почти никто не считает заранее. Отсюда главный симптом нездоровой культуры тестирования: «победители» находятся быстро и регулярно, а накопленный эффект за год — около нуля.

> Самый частый разговор с новым клиентом: „мы тестировали, у нас ничего не работает“. Открываем историю экспериментов — там тесты на 1 500–3 000 человек, остановленные на второй-третий день. Для такой конверсии честный тест требует порядка десяти тысяч в каждой ветке. То есть выводов из этих экспериментов не было в принципе — только иллюзия выводов».
>
> — Дарья Касаткина, CRM-маркетолог, ClientCore

## Что считает калькулятор A/B-тестов Mindbox и где его взять

Калькулятор A/B-тестов в Mindbox — инструмент планирования: вы вводите текущую конверсию метрики, прирост, который хотите уловить, и уровень значимости — а он отвечает, сколько человек должно попасть в каждую ветку эксперимента. Калькулятор доступен в базе знаний платформы, а та же логика встроена в сам mindbox аб тест: при запуске платформа следит за статистической значимостью и не объявляет победителя раньше времени — если не вмешиваться руками.

Зачем считать до запуска, если платформа сама покажет значимость? Затем, что калькулятор отвечает на вопрос, который интерфейс не задает: стоит ли вообще начинать. Если для ловли эффекта нужно 40 000 человек, а в живом сегменте их 8 000, эксперимент обречен. Лучше узнать это до недели работы, чем после.

## Три цифры, которые калькулятор ждет от вас

Первая — базовая конверсия метрики. Берите из отчетов по кампаниям за последние 2–3 месяца: конверсия из доставленных в целевое действие. Если метрика плавает от 1,2% до 3,5% в зависимости от акций, тестируйте на обычной кампании; распродажа искривит базу для сравнения.

Вторая — минимальный детектируемый эффект, MDE. Здесь главная ловушка: чем тоньше эффект, тем больше нужна выборка, и зависимость квадратичная. Пример: конверсия в заказ 2%, вы хотите надежно заметить рост до 2,6% — калькулятор потребует примерно 10 000 человек в каждой ветке, 20 000 на весь тест. Хотите различить рост до 2,2%? Готовьте уже около 40 000. Именно на этом шаге половина затей с тестами честно умирает. И это хорошо — дешевле, чем умереть после месяца эксперимента.

Третья — уровни значимости и мощности. Стандарт индустрии: значимость 95%, мощность 80%. Опустить значимость до 90% ради скорости — значит согласиться, что каждый десятый «победитель» будет случайным. Для решений, которые раскатываются на всю базу, это дорогое согласие.

## Как перевести выборку в длительность теста

Дальше арифметика. Для массовых рассылок: поделите нужный размер ветки на число людей, которые реально получат кампанию. Сегмент 12 000, сплит 50/50 — 6 000 на ветку за одну отправку. Нужно 10 000 — значит, тестовая механика должна прожить минимум две кампании. Для триггеров считают дневной поток: если через ветку брошенной корзины проходит 150 человек в день, на 10 000 уйдет больше двух месяцев. Это нормально — триггер тем временем продолжает продавать.

Два жестких правила. Дата остановки фиксируется до запуска и не переносится. И тест должен прожить полный недельный цикл: поведение базы во вторник и в субботу различается, короткий тест срежет эту разницу в случайную сторону.

> Подглядывание убивает больше экспериментов, чем плохие гипотезы. Если проверять результаты каждый день и останавливаться, как только появилась значимость, реальный шанс ошибки вырастает с заявленных 5% до 20–30%. У нас правило: смотреть на цифры можно, останавливать — нельзя, пока не набрана выборка. Ругаемся, но держимся».
>
> — Дарья Касаткина, CRM-маркетолог, ClientCore

**Норма**

- дата и условия остановки зафиксированы до старта
- тест живет минимум один полный недельный цикл
- решение принимается один раз — после набора выборки

**Red flag**

- «во вторник было значимо, давайте остановим»
- тест идет «пока не надоест»
- победитель выбран по кликам, а что случилось с покупками — не проверили

## Как настроить A/B-тест в Mindbox, когда расчет готов

Порядок работы в интерфейсе:

1. Создайте кампанию и включите A/B-тест. В массовых рассылках это штатный режим: база делится на тестовые ветки, победитель может автоматически уйти остальным. 2. Задайте размер веток. Сплит 50/50 набирает выборку быстрее всего. Если гипотеза рискованная — агрессивный оффер, новая механика — тестовую группу можно ужать до 20–30%. Помните: меньше ветка, длиннее тест. 3. Выберите метрику победителя до старта. Одну. Если цель — выручка, метрика должна стоять максимально близко к деньгам: конверсия в заказ. Открытия для этого не годятся. 4. Время теста берите из расчета — цифра из калькулятора, деленная на ваш трафик. 5. Заранее решите, что будет после: авторассылка победителя или ручной разбор. Для дорогих решений ручной разбор честнее — посмотрите срезы по сегментам, прежде чем раскатывать.

И отдельно про триггеры. В цепочках A/B-тест тоже настраивается, плюс там нужна контрольная группа — люди, которые не получают коммуникацию вообще. Без нее вы измеряете разницу между ветками, но вклад самого триггера в выручку остается неизвестным.

## Ошибки, которые мы находим на аудитах

Когда мы проводим аудит CRM-маркетинга — для Tripster, например, разбирали весь контур в Mindbox, чтобы найти, где теряется выручка ([кейс](https://clientcore.ru/blog/articles/otzyv-tripster-o-clientcore-audit-crm-marketing-mindbox)) — эксперименты всегда в списке проверок. И типовой набор проблем повторяется с завидной стабильностью.

Ошибка первая: в одном тесте меняют все сразу — тему, дизайн, время отправки. Разница между ветками есть, а понимания, чем она вызвана, нет. Следующий тест начинается с чистого листа.

Ошибка вторая: смешанные сегменты. В ветки попадают и активные покупатели, и «спящие» полтора года. Средний результат близок к нулю, и гипотезу хоронят — хотя внутри активного сегмента она могла дать двузначный прирост.

Ошибка третья: победителя выбирают по открытиям. После того как Apple включила Mail Privacy Protection, часть открытий на iOS «нарисованная» — клиент письмо не видел, а открытие засчитано. Для выводов годятся клики и конверсии.

> Болезненный случай из практики: клиент тестировал оффер на всей базе, получил ноль и отключил механику. Когда мы пересчитали результаты по RFM-сегментам, выяснилось: у активных прирост был +18%, а спящие все съели в минус. Механику вернули — на правильном сегменте она продолжает зарабатывать».
>
> — Дарья Касаткина, CRM-маркетолог, ClientCore

**Норма**

- один тест — одно изменение
- метрика победителя близка к деньгам
- у триггеров есть контрольная группа

**Red flag**

- новая тема, новый дизайн и новое время отправки в одном тесте
- победитель определен «по тому, что выросло»
- вклад триггеров в выручку неизвестен, потому что контрольной группы нет

## Базы мало: четыре рабочих хода

Если калькулятор показал 30 000 на тест, а в базе 9 000, это не приговор.

Поднимите MDE. Согласитесь ловить только крупные эффекты — 30–40% относительных. Слабые гипотезы отсеются сами, и это полезный фильтр: микрооптимизации темы письма редко стоят недели эксперимента.

Идите выше по воронке. Кликов в письме в разы больше, чем заказов, значит, выборка набирается быстрее. Но вывод по кликам проверяйте на конверсии, хотя бы вручную на больших числах: рост кликов с падением покупок встречается чаще, чем хотелось бы.

Копите выборку. Одинаковая механика теста в нескольких подряд кампаниях складывается в общую выборку — если сегмент и условия одинаковые, результаты агрегируются.

Переносите гипотезу туда, где трафик. Попапы и пуши часто дают заметно больше событий, чем email. Когда мы пересобирали логику рассылок для MINIDINO, ставку сделали на точность: гипотезы проверялись на конкретных сегментах вместо всей базы разом — и эффективность email выросла на 110% за квартал ([кейс](https://clientcore.ru/blog/articles/keis-minidino-rost-effektivnosti-email)).

А если база совсем маленькая — честно признайте: количественные тесты вам пока недоступны. Тогда работают последовательные изменения с замером до/после и здравый смысл. Это слабее статистики, но сильнее, чем тест с ложным выводом.

> **Читайте также:** [Holdout-группа: зачем намеренно не отправлять письма части базы](https://clientcore.ru/blog/articles/holdout-gruppa-zachem-namerenno-ne-otpravlyat-pisma-chasti-bazy)

---

[Открыть статью на сайте](https://clientcore.ru/blog/articles/kalkulyator-a-b-testov-mindbox-kak-splanirovat-eksperiment-do-zapuska)
