A/B-тест темы письма: что проверять, когда open rate обманывает
Open rate после Apple MPP показывает погоду. Смотрим, какие гипотезы тестировать в теме письма и как выбирать победителя по кликам и конверсии.
Если победителя в ab тест темы письма вы до сих пор определяете по open rate, с приличной вероятностью вы награждаете случайный вариант. С сентября 2021 года Apple Mail Privacy Protection подгружает письма в фоне: трекинговый пиксель срабатывает, а человек письмо в глаза не видел. В B2C-базах доля Apple Mail доходит до половины всех чтений — значит, половина «открытий» может быть фоновым шумом.
Печальнее другое: механика тестов у большинства команд осталась той же, что в 2019-м. Два варианта темы, десять процентов базы, через три часа победитель по открытиям улетает остальным. О том, что тестировать в рассылках теперь и как считать результат, когда открытия уже не измеряют интерес, рассказывает Екатерина Чернова, CRM-маркетолог ClientCore. За последние годы она перевела тестирование тем на клики и выручку в дюжине e-commerce проектов — и собрала статистику, на какие гипотезы сейчас стоит тратить выборку.
ЧИТАЙТЕ ТАКЖЕ
«Почему «победитель» теста испаряется после раскатки на всю базу и как 20 минут с калькулятором до запуска спасают эксперимент — с расчетами и разбором ошибок.»
Apple анонсировала Mail Privacy Protection летом 2021 года и выкатила с iOS 15 в сентябре. Механика простая: приложение Mail на iPhone и Mac заранее, через прокси-серверы Apple, подгружает содержимое письма — включая пиксель, которым ESP считает открытие. Человек конверт мог ни разу не раскрыть, а система уже зафиксировала open.
Попутно два уточнения, без которых картину читают неверно. Первое: MPP затрагивает только приложение Apple Mail и только тех, кто согласился на защиту — а соглашаются, по отраслевым замерам, около 95% пользователей. Второе: если клиент читает почту в приложении Gmail на том же iPhone, фоновой подгрузки нет. Поэтому перекос зависит от структуры конкретной базы: в массовых B2C-проектах на Apple Mail приходится 30–60% всех открытий.
Практический итог: open rate у многих отправителей после 2021 года вырос с 20–30% до 40–55% — при том же контенте и тех же темах. Если вы радуетесь «росту открываемости» в годовом отчете, есть шанс, что расти там нечему.
В одном проекте смотрели дашборд: open rate ползет с 27% к 52% за четыре месяца, клики стоят на месте. Команда уже готовила презентацию о „прорыве в контенте" — разобрали цифры по почтовым клиентам, и весь рост оказался долей Apple Mail. Клики были честным зеркалом, открытия — фоновой подгрузкой».
Екатерина Чернова
CRM-маркетолог, ClientCore
Норма
смотреть открытия в разрезе почтовых клиентов: Apple Mail отдельно, остальные отдельно
принимать решения по тестам тем на кликах и выручке, открытия держать фоновым сигналом
Red flag
сравнивать open rate 2020 и 2024 годов как доказательство роста качества рассылок
объявлять победителя теста темы по open rate «потому что так быстрее» — быстрее, но по шуму
На что опираться вместо открытий
Короткий ответ: на клики и деньги. Тема письма влияет на одно решение читателя — открыть и кликнуть или пролистать. Значит, ближайшая честная метрика для темы — CTR от доставленных: сколько получивших письмо кликнули. CTOR после MPP отравлен той же подгрузкой: у него в знаменателе открытия, и он рисует красивые числа при мертвой воронке.
Вторая метрика — конверсия в заказ и выручка на тысячу доставленных писем. Она работает страховкой от кликбейт-тем: вариант с громкой интригой обычно собирает клики, но люди уходят без покупки, потому что обещание не совпало с содержимым. Судите тему парой метрик: клики показывают силу захода, выручка на доставленное — его честность.
Технически это решается UTM-метками на ссылках и окном атрибуции 3–7 дней: в Mindbox и подобных платформах кампания тянет за собой заказы, и вы видите деньги на каждый вариант. Метрики зафиксируйте до запуска теста, иначе после результатов рука так и тянется выбрать ту цифру, где любимый вариант впереди.
Какие гипотезы тестировать в теме письма
Тест без гипотезы — это перебор. Гипотеза звучит так: «если сделать X, получим Y, потому что Z». Без «потому что» вы тасуете слова и учитесь на погрешности измерения. Вот что имеет смысл проверять в первую очередь.
Длина. Сравнивайте короткие темы до 30–35 знаков с длинными в 60–70, когда суть уезжает в конец фразы. На iPhone видно примерно 40–45 знаков: если ключевое слово стоит на 50-й позиции, половина аудитории его не прочтет.
Персонализация. Из гипотез по персонализации темы письма имя — самая переоцененная: подписчики давно поняли, что это делает робот. Крепче работает персонализация по контексту: категория из истории просмотров, бренд в покупках, город для офлайн-ритейла. «Ваша любимая категория со скидкой» против «Анна, вам скидка» — первый вариант и тестировать интереснее.
Цифры. Размер скидки, дедлайн, количество товаров в подборке: конкретика задает ожидание и фильтрует клики. Тема без цифр часто выигрывает по открытиям у «iOS-роботов», тема с цифрами чаще выигрывает по кликам у живых людей.
Вопрос или утверждение. Вопрос работает, когда бьет в узнаваемую ситуацию («Успели купить детям ботинки на зиму?»), утверждение — когда есть жесткий оффер («−30% на все пуховики до воскресенья»). Это две разные гипотезы: проверяйте сначала формат, потом наполнение.
Ставка на контекст — наблюдение из боевых проектов. Когда мы пересобирали email-программу FINNTRAIL, команда ускорила сборку писем с полутора недель до двух часов и сделала персонализацию рабочим инструментом — выручка канала выросла на 15% (кейс). Темы там итерировали по кликам: в базе с высокой долей iPhone победителя по открытиям назначал бы алгоритм Apple.
Самая живучая мифология — эмодзи и имя в теме. В серии тестов по трем бьюти-проектам имя выигрывало один раз из восьми, зато персонализация по последней категории просмотров давала прирост кликов 18–24%. Проверяйте мифы на своей базе, но начинайте с контекста — он дешевле в настройке и честнее в эффекте».
Екатерина Чернова
CRM-маркетолог, ClientCore
Как поставить тест и не обмануть себя
Первая ловушка — выборка. Если на вариант приходятся 500–800 доставленных писем, а разница в кликах составляет двадцатую часть процента, вы измеряете шум. Рабочее правило: минимум 2 000–3 000 доставленных на вариант для кликовых метрик, и разница должна быть заметной — хотя бы 15–20%. База меньше? Накапливайте одну гипотезу через серию из двух-трех рассылок и считайте суммарно.
Вторая ловушка — спешка. Клики собираются 48–72 часа, а объявить победителя хочется через три часа, когда пришло 200 открытий. Так тесты превращаются в ритуал: побеждает тот вариант, который удобнее запустить. Фиксируйте заранее: ждем порог в N доставленных или трое суток, потом смотрим CTR и выручку на доставленное, потом раскатываем.
Третья ловушка — грязный дизайн. Классическая схема «10–20% базы смотрят два варианта, лучший уходит остальным» жива, но при одной переменной: поменяли в паре вариантов длину, имя и эмодзи — на выходе не узнаете, что сработало. Еще грешат сравнением разных гипотез из разных недель: понедельник с распродажей против четверга с контентным письмом не сравнивается. И держите сегмент чистым: мешать в один тест горячих покупателей и спящих — верный способ получить среднюю температуру по палате.
Про сегменты — из практики. У MINIDINO рассылки уходили всей базе скопом, без единого среза; мы пересобрали логику на точность по сегментам, и эффективность email-канала выросла на 110% за квартал (кейс). Тесты тем до этого давали мусор именно из-за смешанных сегментов: условные «Лучшие клиенты недели» били «Снова в продаже» просто потому, что в одну пару попало больше активных подписчиков.
Мой рабочий порог: разница по кликам меньше 15% — у нас нет победителя, есть ничья. Половину „выигранных" тестов, которые я вижу при аудите чужих аккаунтов, на самом деле составляют ничьи, которые команда зафиксировала как урок и потом масштабировала на всю базу».
Екатерина Чернова
CRM-маркетолог, ClientCore
Норма
одна переменная на тест и заранее записанная гипотеза с обоснованием
победитель по кликам и выручке на доставленное, решение через 48–72 часа
чистый сегмент и одинаковое время отправки у вариантов
Red flag
три изменения в паре вариантов и вывод «это сработало» без разбора, что именно
объявление результата по первым сотням открытий
сравнение гипотез из разных недель и разных акций между собой
Когда open rate еще пригодится
Хоронить открытия полностью не нужно, их место просто изменилось. Первая задача — сигнал доставляемости: резкое падение open rate по конкретному домену (например, только по mail.ru или только по Gmail) обычно означает спам-проблемы. Здесь открытия честный индикатор, потому что вы сравниваете домен с самим собой.
Вторая задача — сравнения внутри одной когорты почтовых клиентов. Отфильтруйте отчет по Gmail-клиентам, где MPP не действует, и open rate снова станет рабочей метрикой. Для B2B-баз, где Apple Mail часто собирает меньше 10% чтений, открытия вообще остались почти здоровыми — там судить темы по opens можно, хотя клики все равно надежнее.
Практичный первый шаг: измерьте долю Apple Mail в открытиях своей базы. В большинстве ESP и в Mindbox это видно в разрезе по клиентам. Доля выше 25–30% — пора переводить решения по темам на клики и выручку, а open rate оставить сервисной метрикой для доставляемости.
ЧИТАЙТЕ ТАКЖЕ
«Вариант B выиграл на третий день теста — можно раскатывать? Скорее всего, вы смотрите на шум. Разбираем, как считать статистическую значимость A/B-теста и когда выводу можно верить.»
Сколько времени должен длиться A/B-тест темы письма?
Минимум 48–72 часа на сбор кликов: основная масса реакций приходит в первые сутки, хвост дотягивается к третьим. Раньше — вы судите по первым сотням реакций и режете статистику. Если оцениваете темы по выручке, дайте кампании окно атрибуции 3–7 дней, иначе сравните варианты по неполным деньгам.
Что делать, если база маленькая и тест не набирает выборку?
Два пути. Первый — накапливать одну гипотезу через серию: повторяете тот же вопрос «дедлайн против без дедлайна» в двух-трех соседних рассылках и считаете суммарно. Второй — тестировать грубые гипотезы с большой ожидаемой разницей: на тонких различиях маленькая база всегда ответит шумом.
CTOR или CTR — что теперь показывает правду?
CTR от доставленных. В CTOR открытия стоят в знаменателе, после Apple MPP они раздуты подгрузкой, поэтому CTOR рисует комфортные числа при любом состоянии воронки. Считайте кликнувших от всех, кому письмо дошло, — грубее, зато честно.
Стоит ли тестировать темы в триггерных цепочках?
Да, и там тесты даже чище: трафик триггера стабильнее массовых рассылок, сезонность ниже. С брошенной корзиной или реактивацией накапливайте выборку по неделям, метрики те же — клики и конверсия на доставленное.