Если совсем коротко, A/B-тестирование это способ честно сравнить два варианта одного и того же: старую кнопку и новую, старый заголовок и новый, старую обложку карточки товара и новую. Половина пользователей случайным образом видит вариант A, вторая половина видит вариант B, и через какое-то время вы смотрите, у кого конверсия (доля людей, которые сделали нужное действие: купили, подписались, кликнули) получилась выше.
Звучит просто. На практике примерно каждый второй тест, который я вижу в работе маркетологов и продуктовых команд, показывает не то, что произошло на самом деле. Не потому что люди глупые. Просто статистика умеет выглядеть убедительно там, где никакого эффекта нет, и человек без подготовки этого не замечает: цифра зелёная, стрелочка вверх, значит побеждает вариант B. А через месяц после раскатки выручка ровно такая же, как была.
Поэтому статья устроена в два слоя. Сначала матчасть: что такое A/B-тест, как его проводить, сколько нужно людей, какие инструменты работают в России в 2026 году. Потом самое интересное: разбор способов обмануться собственным отчётом, от подглядывания в промежуточные результаты до парадокса Симпсона. Второй слой на большинстве сайтов почему-то отсутствует, хотя именно он отделяет работающий эксперимент от красивой имитации.
Тема на стыке аналитики, маркетинга и продукта. Если вы примеряете её на себя как профессию, посмотрите наши разборы пути в продуктовую аналитику с нуля и работы веб-аналитика, а если нужна структурная программа, у нас собраны онлайн-курсы по A/B-тестированию с ценами и отзывами.
Что такое A/B-тестирование простыми словами

A/B-тест это контролируемый эксперимент на живых пользователях. Вы берёте аудиторию, случайным образом делите её на две группы и показываете им разные версии страницы, письма, экрана приложения или рекламного объявления. Все остальные условия одинаковые: одно и то же время, один и тот же трафик, одни и те же акции.
Ключевое слово тут «случайным образом». Не «мужчинам вариант A, женщинам вариант B». Не «в понедельник A, во вторник B». Именно случайное распределение делает группы сопоставимыми по всему, что вы не контролируете и часто даже не знаете: по устройствам, по источникам трафика, по настроению, по погоде за окном.
Группа A называется контрольной: это то, что уже работает. Группа B называется экспериментальной или тестовой: это ваша гипотеза. Разница между ними по выбранной метрике и есть результат теста.
Как это читается и почему сплит-тест это то же самое
Вслух говорят «эй-би тестирование», реже «а-бэ». На письме встречаются написания «A/B-тестирование», «AB-тестирование» и «аб-тестирование»: это одно и то же, разница только в раскладке клавиатуры.
Сплит-тестирование это полный синоним A/B-теста. Слово пришло от английского split, «разделение»: трафик делят на потоки. Иногда сплит-тестом называют вариант, когда версии лежат на разных URL, а A/B-тестом тот случай, когда подмена происходит на одной странице. Это деление держится не везде, и в большинстве текстов термины взаимозаменяемы.
Ещё есть A/B/n: то же самое, но вариантов больше двух. И многовариантное тестирование (MVT), где вы меняете сразу несколько элементов и смотрите на все их комбинации. К MVT вернёмся ниже, потому что с ним связана самая дорогая ошибка новичков.
Чем A/B-тест отличается от «поменяли и посмотрели»
Самый частый способ проверить идею выглядит так: в понедельник поменяли заголовок на лендинге (одностраничном сайте под одно предложение), через неделю посмотрели конверсию, она выросла на 12%, порадовались. Это сравнение «до и после», и доверять ему нельзя.
За эту неделю успело поменяться примерно всё: доля мобильного трафика, ставки в рекламном аукционе, погода, конкурент запустил распродажу, у вас закончился остаток по популярному товару. Вы приписали изменению заголовка эффект, который на самом деле сложился из десятка причин.
Главное отличие. В A/B-тесте обе версии живут одновременно и в одних и тех же условиях, поэтому всё внешнее действует на обе группы одинаково и в разнице сокращается.
Именно поэтому A/B-тест считается самым надёжным способом узнать, влияет ли изменение на поведение людей. Не единственным, но самым надёжным. И именно поэтому его так легко испортить: стоит нарушить одновременность или случайность, и метод превращается в тот же самый «до и после», только с более убедительными графиками.
Что можно тестировать и где стоят ограничения
Тестировать можно любой элемент, который видит пользователь и который влияет на его решение. На практике чаще всего проверяют:
- Заголовки и офферы: формулировка первого экрана, обещание, цена в заголовке.
- Кнопки: текст, цвет, размер, положение. Классика, с которой все начинают, и обычно самый слабый по эффекту участок.
- Изображения: главное фото товара, обложка видео, иллюстрация на лендинге.
- Формы: количество полей, обязательность телефона, порядок шагов.
- Письма: тема, отправитель, время отправки, структура.
- Логику продукта: новый алгоритм рекомендаций, изменённый онбординг, другой порядок экранов.
- Ценообразование: скидки, пороги бесплатной доставки, состав тарифов.
А вот чего сделать не выйдет. Во-первых, нельзя показывать разным людям разные цены на один товар на маркетплейсах: площадки это прямо запрещают, и Ozon в своём инструменте тестирования цену из доступных полей убрал. Во-вторых, бессмысленно тестировать то, что видит слишком мало людей. В-третьих, не тестируются вещи, где вариант B нельзя откатить: ребрендинг, смена домена, переезд на новую платформу.
Отдельная категория это изменения, которые вы обязаны сделать по закону или по требованию площадки. Их не тестируют, их внедряют.
Канал основателя Checkroi Вани Буявца3 700 человек читают мой Телеграм-канал про нейросетиСобрал промпты для Claude Code и ChatGPT, разборы ИИ-инструментов и лайфхаки по продвижению бизнеса в одном местеПрисоединитьсяВиды тестов: A/B, A/B/n и многовариантное
Обычный A/B-тест сравнивает два варианта и меняет один элемент. Самая понятная схема и самая быстрая по набору выборки, поэтому с неё стоит начинать.
A/B/n это то же самое, но вариантов три и больше: например, четыре разных заголовка. Выборка тут делится на четыре части, значит каждой группе нужно набрать столько же людей, сколько нужно было бы в обычном тесте. Плюс появляется проблема множественных сравнений: чем больше вариантов, тем выше шанс, что один из них «выиграет» случайно. Поэтому при трёх и более вариантах порог значимости обычно ужесточают.
Многовариантное тестирование (MVT) меняет несколько элементов сразу и проверяет их комбинации. Два заголовка и три картинки дают шесть версий страницы. Метод отвечает на вопрос, который A/B не берёт: не усиливают ли элементы друг друга. Цена высокая: выборка растёт пропорционально числу комбинаций, и шесть версий требуют примерно втрое больше трафика, чем две.
Практическое правило простое. Если трафика меньше сотни тысяч визитов в месяц, MVT почти наверняка не для вас: сначала A/B на крупных изменениях, комбинации потом.
Отдельно стоит ухудшающий тест: вместо того чтобы добавлять новое, вы временно убираете существующее и смотрите, как просядут метрики. Так проверяют, окупается ли блок отзывов, нужен ли онлайн-чат, работает ли рекомендательная лента. Метод неприятный, зато честный и требует меньше данных.
Когда A/B-тест окупается и когда он не нужен
Эксперимент имеет смысл при трёх условиях одновременно: у вас достаточно трафика, вы умеете измерять результат, и цена ошибки заметна. Если хотя бы одно не выполняется, тест превратится в ритуал.
Трафика достаточно, если на странице набирается хотя бы несколько тысяч уникальных посетителей за пару недель и хотя бы несколько сотен целевых действий. Точные числа зависят от текущей конверсии, о них подробно в следующем разделе.
Теперь честный список ситуаций, когда A/B-тест запускать не надо.
- Мало трафика. Сайт с 300 визитами в месяц не даст статистически различимого результата даже за полгода. Тут работают качественные методы: проверка юзабилити своими силами, интервью, коридорные тесты.
- Изменение очевидно полезное. Если форма падает на мобильных, её надо чинить, а не сравнивать со сломанной версией.
- Эффект заведомо мизерный. Оттенок серого у подписи под кнопкой не сдвинет выручку, а две недели вы потратите.
- Нет решения под результат. Спросите заранее: что мы сделаем, если победит A, и что, если победит B. Если ответ в обоих случаях «ничего», тест не нужен.
- Идёт распродажа или сезонный пик. Поведение аудитории в чёрную пятницу не переносится на обычные недели.
Практический фильтр. Перед запуском напишите одним предложением, какое решение вы примете по результату. Если предложение не пишется, эксперимент можно не начинать.
Гипотеза, целевая метрика и защитные метрики
Гипотеза это не «давайте попробуем другой цвет». Гипотеза это утверждение с причиной, которое можно опровергнуть. Рабочая форма выглядит так: если мы сделаем X, то метрика Y изменится на Z, потому что W.
Пример слабой формулировки: «сделаем кнопку зелёной, будет лучше». Пример рабочей: «если вынести стоимость доставки на карточку товара, доля брошенных корзин упадёт примерно на 10%, потому что сейчас 40% пользователей уходят с шага оплаты именно после того, как видят цену доставки впервые».
Разница в том, что во втором случае у вас есть основание (данные о брошенных корзинах), ожидаемый размер эффекта и понятная логика. Такую гипотезу можно не подтвердить, и это тоже результат: вы узнаете, что дело не в доставке.
Целевая метрика выбирается до старта и ровно одна. Это может быть конверсия в заказ, средний чек, доля дочитавших, выручка на пользователя. Не «посмотрим на всё сразу»: если метрик пять, вероятность, что хотя бы одна случайно покажет красивый рост, приближается к четверти.
Кроме целевой нужны защитные метрики (guardrail). Их задача не улучшиться, а не ухудшиться. Типичный набор: выручка на пользователя, доля отказов, скорость загрузки, количество обращений в поддержку, отписки от рассылки. Классическая ловушка выглядит так: кликов на кнопку стало на 30% больше, а денег меньше, потому что новый заголовок приводил на оплату людей, которые не собирались платить.
Если вы только выстраиваете измерения, начните с базовой настройки счётчика: у нас есть пошаговый гайд по установке Яндекс Метрики и разбор того, чем Метрика отличается от Вебмастера.
Размер выборки и длительность

Это место, где ломается больше всего тестов. Люди запускают эксперимент, набирают полторы тысячи посетителей, видят «конверсия выросла с 2,0% до 2,4%» и раскатывают вариант B. При таком объёме разница в 0,4 процентных пункта это чистый шум: она получилась бы и в том случае, если бы обе группы видели абсолютно одинаковую страницу.
Сколько людей нужно, зависит от четырёх вещей: текущей конверсии, размера эффекта, который вы хотите заметить, допустимой вероятности ошибиться и мощности теста. Первые две задаёте вы, вторые две обычно берут стандартными: уровень значимости 5% и мощность 80%.
Размер эффекта называют MDE, минимальный детектируемый эффект: это самое маленькое изменение, ради которого вам вообще стоит что-то менять. Тут есть неприятная арифметика: чтобы заметить эффект вдвое меньше, выборка нужна вчетверо больше.
Таблица «конверсия × MDE → сколько нужно посетителей»
В таблице указано количество посетителей на каждую группу при значимости 5% и мощности 80%. Общее число посетителей теста вдвое больше.
| Текущая конверсия | Рост на 5% | Рост на 10% | Рост на 20% |
|---|---|---|---|
| 1% | 637 000 | 163 000 | 42 700 |
| 2% | 315 000 | 80 700 | 21 100 |
| 5% | 122 000 | 31 200 | 8 200 |
| 10% | 57 800 | 14 700 | 3 800 |
| 20% | 25 600 | 6 500 | 1 700 |
| 30% | 14 900 | 3 800 | 1 000 |
Как этим пользоваться. Допустим, конверсия лендинга 2%, а вы рассчитываете на относительный рост в 10%, то есть до 2,2%. По таблице нужно 80 700 посетителей на группу, то есть около 161 тысячи всего. Если у вас 20 тысяч посетителей в месяц, честный тест займёт восемь месяцев, и запускать его бессмысленно. Вывод не «статистика врёт», а «этот эффект вам не измерить, ищите изменения покрупнее».
Обратите внимание на правый столбец. Заметить рост на 20% почти всегда реально, на 5% почти всегда нет. Поэтому сильные команды тестируют не оттенки кнопок, а крупные изменения: другой оффер, другая структура страницы, другая механика.
Если хочется посчитать под свои числа, воспользуйтесь калькулятором размера выборки Эвана Миллера: там задаются базовая конверсия, MDE, значимость и мощность.
Почему две недели это минимум
Даже если нужное количество людей набралось за три дня, тест обычно не останавливают раньше двух недель. Причина в недельной цикличности: в будни и выходные ведут себя по-разному почти все аудитории, у B2B провал в субботу, у товаров для дома пик. Тест длиной в пять дней ловит кусок недели и переносит на всю жизнь продукта её случайные особенности.
Практическое правило: полные недельные циклы, минимум два, максимум четыре. Дольше месяца тянуть тоже не стоит: накапливается износ cookie, пользователи меняют устройства, попадают в обе группы, и чистота эксперимента падает.
Как провести A/B-тест: 7 шагов
Порядок шагов важен ровно так же, как их содержание. Половина проблем возникает из-за того, что метрику или размер выборки выбирают после запуска.
- Найдите узкое место. Посмотрите воронку (путь человека от захода на сайт до оплаты) и найдите шаг, где теряется больше всего людей. Тестировать надо там, а не там, где скучно смотреть на дизайн.
- Сформулируйте гипотезу в форме «если X, то Y изменится на Z, потому что W». Запишите её, чтобы потом не переписать под результат.
- Выберите одну целевую метрику и две-три защитных. Зафиксируйте их письменно до старта.
- Посчитайте размер выборки и срок. Если срок больше месяца, вернитесь к шагу два и придумайте изменение покрупнее.
- Настройте распределение и проверьте его. Первые сутки уходят на технический контроль: работает ли вариант B во всех браузерах, попадает ли пользователь всегда в одну и ту же группу, не сломалась ли отправка целей.
- Дождитесь конца срока, не заглядывая в исход. Технические показатели смотреть можно и нужно. Целевую метрику до конца срока не трогайте, почему именно, в следующем разделе.
- Примите решение и запишите вывод. Раскатать, откатить или повторить тест на большем объёме. Результат «разницы нет» это тоже вывод, и он экономит деньги.
Как читать результаты и не обмануться

Дальше самая полезная часть. Каждый пункт ниже это способ увидеть в отчёте победу, которой нет. Все они встречаются регулярно, и почти все выглядят как нормальная аналитическая работа.
Статистическая значимость не равна выгоде
Значимость отвечает ровно на один вопрос: похоже ли, что разница между группами не случайна. Она ничего не говорит о том, стоит ли изменение внедрения.
Типичная ситуация: на большом трафике тест показал рост конверсии с 3,40% до 3,47% при значимости лучше 1%. Эффект настоящий. Только выражается он в двух дополнительных заказах в день, а на переделку каталога уйдёт месяц разработки. Значимость это про «эффект есть», а размер эффекта это про «эффект нужен». Смотреть надо на оба числа.
Подглядывание (peeking)
Самая массовая и самая незаметная ошибка. Аналитик открывает дашборд каждое утро и ждёт, когда значимость станет ниже 5%. Рано или поздно она станет: конверсия в группах колеблется, и при десятке проверок вероятность хотя бы раз случайно провалиться в «зелёную зону» вырастает примерно до 20–30% даже тогда, когда обе группы видят одну и ту же страницу.
Дальше происходит то, что и должно: человек видит долгожданную звёздочку, останавливает тест и объявляет победу. Через месяц эффект не воспроизводится.
Как лечится. Срок и объём выборки фиксируются заранее, а промежуточные результаты либо не смотрятся вовсе, либо оцениваются методами последовательного анализа, которые специально сделаны под многократные проверки.
P-hacking и множественные сравнения
Родственник подглядывания, только вместо многократных проверок во времени идут многократные проверки по срезам. Общий результат нулевой, аналитик начинает резать данные: мобильные, десктоп, новые пользователи, Москва, возраст 25–34. На пятнадцатом срезе находится сегмент с уверенным ростом.
При пятнадцати независимых проверках вероятность найти хотя бы одну «значимую» разницу на чистом шуме превышает 50%. Это не значит, что срезы смотреть нельзя. Это значит, что найденное на срезе годится только как новая гипотеза для отдельного теста, а не как основание для раскатки.
Перекос групп (SRM)
Sample Ratio Mismatch это ситуация, когда вы задали деление 50 на 50, а в отчёте 52 на 48. Кажется мелочью. На деле это почти всегда признак технической поломки: часть пользователей не попала в трекинг, вариант B падал на старых браузерах, редирект терял часть трафика.
Если группы разъехались сильнее, чем на пару десятых процента при десятках тысяч наблюдений, результат теста читать нельзя вообще, каким бы красивым он ни был. Сначала чинится распределение, потом эксперимент запускается заново.
Эффект новизны и эффект привыкания
Постоянные пользователи реагируют на любое изменение интерфейса просто потому, что оно изменение. Новая кнопка первую неделю собирает лишние клики из любопытства, а потом всё возвращается. Бывает и наоборот: люди привыкли к старому расположению, первые дни теряются, метрика падает, а через две недели новый вариант обгоняет старый.
Лечится это двумя способами. Смотреть динамику по дням, а не только итог. И отдельно считать метрику по новым пользователям, у которых привычек к вашему интерфейсу нет.
Парадокс Симпсона
Самая коварная штука в списке. Вариант B может проигрывать в каждом отдельном сегменте, но выигрывать в общем итоге, и наоборот.
Как это выходит: допустим, в группе B случайно оказалось больше мобильного трафика, а мобильная конверсия у вас в целом ниже десктопной. Тогда суммарная конверсия группы B просядет, даже если внутри мобильных и внутри десктопа вариант B лучше. Общее число врёт, потому что группы отличаются составом.
Проверка простая: сравните структуру групп по устройствам, источникам и регионам. Если она разошлась, разбирайте результат по сегментам, а не по общему итогу.
Доверительный интервал говорит больше, чем p-value
P-value это вероятность увидеть такую же или большую разницу, если бы разницы на самом деле не было. Число полезное, но одномерное: оно не показывает, насколько велик эффект.
Доверительный интервал показывает диапазон, в котором эффект скорее всего лежит. Результат «рост конверсии 8%, интервал от 1% до 15%» и результат «рост конверсии 8%, интервал от минус 4% до 20%» имеют одинаковую точечную оценку и совершенно разную ценность. Во втором случае вы не знаете даже знака эффекта.
Что смотреть в отчёте. Сначала интервал, потом p-value. Если нижняя граница интервала ниже вашего порога окупаемости, изменение внедрять рано, даже когда значимость формально достигнута.
Ошибка первого рода и ошибка второго рода
Ошибка первого рода это когда вы поверили в эффект, которого нет. Её вероятностью управляет уровень значимости: при пороге 5% вы соглашаетесь ошибаться так в одном случае из двадцати.
Ошибка второго рода это когда эффект был, а вы его не заметили. Ей управляет мощность: при мощности 80% вы пропускаете реальный эффект в одном случае из пяти. Именно поэтому «разницы не обнаружено» и «разницы нет» разные утверждения, и на маленькой выборке первое встречается сплошь и рядом.
Как трафик делится технически
Раздел для тех, кто будет настраивать тест руками или ставить задачу разработчику. От того, где происходит разделение, зависит и качество данных, и то, увидит ли пользователь неприятное мигание страницы.
Клиентское разделение
Скрипт в браузере догружает страницу, решает, в какую группу попал посетитель, и подменяет нужные элементы. Так работают визуальные редакторы: Varioqub, Optimizely, встроенные инструменты конструкторов сайтов. Настраивается без разработчика, подходит для текстов, картинок и вёрстки.
Минус тоже известный: между отрисовкой исходной страницы и подменой проходит время, и часть пользователей успевает увидеть исходный вариант. Это называется flicker, мигание контента, и оно не только раздражает, но и искажает результат: люди на медленном интернете фактически видят третью версию страницы.
Серверное разделение
Сервер решает, что отдать, ещё до отправки страницы. Мигания нет, работает одинаково на всех устройствах, годится для логики продукта, а не только для внешнего вида. Требует разработки и, как правило, системы фича-флагов. Для мобильных приложений это единственный рабочий вариант.
Что привязывать к группе
Идентификатор группы нужно хранить так, чтобы пользователь всегда видел один и тот же вариант. Привязка к сессии или к cookie конкретного браузера ломается, когда человек заходит с телефона, потом с ноутбука, потом чистит cookie. В отчёте это выглядит как размытие эффекта: обе группы «загрязнены» друг другом.
Правильно привязывать к идентификатору пользователя, если он у вас есть. Если авторизации нет, cookie остаётся единственным вариантом, но срок жизни ставится длинный, а тест не растягивается на месяцы.
Вредит ли A/B-тест позициям в поиске
Короткий ответ: при аккуратной настройке нет. Google и Яндекс относятся к экспериментам нормально, это стандартная практика. Проблемы начинаются, когда тест реализован грубо.
Три правила, которые снимают почти все риски. Не показывайте поисковому роботу вариант, отличный от пользовательского: подмена контента специально для робота это клоакинг, и за него бывают санкции. Если варианты живут на разных URL, ставьте rel="canonical" с тестовой страницы на основную. И не держите тест бесконечно: длящийся год «эксперимент» поисковик резонно посчитает попыткой обмануть.
Инструменты в 2026 году: что работает в России
Набор сервисов за последние годы заметно поменялся: часть западных платформ ушла или усложнила оплату, зато выросли российские. Ниже те, что реально используются в работе.
Varioqub и эксперименты Яндекс Метрики
Varioqub это бесплатный сервис Яндекса для A/B-тестов на сайте, связанный с Метрикой. Вы подключаете счётчик, задаёте варианты (визуальным редактором или своим кодом), выбираете цель из Метрики и запускаете. Сервис сам делит трафик, считает значимость и показывает отчёт.
Подходит для сайтов и лендингов, где нужно менять контент и вёрстку. Порог входа низкий, отдельного разработчика для простых тестов не требуется. Подробности по настройке есть в официальной справке Varioqub, а по целям и сегментам в справке Яндекс Метрики.
Эксперименты в Яндекс Директе
Если вы тестируете рекламу, а не сайт, деление трафика делается на стороне рекламной системы. В Директе есть эксперименты через Яндекс Аудитории: вы задаёте сегменты, распределяете их по кампаниям и сравниваете результаты в одинаковых условиях аукциона. Так проверяют креативы, тексты объявлений, посадочные страницы и стратегии назначения ставок.
AppMetrica для мобильных приложений
В приложении подмену контента через браузерный скрипт не сделаешь, нужен серверный механизм флагов. AppMetrica умеет раскатывать конфигурацию на долю пользователей и связывать её с продуктовыми метриками. Похожую механику дают Firebase Remote Config и самописные сервисы фича-флагов, которые в крупных командах чаще всего и используют.
Optimizely, VWO и другие западные платформы
Optimizely и Visual Website Optimizer остаются функциональными и дорогими. Их берут, когда нужны сложные сценарии: многостраничные воронки, персонализация, тесты на серверной стороне. Для российской команды главный вопрос тут оплата и юридическая сторона, поэтому чаще выбирают связку Varioqub плюс собственные флаги.
Из бесплатного и близкого по смыслу есть встроенные эксперименты в CMS и конструкторах: Tilda, Bitrix и большинство почтовых сервисов умеют делить аудиторию сами. Для писем этого обычно достаточно, разбор механики есть в нашей статье про email-маркетинг с нуля.
A/B-тесты на маркетплейсах: Wildberries и Ozon

Это направление в русскоязычных гайдах почти не описано, хотя селлеров, которым нужен именно такой тест, кратно больше, чем продуктовых аналитиков.
Ozon (Озон): инструмент «Мои исследования». Встроенный сплит-тест карточки прямо в кабинете продавца. Можно собрать до трёх вариантов карточки и сравнить их по реальным метрикам: тестируются заголовок, фотографии, описание, рич-контент. Стоит порядка 299 ₽ за тест одного товара. Доступ дают селлерам с оборотом примерно от 500 тысяч ₽ в месяц, и есть требование по трафику: если карточка набирает меньше сотни просмотров в день, результат будет статистически неотличим от шума. Цену и участие в акциях тестировать нельзя.
Wildberries: тест главной фотографии. Площадка раскатывает собственный инструмент A/B-тестов главного фото карточки. Схема такая: создаёте тест, добавляете карточку, выбираете дату старта и длительность от 7 до 56 дней, загружаете второе фото, отправляете на модерацию, после неё запускаете. На момент публикации доступ есть не у всех продавцов и связан с платной подпиской.
Что важно понимать про маркетплейсы. Вы тестируете не страницу, а карточку внутри чужого алгоритма ранжирования, и этот алгоритм сам реагирует на изменения. Рост показов после смены фото может быть эффектом теста, а может быть эффектом переиндексации карточки. Поэтому смотреть надо не на показы, а на кликабельность карточки (CTR) и конверсию из клика в заказ, и обязательно держать одинаковые остатки, цену и рекламные ставки на время теста.
Если карточка сама по себе слабая, тестировать в ней нечего: сначала базовая работа, и тут пригодится наш разбор того, как собрать продающую карточку товара.
A/B-тесты обложек на YouTube
Про этот инструмент спрашивают часто, а внятных описаний на русском мало. У YouTube есть встроенный A/B-тест заголовков и превью, который раньше назывался Test & Compare, а теперь в Студии подписан просто как A/B-тестирование.
Как это устроено. В десктопной версии YouTube Studio у ролика открывается настройка A/B-тестирования, где можно загрузить до трёх вариантов: только превью, только заголовки или пары «заголовок плюс превью». Дальше платформа сама распределяет показы и сравнивает варианты.
Главное отличие от обычного A/B-теста в метрике. YouTube оценивает варианты по доле времени просмотра, а не по кликабельности: обложка, которая собирает клики обманом, проиграет. По итогам вы получаете один из трёх вердиктов: победитель, результаты не отличаются, тест неубедительный. Идёт всё это обычно несколько дней и завершается в пределах двух недель.
Ограничения тоже есть: нужны включённые расширенные функции канала, Shorts и премьеры не тестируются, а превью с разрешением ниже 1280 на 720 пикселей платформа принудительно ужмёт. Условия и текущий список ограничений разобраны в справке YouTube.
Что делать, если трафика мало
Ситуация, в которой оказывается большинство небольших сайтов и молодых продуктов. Классический A/B-тест не запускается, а решения принимать надо. Работающие варианты есть.
- Тестируйте только крупные изменения. Судя по таблице выше, эффект в 20% ловится на выборке в 15–30 раз меньшей, чем эффект в 5%. Меняйте оффер целиком, а не подпись под кнопкой.
- Поднимитесь на метрику выше по воронке. Заказов у вас 40 в месяц, а кликов по кнопке 3000. Клик как промежуточная метрика измеряется намного быстрее, хотя и надёжность вывода ниже.
- Switchback-тесты. Вместо деления людей делите время: неделю работает вариант A, неделю B, и так несколько циклов. Подходит для сервисов, где пользователи пересекаются между собой (доставка, такси, маркетплейс) и обычное деление невозможно.
- Холдаут. Оставьте небольшую долю аудитории, например 5%, на старой версии на длинный срок и сравнивайте её с остальными накопительно. Так измеряют суммарный эффект от серии изменений.
- Ухудшающий тест. Приём для проверки того, работает ли элемент вообще: временно отключите его части аудитории. Отрицательные эффекты обычно крупнее положительных, поэтому ловятся на меньшей выборке.
- Качественные методы. Пять интервью с пользователями и запись сессий часто дают больше, чем полгода недостоверных цифр. Как это устроено, разбирали в статье про работу UX-исследователя.
Как посчитать результат руками, в калькуляторе и в Python
Отчёт в Varioqub или в кабинете маркетплейса значимость считает сам. Но полезно уметь проверить его руками, хотя бы чтобы понимать, что именно вам показали.
Самый быстрый способ это онлайн-калькулятор: вводите количество посетителей и конверсий в каждой группе и получаете p-value с доверительным интервалом. Для доли конверсии подходит обычный z-тест для двух пропорций.
В Python то же самое считается в несколько строк через statsmodels:
- Берёте четыре числа: посетители и конверсии по группе A, посетители и конверсии по группе B.
- Вызываете
proportions_ztestизstatsmodels.stats.proportion, он возвращает z-статистику и p-value. - Доверительный интервал разницы даёт
confint_proportions_2indepиз того же модуля. - Нужный размер выборки заранее считает
NormalIndPowerизstatsmodels.stats.power.
Тем, кто хочет разобраться в математике за этими функциями, стоит открыть книгу Рона Кохави, Диане Танг и Я Сюя об онлайн-экспериментах: она считается стандартом индустрии и выложена авторами вместе с дополнительными материалами. Академическое определение и историю метода можно посмотреть в статье в Википедии.
Продвинутые подходы: байесовский взгляд, CUPED и последовательный анализ
Когда команда делает десятки тестов в год, обычной схемы «зафиксировали выборку, дождались срока, посмотрели p-value» начинает не хватать. Три подхода, которые чаще всего добавляют.
Байесовский подход отвечает на другой вопрос. Вместо «насколько странно было бы увидеть такую разницу, если эффекта нет» он даёт «с какой вероятностью вариант B лучше варианта A и насколько». Многие сервисы показывают именно эту формулировку, потому что её проще объяснить бизнесу. Подглядывание байесовский подход прощает мягче, но и он не отменяет необходимости заранее решить, при каком результате вы что делаете.
CUPED это техника снижения дисперсии за счёт данных о пользователе до эксперимента. Если вы знаете, сколько человек тратил месяц назад, вы можете вычесть его личный уровень и мерить только отклонение. На практике это сокращает нужную выборку заметно, иногда вдвое, и особенно хорошо работает на метриках с большим разбросом вроде выручки на пользователя.
Последовательный анализ легализует подглядывание. Метод изначально рассчитан на многократные проверки: он расширяет границы значимости так, чтобы суммарная вероятность ошибки оставалась под контролем. Ценой становится чуть больший объём выборки в среднем, зато плохие варианты можно останавливать досрочно.
A/B-тестирование в маркетинге
В продукте тестируют интерфейсы, в маркетинге чаще коммуникацию. Механика та же, отличаются метрики и скорость получения результата.
Email-рассылки. Самый удобный полигон: почтовые сервисы умеют делить базу сами и часто предлагают схему «протестировали тему на 20% базы, победителя отправили остальным». Тестируют тему, имя отправителя, прехедер, длину письма, время отправки. Осторожность нужна с метрикой: открытие письма после появления защиты почтовых клиентов измеряется всё хуже, поэтому целевой метрикой лучше брать переходы или заказы.
Контекстная и таргетированная реклама. Здесь A/B-тест ближе всего к своей исходной задаче, потому что система сама показывает объявления случайным людям. Проверяют заголовки, изображения, посадочные страницы, аудитории. Главная сложность в том, что рекламный алгоритм оптимизируется по ходу и сам начинает перераспределять показы в пользу лидера, из-за чего группы перестают быть сопоставимыми. Поэтому эксперименты запускают через штатные инструменты рекламной системы, а не вручную двумя кампаниями.
Лендинги и посадочные. Классика: первый экран, оффер, форма, порядок блоков, наличие цены. Тут важнее всего защитная метрика по качеству лидов. Форма из двух полей всегда даст больше заявок, чем форма из шести, а вот дойдут ли эти заявки до сделки, вопрос отдельный.
Цены и акции. На своём сайте тестировать можно, но аккуратно: если два человека увидят разные цены и сравнят, объясняться придётся долго. Обычно тестируют не саму цену, а её подачу: порог бесплатной доставки, отображение старой цены, рассрочку, состав тарифов.
Если интернет-маркетинг для вас новая территория, начните с обзорной статьи о том, как войти в интернет-маркетинг с нуля.
Три примера, которые стоит знать
Кейсы из практики крупных компаний полезны не столько идеями, сколько масштабом: они показывают, ради чего вообще строят культуру экспериментов.
Netflix и обложки. Сервис давно подбирает обложку фильма под зрителя и выбирает варианты через эксперименты. Идея простая: один и тот же фильм можно показать через романтическую линию, через актёра или через экшен-сцену, и разным людям заходит разное. Эффект на вовлечённость оказался таким, что подбор обложек стал отдельным продуктовым направлением.
Microsoft и заголовки рекламы в Bing. Один из самых известных примеров асимметрии между усилиями и результатом. Небольшое изменение в том, как показывались заголовки рекламных объявлений, несколько месяцев лежало в бэклоге как низкоприоритетное. Когда его наконец протестировали, оно дало прирост выручки, измеряемый десятками процентов по этому направлению. Вывод, который из этого делают сами авторы экспериментов: интуиция плохо предсказывает размер эффекта, поэтому дешёвые гипотезы стоит проверять, а не ранжировать по ощущениям.
Отрезвляющая статистика. Рон Кохави, много лет отвечавший за эксперименты в Microsoft и до этого работавший в Amazon, приводит такое наблюдение: положительный эффект даёт примерно треть проверенных идей, ещё треть не меняет ничего, оставшаяся треть делает хуже. В командах вроде Booking.com называли цифры и скромнее, около 10% удачных тестов. Это не повод не тестировать, а повод правильно относиться к результату: основная ценность экспериментов в отсечении плохих идей, а не в череде побед.
15 ошибок, из-за которых тест врёт
Таблица сделана так, чтобы её можно было открыть рядом с отчётом. Левый столбец это ошибка, средний это то, как она выглядит в цифрах, правый это что делать.
| Ошибка | Как выглядит в отчёте | Что делать |
|---|---|---|
| Остановили тест досрочно | Значимость появилась на 4-й день и «зафиксирована» | Довести до расчётного срока, минимум две полные недели |
| Смотрели результат каждый день | График значимости прыгает вокруг порога 5% | Последовательный анализ или полный отказ от промежуточных выводов |
| Метрику выбрали после старта | В отчёте пять метрик, выделена одна выросшая | Фиксировать целевую метрику письменно до запуска |
| Нет защитных метрик | Клики выросли, про выручку в отчёте ни строки | Добавить выручку, отказы, отписки, скорость |
| Слишком маленькая выборка | По 400 человек в группе, разница «в полтора раза» | Посчитать выборку заранее, пересобрать тест |
| Перекос групп (SRM) | Деление 53 на 47 вместо 50 на 50 | Искать техническую причину, перезапускать |
| Пользователь видел оба варианта | Один и тот же клиент есть в обеих группах | Привязывать группу к идентификатору пользователя, а не к сессии |
| Тест шёл во время распродажи | Конверсия обеих групп вдвое выше обычной | Переносить тест на спокойный период |
| Тест короче недельного цикла | Данные за вторник, среду и четверг | Полные недели, кратно семи дням |
| Меняли что-то по ходу | Середина периода: скачок трафика после запуска рекламы | Замораживать всё внешнее на время теста |
| Резали данные до победного | Вывод сделан по срезу «мобильные, Москва, новые» | Считать найденное гипотезой для нового теста |
| Смотрели только p-value | «Значимо» при интервале от минус 3% до плюс 19% | Читать доверительный интервал и размер эффекта |
| Игнорировали эффект новизны | Первые три дня рост, дальше ровно | Смотреть динамику по дням и срез по новым пользователям |
| Тестировали несколько изменений сразу | Поменяли заголовок, кнопку и фото, эффект есть | Разделить на отдельные тесты либо переходить к MVT |
| Раскатали без проверки экономики | Рост конверсии 0,07 п. п. при месяце разработки | Сравнить эффект в деньгах со стоимостью внедрения |
Мини-кейс: как выглядит честный разбор отчёта
Разберём вымышленный, но типовой отчёт по шагам. Интернет-магазин тестировал новую карточку товара с ценой доставки на первом экране.
Исходные данные: группа A, 42 100 посетителей и 1 010 заказов. Группа B, 41 800 посетителей и 1 120 заказов. Конверсия A равна 2,40%, конверсия B равна 2,68%. Относительный рост 11,7%.
Первое, что проверяем, это баланс групп. 42 100 против 41 800 это расхождение в 0,4%, при таких объёмах допустимо. Признаков поломки нет, читаем дальше.
Второе, значимость и интервал. P-value выходит около 0,007, то есть значимо. Доверительный интервал для относительного роста примерно от 3% до 21%. Нижняя граница положительная, значит вариант B почти наверняка лучше, хотя истинный размер эффекта может оказаться втрое меньше наблюдаемого.
Третье, деньги. Средний чек 4 200 ₽, дополнительные 0,28 процентных пункта конверсии на 42 тысячах посетителей дают около 118 заказов, то есть примерно полмиллиона рублей выручки за период теста. Разработка карточки заняла неделю. Экономика сходится с запасом даже по нижней границе интервала.
Четвёртое, защитные метрики. Средний чек в группе B упал с 4 350 ₽ до 4 200 ₽. Вот это уже интересно: часть роста заказов пришлась на дешёвые позиции, где доставка не выглядит пугающей. Итоговая выручка всё равно выше, но эффект скромнее, чем показывала первая цифра.
Пятое, динамика. По дням рост ровный, всплеска в первые двое суток нет. Значит эффект новизны ни при чём.
Вывод по кейсу. Раскатываем вариант B, но в план ставим отдельный тест: не проседает ли выручка по дорогим товарам, где доставка дороже и заметнее.
Чек-лист запуска A/B-теста

Двенадцать пунктов, которые стоит пройти до старта, а не после.
- Узкое место воронки найдено по данным, а не по ощущениям
- Гипотеза записана в форме «если X, то Y на Z, потому что W»
- Целевая метрика одна и зафиксирована письменно
- Защитные метрики выбраны, их две или три
- Размер выборки посчитан под реалистичный MDE
- Срок теста укладывается в две-четыре полные недели
- Распределение привязано к пользователю, а не к сессии
- Вариант B проверен на мобильных, в разных браузерах и при медленном интернете
- На период теста заморожены акции, рекламные бюджеты и правки в дизайне
- Договорились не смотреть целевую метрику до конца срока
- Заранее решено, что делаем при каждом из трёх исходов: рост, падение, ничего
- Есть место, куда запишут результат, чтобы через полгода никто не предложил тот же тест снова
Словарь терминов
- Контрольная группа (A) текущая версия, точка отсчёта.
- Тестовая группа (B) версия с изменением.
- Конверсия доля пользователей, совершивших целевое действие.
- MDE минимальный эффект, который вы рассчитываете заметить.
- Уровень значимости (альфа) допустимая вероятность увидеть эффект там, где его нет. Обычно 5%.
- Мощность вероятность заметить эффект, если он есть. Обычно 80%.
- P-value вероятность получить такую же или большую разницу при отсутствии реального эффекта.
- Доверительный интервал диапазон правдоподобных значений эффекта.
- Peeking подглядывание в промежуточные результаты и остановка теста по ним.
- SRM расхождение фактического деления групп с задуманным.
- Guardrail-метрика защитная метрика, которая не должна ухудшиться.
- MVT многовариантное тестирование, проверка комбинаций нескольких элементов.
- Холдаут доля аудитории, надолго оставленная на старой версии для замера общего эффекта.
- Switchback схема, где чередуются не пользователи, а временные интервалы.
- CUPED метод снижения разброса метрики за счёт данных о поведении до эксперимента.
Сколько стоит провести A/B-тест
Прямые расходы на инструмент могут быть нулевыми: Varioqub бесплатен, эксперименты в рекламных кабинетах входят в сам кабинет, тест карточки на Ozon стоит около 299 ₽. Западные платформы вроде Optimizely и VWO начинаются от сотен долларов в месяц и берутся под большие объёмы.
Основная стоимость это люди и время. На один нормально собранный тест уходит примерно так: несколько часов аналитика на гипотезу, метрики и расчёт выборки, от одного дня до недели разработки на вариант B, две-четыре недели ожидания и ещё несколько часов на разбор результата. В деньгах для небольшой команды это чаще всего десятки тысяч рублей на тест, если считать по ставкам исполнителей.
Отсюда следует неочевидный вывод. Тест на изменение, которое в лучшем случае принесёт несколько тысяч рублей в месяц, не окупится никогда, даже если сам инструмент бесплатный. Сначала считаем потенциальную выгоду, потом решаем, нужен ли эксперимент.
Нанимать отдельного человека под A/B-тесты малому бизнесу обычно рано. Чаще эксперименты ведёт продуктовый или веб-аналитик в связке с маркетологом, а зарплатные ориентиры по этим ролям мы разбирали в статьях про профессию продуктового аналитика и заработок аналитика данных.
Где научиться A/B-тестированию
Самостоятельно освоить механику реально, и обучение можно построить бесплатно: калькулятор выборки, бесплатный Varioqub и один живой сайт закрывают базу. Сложнее с двумя вещами. Первая это статистика на уровне, где вы понимаете, почему подглядывание ломает результат. Вторая это практика на настоящих объёмах данных, которую негде взять, пока у вас нет доступа к продукту с трафиком.
Именно поэтому A/B-тесты почти никогда не изучают отдельным предметом. Они входят блоком в программы по продуктовой аналитике, веб-аналитике, продакт-менеджменту и интернет-маркетингу, где вокруг них есть SQL, метрики и работа с гипотезами. Ниже курсы, где эта тема разбирается на практике, с ценами, длительностью и отзывами студентов.
| Курс | Школа | Стоимость со скидкой | В рассрочку | Длительность | Обзор курса от Checkroi |
|---|---|---|---|---|---|
| Статистика и A/B-тестирование Перейти на сайт курса | 19 900 ₽ | 1658 ₽/мес. | 2 месяца | Обзор курса | |
| Симулятор A/B-тестов Перейти на сайт курса | 55 000 ₽ | 3217 ₽/мес. | 2 месяца | Обзор курса | |
| Профессия «Data Scientist PRO» Перейти на сайт курса | 224 595 ₽ | 7245 ₽/мес. | 12 месяцев | Обзор курса | |
| Профессия «Продюсер онлайн-курсов с нуля до PRO» Перейти на сайт курса | 129 055 ₽ | 4024 ₽/мес. | 6 месяцев | Обзор курса | |
| Программирование для анализа данных | 134 640 ₽ | 5500 ₽/мес. | 12 месяцев | Обзор курса | |
| Профессия «Аналитик данных с нуля до middle» Перейти на сайт курса | 145 600 ₽ | 6066 ₽/мес. | 12 месяцев | Обзор курса | |
| Системный аналитик с нуля Перейти на сайт курса | 71 750 ₽ | 5979 ₽/мес. | 6 месяцев | Обзор курса | |
| Аналитик данных с нуля Перейти на сайт курса | 126 936 ₽ | 4994 ₽/мес. | 4 месяца | Обзор курса | |
| Профессия «Аналитик данных» Перейти на сайт курса | 101 000 ₽ | 4156 ₽/мес. | 8 месяцев | Обзор курса | |
| Профессия «Продуктовый дизайнер» Перейти на сайт курса | 109 800 ₽ | 4787 ₽/мес. | 5 месяцев | Обзор курса |
Больше программ — в полном каталоге курсов по A/B-тестированию
При выборе смотрите на две вещи. Есть ли в программе разбор статистики (значимость, мощность, размер выборки), а не только кнопки в интерфейсе. И есть ли проектная работа с реальными или хотя бы приближенными к реальности данными: без неё после курса останется теория, которую нечем подкрепить в резюме.




