До 10%Рекомендуйте нас и получайте процент за каждого приведённого клиента

A/B-тестирование в интернет-магазине: как ставить и не обманываться

A/B-тестирование в интернет-магазине на 1С-Битрикс: гипотезы, выборка, значимость

«Поменяли кнопку — конверсия выросла на 12%». Знакомая радость, которая через месяц тихо испаряется. Проблема не в кнопке, а в том, что вывод сделан на глаз: посмотрели цифру, обрадовались, выкатили на всех. A/B-тестирование существует ровно для того, чтобы отличать реальный эффект от случайного шума — но само по себе оно не спасает от самообмана, если ставить тесты неаккуратно.

Эта статья — практический разбор того, как проводить A/B-тесты в интернет-магазине честно: как формулировать гипотезу, считать размер выборки, читать статистическую значимость и не попадаться на ошибку подглядывания. Отдельно разберём подводные камни 1С-Битрикс — прежде всего композитный кэш, который умеет незаметно ломать сплит. Если аналитику и данные заказов нужно навести в порядок системно, это делается в связке с аудитом и оптимизацией 1С.

Коротко

  • Тест начинается с гипотезы и одной главной метрики, а не с «давайте поменяем и посмотрим».
  • Размер выборки и срок считают заранее; завершают тест по плану, а не по красивой цифре.
  • Ошибка подглядывания — главный способ увидеть эффект, которого нет; не останавливайте тест на первом «выигрыше».
  • В 1С-Битрикс проверьте, что распределение по веткам не ломается композитным кэшем и корректно пишется в журнал событий.

Зачем магазину A/B-тесты и когда они врут

A/B-тест нужен, чтобы принимать решения по данным, а не по вкусу. Вы показываете двум случайным группам посетителей разные варианты страницы и сравниваете, у какой выше целевая метрика. Поскольку обе группы приходят в один и тот же период, сезонность, рекламные всплески и погода действуют на них одинаково — а значит, разница между вариантами объясняется именно изменением, а не внешними факторами.

Врут тесты не сами по себе, а из-за нарушений процедуры: маленькая выборка, ранняя остановка, подгонка сегментов, сломанное распределение. В интернет-магазине с этим особенно легко ошибиться — конверсия невысокая, заказов немного, а желание побыстрее увидеть результат велико. Поэтому дисциплина важнее инструмента: правильно поставленный тест на простом сервисе полезнее, чем неряшливый на дорогом.

Что такое A/B-тест и чем он не является

A/B-тест — это рандомизированный эксперимент: посетители случайно и стабильно распределяются между вариантом A (контроль) и вариантом B (изменение), а затем сравниваются их метрики. Ключевое слово — «случайно и стабильно»: один и тот же посетитель должен всё время видеть один вариант, иначе данные смешаются.

Чем A/B-тест не является:

A/B-тест: сравнение двух вариантов Трафикделим пополамВариант AконтрольныйВариант BгипотезаПобедительпо метрике
Схема: трафик делится поровну между контрольным вариантом и гипотезой; выигрывает тот, у кого статистически лучше целевая метрика. Решение — на данных, а не на вкусе.

Гипотеза: с чего начинается честный тест

Тест без гипотезы — это гадание. Хорошая гипотеза связывает наблюдение, изменение и ожидаемый эффект: «Пользователи не замечают кнопку заказа на карточке (наблюдение из карты кликов), поэтому если сделать её контрастнее и закрепить (изменение), вырастет доля добавлений в корзину (эффект)». Такую формулировку можно проверить и опровергнуть — в отличие от «давайте сделаем покрасивее».

Формула гипотезы: «Потому что мы видим [данные], мы считаем, что [изменение] приведёт к [эффект по метрике]». Если любую из трёх частей заполнить нечем — тест ставить рано, сначала нужны данные аналитики.

Гипотезы приоритезируют: сначала берут те, что дёшевы в реализации и потенциально дают большой эффект. Мелкие косметические правки лучше не гонять через полноценный тест — на них не хватит выборки, чтобы поймать крохотный эффект.

Метрика: что именно вы измеряете

У теста должна быть одна главная метрика, выбранная до запуска. Если решать постфактум, «по какой цифре мы выиграли», — вы гарантированно найдёте выигрышную и обманете себя. Для интернет-магазина главной метрикой обычно служит конверсия в заказ или выручка на посетителя, а вспомогательными — микроконверсии по воронке.

Тип метрикиПримерыРоль в тесте
ГлавнаяКонверсия в заказ, выручка на визитПо ней принимается решение
ВспомогательнаяДобавления в корзину, переходы к оформлениюОбъясняет, почему главная изменилась
ЗащитнаяСредний чек, возвраты, отказыЛовит побочный вред от изменения

Защитные метрики важны: вариант B может поднять конверсию, но уронить средний чек, и в деньгах вы уйдёте в минус. Поэтому вместе с главной метрикой всегда смотрят несколько защитных, чтобы «победа» не оказалась пирровой.

Размер выборки и длительность

Размер выборки считают заранее, до запуска. Он зависит от трёх величин: базовой конверсии, минимального эффекта, который вы хотите уловить, и требований к надёжности. Чем меньше эффект вы ловите, тем больше нужно наблюдений — и это нелинейно: поймать прирост в 2% на порядок дороже, чем в 20%.

  1. Возьмите базовую конверсию. Текущее значение метрики из аналитики за репрезентативный период.
  2. Задайте минимальный эффект. Прирост, ниже которого изменение бизнесу неинтересно.
  3. Рассчитайте выборку. Калькулятором размера выборки получите нужное число посетителей на ветку.
  4. Оцените срок. Разделите выборку на дневной трафик — и не менее одной-двух полных недель, чтобы захватить недельный цикл.

Если по расчёту тест должен идти месяцами, это сигнал: либо ловите более крупный эффект, либо тестируйте радикальные изменения, либо считайте по микроконверсиям, которых набирается больше. Растягивать слабый тест бесконечно — не решение.

Статистическая значимость без самообмана

Статистическая значимость отвечает на вопрос: насколько вероятно, что наблюдаемую разницу мог дать случай. Порог 95% означает, что вы согласны примерно в 5% случаев ошибочно принять шум за эффект. Это разумный компромисс, но у него есть два подвоха, о которых часто забывают.

Первый: значимость не равна величине эффекта. Разница может быть статистически значимой, но крохотной и бесполезной для бизнеса. Поэтому вместе со значимостью всегда смотрят доверительный интервал эффекта — на сколько именно вырос показатель и насколько оценка точна. Второй подвох связан с многократными проверками — о нём в следующем разделе.

Ошибка подглядывания и ранняя остановка

Самая частая причина ложных выводов — peeking, подглядывание. Если каждый день смотреть на промежуточные цифры и останавливать тест в момент, когда вариант B случайно вырвался вперёд, доля ложных «побед» вырастает в разы. Дело в том, что метрики колеблются, и при частых проверках рано или поздно наткнёшься на случайный всплеск и примешь его за результат.

Правило: зафиксируйте размер выборки и срок до старта и подводите итог только по их достижении. Хотите смотреть промежуточно — используйте методы с поправкой на многократные проверки, а не обычный порог 95% при ежедневном подглядывании.

То же касается остановки «потому что и так всё ясно». Пока не набрана плановая выборка, ясности нет — есть промежуточный шум. Дисциплина остановки — половина честности теста. Кстати, к дисциплине изменений на бою помогает и аккуратный процесс выкатки: как устроен безопасный деплой, мы разбирали в статье про CI/CD и деплой на Битрикс.

A/B-тесты и композитный кэш 1С-Битрикс

Здесь начинается специфика платформы. Композитный сайт 1С-Битрикс отдаёт статическую часть HTML из кэша, чтобы страница открывалась мгновенно. Если наивно подменять вариант A/B на сервере при генерации страницы, в кэш попадёт один вариант — и его увидят все, независимо от распределения. Тест сломается незаметно: цифры будут, а рандомизации не будет.

Чтобы этого избежать, назначение ветки и подмену варианта делают так, чтобы не завязывать их на кэшируемый HTML: распределение и отрисовку изменения выносят на клиентскую сторону либо в динамический слой поверх композита. Заодно проверяют, что идентификатор ветки стабилен для посетителя и корректно доживает до события заказа.

Инфраструктурная часть — кэш, композит, окружение — влияет на чистоту эксперимента сильнее, чем кажется. О том, как устроено окружение Битрикса, полезно почитать в материале про хостинг и инфраструктуру BitrixVM.

Инструменты и журнал событий

Технически тест держится на двух вещах: стабильном распределении посетителей и надёжной фиксации событий. События — показ варианта, добавление в корзину, оформление, оплата — должны попадать в журнал так, чтобы их можно было связать с веткой и с заказом. Если события теряются или пишутся с задержкой, любая статистика поедет.

Отладку тут ведут как обычную инженерную задачу: проверяют, что событие срабатывает ровно один раз, не дублируется при перезагрузке, корректно передаёт идентификатор ветки. Часть данных о заказах приходит из учётной системы, поэтому корректность воронки завязана на обмен и автоматизацию продаж и склада на 1С: статус «оплачен» или «отгружен» должен доезжать до аналитики без искажений.

Что тестировать в интернет-магазине

Тестировать имеет смысл то, что близко к деньгам и затрагивает много посетителей. Классические зоны для магазина:

Начинайте с этапов воронки, где теряется больше всего людей: именно там даже небольшое улучшение даёт заметный эффект в деньгах. А чтобы тесты можно было ставить быстро и безопасно, помогает гибкая архитектура витрины — её мы обеспечиваем услугой автоматизации на 1С и аккуратной разработкой.

Частые ошибки A/B-тестирования

Чек-лист запуска теста

  1. Гипотеза сформулирована. Есть данные-основание, изменение и ожидаемый эффект по метрике.
  2. Метрики выбраны заранее. Одна главная плюс вспомогательные и защитные.
  3. Выборка и срок рассчитаны. Известно, сколько посетителей и заказов нужно на ветку.
  4. Распределение проверено. Рандомизация не ломается композитным кэшем и стабильна для посетителя.
  5. События пишутся корректно. Показ, корзина, заказ и оплата связаны с веткой без дублей и потерь.
  6. План остановки зафиксирован. Итог подводится по достижении выборки, а не по подглядыванию.
  7. Итог задокументирован. Результат, значимость и размер эффекта записаны — даже если он отрицательный.

Вывод

A/B-тестирование — это инструмент против самообмана, но только если соблюдать процедуру. Гипотеза, одна главная метрика, заранее посчитанная выборка, честная остановка и корректная фиксация событий превращают тест из ритуала в источник надёжных решений. Без этого он лишь придаёт научный вид случайным цифрам.

На 1С-Битрикс к общей дисциплине добавляется техническая: проследите, чтобы композитный кэш не ломал распределение, а данные заказов из 1С доезжали до аналитики без искажений. Тогда тесты начнут экономить деньги — и на подтверждённых гипотезах, и на вовремя отброшенных.

Частые вопросы

Сколько времени должен идти A/B-тест в интернет-магазине?

Как минимум одну-две полные недели, чтобы захватить все дни недели и типичные колебания спроса. Ориентируйтесь не на срок, а на заранее рассчитанный размер выборки: тест завершают, когда набрано нужное число посетителей и конверсий в каждой ветке, а не когда «уже видно разницу». Останавливать раньше по красивым цифрам — самый частый способ обмануть себя.

Какой минимальный трафик нужен для A/B-теста?

Зависит от базовой конверсии и величины эффекта, который вы хотите поймать. Чем меньше исходная конверсия и чем скромнее ожидаемый прирост, тем больше нужно посетителей и заказов. Магазину с сотней заказов в месяц ловить прирост в 2–3% бессмысленно: выборка не наберётся за разумный срок. В таких случаях тестируют крупные изменения или считают по микроконверсиям.

Что такое статистическая значимость простыми словами?

Это оценка вероятности того, что наблюдаемая разница между вариантами — не случайность. Порог обычно берут 95%: если тест показывает значимость выше него, разницу считают неслучайной. Но значимость не гарантирует, что эффект большой или полезный для бизнеса, — она лишь говорит, что он, скорее всего, реален. Смотреть надо и на значимость, и на размер эффекта.

Можно ли остановить тест, как только вариант B вырвался вперёд?

Нет, это классическая ошибка подглядывания (peeking). Если многократно смотреть на промежуточные цифры и останавливаться на первом «выигрыше», доля ложных срабатываний резко растёт — вы будете видеть эффекты там, где их нет. Правильно — зафиксировать план заранее: размер выборки, срок и метрику, и подводить итог только по достижении плана.

Как A/B-тест уживается с композитным кэшем 1С-Битрикс?

Композитный сайт отдаёт HTML из кэша, поэтому наивная подмена варианта на сервере может «залипнуть» — всем покажется один вариант из кэша. Распределять посетителей по веткам и фиксировать вариант нужно так, чтобы это не ломало кэширование: обычно назначение ветки делают на стороне клиента или через отдельный слой, не завязанный на кэшируемый HTML. Это стоит проверить до запуска теста.

Чем A/B-тест отличается от простого сравнения «до и после»?

Сравнение «до и после» смешивает эффект изменения с сезонностью, рекламными всплесками и другими внешними факторами: вы не знаете, выросла конверсия из-за новой кнопки или из-за акции у конкурента. A/B-тест показывает оба варианта одновременно одной и той же аудитории, поэтому внешние факторы действуют на ветки одинаково и не искажают вывод.

Что делать, если тест не показал значимой разницы?

Это тоже результат: гипотеза не подтвердилась либо эффект слишком мал, чтобы его уловить на вашем трафике. Не подкручивайте порог и не продлевайте тест бесконечно в поисках значимости. Зафиксируйте, что изменение не даёт заметного эффекта, и переходите к следующей гипотезе — отрицательный результат экономит ресурсы не хуже положительного.

Нужно ли тестировать на мобильных и десктопе отдельно?

Часто да, потому что поведение и конверсия на этих устройствах сильно различаются. Изменение, полезное на десктопе, может мешать на мобильном, и общий результат «размажется». Если трафика хватает, полезно смотреть срезы по устройствам, но заранее заложить это в план, а не нарезать сегменты постфактум в поисках выигрышного среза.

Поделиться:

Хотите принимать решения по данным, а не на глаз?

Настроим достоверный учёт заказов и событий в 1С-Битрикс и 1С, чтобы A/B-тесты и аналитика опирались на честные цифры. Рассчитаем работу по вашему проекту.

Аудит и оптимизация 1С

Редакция B2Bsite

Команда B2Bsite. С 2014 года разрабатываем интернет-магазины на 1С-Битрикс: настраиваем аналитику, учёт заказов и корректный обмен с 1С, чтобы эксперименты и решения опирались на достоверные данные.

← Все статьи блога