
Самая частая ошибка при тестировании сайтов — слишком ранние выводы по слишком маленьким данным. Если разобраться, как работает статистическая значимость, многие решения становится принимать одновременно проще и осторожнее: одни тесты можно смело запускать, других не стоит делать вообще.
01Что такое статистическая значимость простыми словами
Статистическая значимость — это ответ на вопрос «насколько вероятно, что наблюдаемая разница между группами случайна». Если значимость высокая, мы уверены, что эффект реальный. Если низкая — разница могла появиться сама собой, просто потому что повезло одной из групп.
Важно понимать: значимость не говорит, что изменение «работает на 95%». Она говорит, что при отсутствии реального эффекта получить такую разницу было бы маловероятно. И ровно поэтому маленькая выборка опасна — на 100 посещениях «случайно повезти» намного проще, чем на 10 000.
02Почему маленькая выборка обманывает
Представьте сайт с обычной конверсией около 2%. В вариант A пришло 200 человек, в вариант B — тоже 200. В первом — 4 заявки, во втором — 7. Разница «в 1,75 раза» выглядит огромной. Но при таких объёмах подобный разрыв легко получается просто случайно: достаточно, чтобы в одну из групп залетели два мотивированных клиента в один день.
Чем меньше базовая конверсия и чем меньше посетителей — тем больше «случайной болтанки» в результатах. Поэтому интернет-магазины с потоком тысяч пользователей в день могут проводить эксперименты быстро, а узкоспециализированный b2b-сайт — нет.
03Как примерно прикинуть нужный объём
Точный расчёт делается через калькуляторы выборки. Для них нужно указать три параметра:
- Базовую конверсию текущего варианта (например, 2%).
- Минимальный эффект, который вы готовы считать значимым (например, +20% к этой конверсии).
- Уровень значимости и мощность теста (обычно 95% и 80%).
Учебный пример. При базе 2% и эффекте +20% (т. е. рост до 2,4%) на каждую группу потребуется примерно 16–18 тысяч уникальных посетителей. Если ваш сайт получает 200 заявок в месяц, такой тест займёт месяцы. Это не значит «не делать тест» — это значит, что нужно либо тестировать более серьёзные изменения, либо переключаться на гипотезы с большим ожидаемым эффектом, либо подключать качественные методы. О том, как уложиться в скромный бюджет, есть отдельный материал про дешёвое тестирование.
04Главные ошибки при работе с выборкой
- «Подсматривание» результатов. Если вы заходите в отчёт каждые два часа и останавливаете тест, как только «появилась разница», уровень значимости фактически перестаёт работать.
- Сравнение по микро-метрикам вместо макро-результата. Клики и скроллы могут быть значимы при меньшей выборке, но они не равны заявкам и продажам.
- Игнорирование сезонности. Тест, проведённый только в выходные, переносить на будни нельзя.
- Сегментация после теста. Если результат «выровнялся», но «зато в Москве он значимо лучше» — почти наверняка это иллюзия. На каждом срезе выборка ещё меньше.
- Тесты без контроля. «До и после» — это не тест, а наблюдение. На результат влияют и сезон, и реклама, и поведение конкурентов.
05Когда тесту нельзя верить
Чек-лист «не доверять и не катить в продакшн»:
- В каждой группе меньше 100–200 целевых событий (например, заявок).
- Тест шёл меньше одного полного бизнес-цикла (часто — меньше двух недель).
- Победитель определился в первые сутки и «значимость» появилась слишком быстро.
- В группах сильно разный состав трафика: один источник попал в одну группу больше, чем в другую.
- Изменялся не один элемент, а несколько — без планов на multivariate. Подробнее об этом разнице см. статью о типах тестов.
Если что-то из этого про ваш тест — лучше его не считать доказательством. Это рабочая гипотеза, которую нужно перепроверять.
06Что делать, если трафика мало
Если бизнес небольшой, A/B со статистикой по щелчку пальцев не получится. Это нормально. Стратегий несколько:
- Тестировать только крупные изменения, у которых ожидаемый эффект большой, — их видно быстрее.
- Опираться на качественные методы: интервью с клиентами, юзабилити-тестирование, разбор записей вебвизора.
- Смотреть на корректно настроенные микро-конверсии и поведение пользователей в Яндекс.Метрике.
- Использовать тесты офера через рекламу — там трафик можно «подкрутить» бюджетом.
Эти подходы не дают строгих p-value, но позволяют принимать осмысленные решения. Так и устроена работа в рамках направления дизайна и аналитики на небольших проектах.
Честная статистика вместо красивых цифр
Перед каждым тестом считаем выборку и срок, отдельно проверяем корректность аналитики, не публикуем «победителей» по 5–10 заявкам. Решения по сайту принимаем только когда данные действительно говорят, а не угадывают.
Официальная документация по теме — Справка Яндекс.Метрики.
