[email protected] Обсудить проект
Главная/Блог/Юзабилити и конверсия/A/B-тестирование: как проводить эксперименты

A/B-тестирование: как проводить эксперименты

Рубрика: Юзабилити и конверсияВремя чтения: 11 минАвтор: команда MediaFrukt
A/B-тестирование: как проводить эксперименты

A/B-тест позволяет принимать решения о сайте на основе поведения реальных посетителей, а не вкусов руководства. Рассказываем, как мы готовим и проводим эксперименты для клиентов, когда тест имеет смысл, а когда лучше обойтись без него.

Спор о том, какая кнопка лучше — зелёная или оранжевая, какой заголовок убедительнее, нужна ли на странице цена, — может длиться бесконечно. У каждого участника есть мнение, и у каждого мнения есть аргументы. A/B-тестирование позволяет закончить такой спор фактами: показать разным посетителям разные варианты и посмотреть, какой из них даёт больше целевых действий.

Звучит просто, но на практике многие эксперименты проводятся так, что их результатам нельзя доверять. Разберём, как устроен A/B-тест, как его правильно подготовить и как не обмануть себя при анализе.

Как устроен A/B-тест

Суть метода в том, что трафик сайта случайным образом делится на две группы. Первая группа видит текущую версию страницы — её называют контрольной, или вариантом A. Вторая группа видит изменённую версию — вариант B. Всё остальное для обеих групп одинаково: источники трафика, время, условия. Поэтому если одна версия показывает лучший результат, разница с высокой вероятностью вызвана именно изменением.

Кроме классического A/B-теста, существуют и другие форматы:

  • A/B/n-тест — сравнение нескольких вариантов одновременно. Требует больше трафика, так как он делится на большее число групп.
  • Многовариантный тест — одновременная проверка нескольких элементов и их сочетаний. Подходит только для сайтов с очень большим трафиком.
  • Сплит-тест страниц — сравнение двух полностью разных страниц, например старого и нового лендинга.

Для большинства проектов наших клиентов оптимален классический тест с двумя вариантами. Он даёт понятный результат и не требует огромного трафика.

Когда тестировать имеет смысл

A/B-тест — мощный инструмент, но не универсальный. Он требует достаточного числа посетителей и целевых действий. Если на сайт заходит тридцать человек в день и приходит одна заявка в неделю, эксперимент придётся вести месяцами, и за это время изменится слишком многое — сезон, реклама, конкуренты.

Тестирование оправдано, когда:

  • на странице достаточно трафика — хотя бы несколько сотен визитов в день;
  • целевых действий набирается хотя бы несколько десятков в неделю на каждый вариант;
  • изменение затрагивает важный для конверсии элемент;
  • в команде есть разногласия, и данные помогут их разрешить;
  • цена ошибки высока — например, при изменении цен или структуры тарифов.

Если трафика мало, не нужно отказываться от улучшений. Можно опираться на качественные методы — записи сессий, опросы, юзабилити-тесты с несколькими людьми — и внедрять очевидные исправления без эксперимента. Сломанную форму не нужно тестировать, её нужно чинить.

Тестируйте то, в чём есть реальная неопределённость. Если вы точно знаете, что изменение улучшит сайт — например, исправление ошибки, — просто внедрите его.

Гипотеза: основа любого эксперимента

Тест без гипотезы — это лотерея. Можно менять цвета кнопок наугад и иногда получать случайные «победы», но системного роста так не добиться. Хорошая гипотеза опирается на данные и объясняет, почему изменение должно сработать.

Мы формулируем гипотезы по шаблону: «Если мы изменим X, то метрика Y вырастет, потому что Z». Например:

  1. Если мы добавим на страницу услуги примерные цены, то конверсия в заявку вырастет, потому что по записям сессий видно, как люди ищут стоимость и уходят, не найдя её.
  2. Если мы сократим форму до двух полей, то доля отправленных заявок вырастет, потому что половина людей бросает форму на поле «Email».
  3. Если мы заменим стоковое фото на первом экране реальной фотографией команды, то время на странице увеличится, потому что в опросе клиенты называли личный контакт главной причиной выбора.

Часть «потому что» — самая важная. Она заставляет опираться на наблюдения, а не на догадки, и помогает интерпретировать результат. Даже если гипотеза не подтвердилась, вы узнаёте что-то новое о своей аудитории.

Когда гипотез набирается много, их стоит приоритизировать. Мы оцениваем каждую по трём параметрам: ожидаемое влияние на результат, уверенность в гипотезе и трудоёмкость внедрения. В первую очередь идут гипотезы с высоким влиянием и небольшими затратами.

Выбор метрики и объём выборки

Прежде чем запускать тест, нужно определить главную метрику — ту, по которой будет определяться победитель. Обычно это конверсия в целевое действие: заявку, заказ, регистрацию. Можно отслеживать и дополнительные метрики, но решение принимается по одной заранее выбранной.

Почему это важно? Если отслеживать десяток метрик, одна из них почти наверняка покажет «значимую» разницу случайно. Соблазн выбрать её постфактум и объявить победу очень велик.

Следующий шаг — рассчитать необходимый объём выборки. Он зависит от трёх вещей:

  • текущей конверсии страницы;
  • минимального эффекта, который вы хотите обнаружить;
  • требуемого уровня уверенности в результате.

Чем ниже текущая конверсия и чем меньше ожидаемый эффект, тем больше посетителей нужно. Для расчёта есть бесплатные онлайн-калькуляторы размера выборки. Если калькулятор показывает, что для теста нужно полгода, лучше выбрать более смелое изменение, которое даст больший эффект, или протестировать страницу с большим трафиком.

Как провести тест правильно

Подготовка завершена, можно запускать. Вот правила, которые мы соблюдаем в каждом эксперименте:

  1. Меняйте одно. Если в варианте B изменены заголовок, кнопка и фотография одновременно, при победе вы не узнаете, что именно сработало. Исключение — сплит-тест полностью разных страниц, когда цель — выбрать лучшую страницу целиком.
  2. Делите трафик случайно и стабильно. Один и тот же посетитель при повторном заходе должен видеть тот же вариант.
  3. Проверьте оба варианта перед запуском. На разных устройствах, в разных браузерах. Сломанный вариант B гарантированно проиграет, и вывод будет ложным.
  4. Не подглядывайте с целью остановить. Смотреть на промежуточные данные можно, но останавливать тест, как только появилась «значимая» разница, нельзя — это главная причина ложных результатов.
  5. Держите тест минимум полную неделю, а лучше две. Поведение посетителей в будни и выходные различается, и тест должен охватить полный цикл.
  6. Не меняйте ничего по ходу. Запуск новой рекламной кампании, изменение цен или акция посреди теста искажают результаты.
Заранее запишите: какую гипотезу проверяете, по какой метрике судите, сколько посетителей нужно и когда остановите тест. Этот короткий план защищает от соблазна подогнать выводы под желаемый результат.

Анализ результатов

Тест завершён, нужный объём данных набран. Дальше возможны три исхода.

Вариант B победил со статистической значимостью. Внедряем его для всех посетителей и фиксируем результат. Полезно понаблюдать за метрикой ещё пару недель: иногда эффект новизны со временем ослабевает.

Вариант B проиграл. Это тоже ценный результат. Гипотеза не подтвердилась, значит, наше понимание аудитории было неточным. Стоит разобраться почему и сформулировать новую гипотезу.

Разницы нет. Самый частый исход, и в нём нет ничего страшного. Изменение не повлияло на поведение посетителей — значит, этот элемент не был узким местом. Можно оставить любой вариант и перейти к следующей гипотезе.

При анализе стоит смотреть на сегменты: иногда вариант B выигрывает на мобильных и проигрывает на компьютерах, а в сумме разница нулевая. Но сегментный анализ — источник новых гипотез, а не повод объявить победу. Если в одном сегменте из десяти нашлась разница, её стоит перепроверить отдельным тестом.

В одном из проектов — интернет-магазине товаров для сада — мы тестировали отображение стоимости доставки прямо в карточке товара. В целом рост конверсии оказался небольшим, но в сегменте посетителей из регионов он был заметным. Следующим тестом мы проверили отдельный блок с условиями доставки для регионов, и эта гипотеза дала уверенный результат.

Частые ошибки

Вот что чаще всего портит эксперименты:

  • остановка теста при первом появлении значимой разницы;
  • слишком маленькая выборка и выводы по десятку конверсий;
  • тестирование незначительных деталей на странице с небольшим трафиком;
  • одновременный запуск нескольких тестов на одной странице, которые влияют друг на друга;
  • отсутствие проверки варианта B на мобильных устройствах;
  • игнорирование качества заявок: вариант B дал больше заявок, но меньше продаж.

Последний пункт стоит выделить. Если есть возможность, связывайте результаты теста с данными CRM. Иногда вариант, который приносит больше заявок, привлекает менее целевых клиентов, и в итоге продаж становится меньше.

Что важно запомнить

A/B-тестирование — способ принимать решения о сайте на основе поведения посетителей, а не мнений. Чтобы эксперименту можно было доверять, нужны обоснованная гипотеза, одна главная метрика, заранее рассчитанный объём выборки и дисциплина — не останавливать тест раньше времени и не менять условия по ходу.

Начните с одной гипотезы на самой посещаемой странице. Даже если первый тест не даст роста, вы выстроите процесс и научитесь по-новому смотреть на данные. Команда MediaFrukt помогает клиентам на тарифах «Стандарт» и «Эксклюзив» выстроить регулярную работу с гипотезами: от сбора данных до внедрения победивших вариантов.

Нужна помощь с задачей?

Команда MediaFrukt разберёт ваш проект и предложит решение. Консультация бесплатна.

Обсудить проект