Ученье свет

Контакты

Главная Каталог A/B‑тесты простым языком

A/B‑тесты простым языком

Дата создания September 1, 2026
Отзывы (4.4 оценка учеников)

О чем этот курс

Этот курс — практическое руководство по A/B‑тестам для продакт‑менеджеров, маркетологов и начинающих аналитиков. Вместо сложных формул — понятные шаги, числовые примеры и готовые шаблоны. Вы научитесь отличать настоящий эксперимент от простого сравнения, правильно выбирать метрики, избегать искажений и принимать взвешенные продуктовые решения.

Важно: p‑value не является автоматическим ответом «внедрять/не внедрять». Мы покажем, как сочетать статистическую и практическую значимость, доверительные интервалы, риски и контекст бизнеса.

flowchart TD
    A["Idea"] --> B["Hypothesis"]
    B --> C["Define metrics (primary, guardrails)"]
    C --> D["Design (Control/Test, unit)"]
    D --> E["Randomize"]
    E --> F["Run"]
    F --> G["Monitor guardrails"]
    G --> H["Analyze (effect size, CI, p-value)"]
    H --> I{"Decision"}
    I --|Ship|--> J["Learnings"]
    I --|Repeat|--> J
    I --|Reject|--> J
    J --> K["Backlog"]

Что вы получите

  • Шаблон паспорта эксперимента и чек‑лист запуска.
  • Интуитивное понимание метрик: основная, защитные, диагностические.
  • Навык расчёта примерного размера выборки, длительности и интерпретации интервалов.
  • Практику на реальных кейсах, мини‑тесты и разбор типичных ошибок.

Структура и форматы внутри каждого модуля

Каждый модуль включает: кейс, практику с числами, мини‑тест (3–5 вопросов) и разбор ошибочного решения.

Модуль 1. Гипотеза и ожидаемый механизм эффекта

  • Смысл гипотезы: «Если мы сделаем X, то Y изменится, потому что Z» — где Z это механизм.
  • Кейс: новая кнопка «Купить» на карточке товара.
  • Практика: переписать «хотим увеличить конверсию» в проверяемую гипотезу с механизмом.
  • Мини‑тест: выбрать корректную формулировку гипотезы и контрафакт.
  • Разбор ошибки: гипотеза без механизма → ложное чувство контроля, путаница в метриках.

Модуль 2. Контроль и тест, случайное распределение, единица рандомизации

  • Контроль vs тест: что фиксируем, что меняем, что держим постоянным.
  • Единица рандомизации: пользователь, сессия, заказ; когда что выбирать (избежать «перетекания» эффектов).
  • Кейс: рекомендательная лента — рандомизируем пользователя, а не показ.
  • Практика: подобрать единицу рандомизации для 3 сценариев (email‑кампания, баннер, корзина).
  • Мини‑тест: определить, где возможны коллизии и как с ними быть.
  • Разбор ошибки: рандомизация по сессии при долгоживущем эффекте → смазанные оценки.

Модуль 3. Метрики: основная, защитные и диагностические

  • Основная метрика: связка с целью продукта и гипотезой.
  • Защитные (guardrails): не ухудшаем отмены, жалобы, ошибки, задержки.
  • Диагностические: помогают понять «почему», но не решают «внедрять ли».
  • Кейс: рост конверсии в заказ при падении среднего чека — как принять решение?
  • Практика: составить дерево метрик и выбрать primary + 2 guardrails.
  • Мини‑тест: что делать при конфликте метрик.
  • Разбор ошибки: выбор нескольких основных метрик → множественные сравнения и ложные срабатывания.
graph TD
  NSM["North Star Metric"] --> Primary["Primary metric: Conversion"]
  Primary --> CTR["CTR"]
  Primary --> CheckoutRate["CheckoutRate"]
  Primary --> AOV["AOV"]

  subgraph Guardrails
    Retention["Retention"]
    Churn["Churn"]
    Latency["Latency"]
    ErrorRate["ErrorRate"]
  end

  Primary -. "diagnostics" .-> ClickMap["ClickMap"]
  Primary -. "diagnostics" .-> AddToCart["AddToCart"]
  Primary -. "diagnostics" .-> SessionTime["SessionTime"]

Модуль 4. Статистическая и практическая значимость, доверительные интервалы, ошибки I/II рода

  • Интуитивно: статистическая значимость говорит «эффект отличим от нуля», практическая — «эффект нам выгоден».
  • Доверительный интервал: диапазон разумных значений эффекта.
  • Ошибки I/II рода: ложные тревоги и пропущенные улучшения; баланс рисков.
  • Кейс: значимость достигнута, но эффект меньше MDE — что решаем?
  • Практика: прочитать интервал и сверить с порогом окупаемости.
  • Мини‑тест: интерпретация p‑value и 95% CI.
  • Разбор ошибки: «p=0.04 значит 96% шанс, что тест лучше» — почему это неверно.
Числовой пример 1: разница конверсий и 95% CI

Эксперимент на посетителях сайта:

ГруппаПосетителей (n)ПокупокКонверсия
Контроль (A)20 0002 00010.0%
Тест (B)20 0002 14010.7%

Разница B−A = +0.7 п.п. Пул‑оценка p≈0.1035, стандартная ошибка ≈0.3046 п.п., z≈2.30, p≈0.021. 95% CI: от +0.1 до +1.3 п.п. Вывод: эффект, вероятно, положительный, но нижняя граница может быть меньше порога окупаемости, поэтому бизнес‑решение требует сопоставления с MDE/экономикой.

Модуль 5. Мощность, размер выборки (интуитивно) и длительность теста

  • Мощность: шанс заметить важный для нас эффект (MDE) при заданных рисках.
  • Правило: меньше базовый уровень и меньше MDE → больше выборка и дольше тест.
  • Кейс: email‑кампания с низкой базовой конверсией.
  • Практика: прикинуть длительность при данном трафике.
  • Мини‑тест: как изменится длительность при MDE в 2 раза меньше.
  • Разбор ошибки: остановка «когда стало зелёным» → завышение ложноположительных.
Числовой пример 2: грубая оценка размера выборки и длительности

Цель: увидеть рост с 10.0% до 10.5% (MDE=+0.5 п.п.), α=0.05, мощность 80%.

ПараметрЗначение
Оценка n на группу≈ 57 000
Доступный трафик/день10 000 уникальных пользователей
На группу в день≈ 5 000
Оценка длительности≈ 12 дней чистого трафика → планируем 14 дней, чтобы покрыть полные недели и сезонность

Модуль 6. Преждевременная остановка и множественные сравнения

  • Почему «подглядывание» увеличивает шанс ложноположительного результата.
  • Простые стратегии: фиксированный горизонт или корректные последовательные методы.
  • Множественные сравнения: много метрик/вариантов → контроль FWER/FDR (на интуитивном уровне). Пример: Бонферрони как простой бампер.
  • Кейс: 1 контроль + 4 варианта, 6 метрик — что делать?
  • Практика: отметить где нужна корректировка и какие метрики оставить диагностическими.
  • Мини‑тест: вопросы на FWER vs FDR.
  • Разбор ошибки: выбор лучшего из 5 по наименьшему p‑value без поправок.

Модуль 7. Перекос выборки, сезонность и другие искажения

  • Источники перекоса: каналы трафика, устройства, регионы, новые/старые пользователи.
  • Сезонность и календарные эффекты: почему важно включать полные недели.
  • Коллизии и «перетекание» эффекта между группами; кросс‑девайс.
  • Кейс: в тесте больше мобильного трафика — ложный рост конверсии.
  • Практика: отчистить срезы и проверить баланс по ключевым признакам.
  • Мини‑тест: где риск смещения выше и как его снизить.
  • Разбор ошибки: ретроспективное «подсматривание» лучшего среза.

Модуль 8. Анализ результатов и принятие решения

  • Чтение отчёта: эффект, 95% CI, p‑value, метрики‑защитники, срезы.
  • Решение: внедрять, повторить или отказаться — с учётом практической значимости, рисков и стоимости внедрения.
  • Кейс: эффект пограничный, защитная метрика слегка просела.
  • Практика: сформулировать рекомендацию и риски.
  • Мини‑тест: что делать при конфликте сигналов.
  • Разбор ошибки: «p<0.05 значит внедряем всегда» — почему это опасно.

Модуль 9. Итоговый проект

Вы создадите полноценный паспорт эксперимента и отчёт по условным данным, завершив рекомендацией: внедрять, повторить или отказаться.

  • Паспорт эксперимента: гипотеза и механизм, аудитория, единица рандомизации, дизайн (контроль/тест), основная и защитные метрики, MDE, размер выборки, длительность, риски и план мониторинга.
  • Отчёт по данным: таблицы результатов, 95% CI, интерпретация, влияние на экономику, решение и план дальнейших шагов.

Схема: жизненный цикл A/B‑теста

flowchart TD
    A["Idea"] --> B["Hypothesis"]
    B --> C["Define metrics (primary, guardrails)"]
    C --> D["Design (Control/Test, unit)"]
    D --> E["Randomize"]
    E --> F["Run"]
    F --> G["Monitor guardrails"]
    G --> H["Analyze (effect size, CI, p-value)"]
    H --> I{"Decision"}
    I --|Ship|--> J["Learnings"]
    I --|Repeat|--> J
    I --|Reject|--> J
    J --> K["Backlog"]

Карта метрик

graph TD
  NSM["North Star Metric"] --> Primary["Primary metric: Conversion"]
  Primary --> CTR["CTR"]
  Primary --> CheckoutRate["CheckoutRate"]
  Primary --> AOV["AOV"]

  subgraph Guardrails
    Retention["Retention"]
    Churn["Churn"]
    Latency["Latency"]
    ErrorRate["ErrorRate"]
  end

  Primary -. "diagnostics" .-> ClickMap["ClickMap"]
  Primary -. "diagnostics" .-> AddToCart["AddToCart"]
  Primary -. "diagnostics" .-> SessionTime["SessionTime"]

Оглавление

10 часа

Курс содержит:
  • Длительность: 10 часа
  • Студентов: 42
  • Сертификат: Да

Похожие курсы

Другие курсы по близким темам

Подпишитесь сегодня — получайте полезные идеи