Clew

ГлавнаяИнструментыA/B-тестированиеКалькулятор A/B-тестов

Калькулятор A/B-тестов со значимостью, выборкой и сроком

Проверьте, значима ли разница конверсий, узнайте, сколько посетителей и дней нужно тесту, и посмотрите на результат глазами байесовской статистики. Графики распределений с доверительными интервалами и перцентилями — как в классических калькуляторах.

● Бесплатно, без регистрацииОбновлено:

A — контроль

B — вариант

Уровень доверия
Гипотеза
Двусторонняя ловит и рост, и падение. Одностороннюю выбирайте заранее, до запуска теста.

—

 

Конверсия A— 
Конверсия B— 
Разница— 
Относительный прирост— 
p-value— 
Мощность— 
Распределения конверсий A и Bзатемнено — доверительный интервал
Распределения конверсий A и B
A — контрольB — вариантпунктир — границы интервала, сплошная — медиана
Перцентили распределений
2,5-й перцентиль50-й (медиана)97,5-й перцентиль
A———
B———
B − A———
Распределение разницы B − A, п.п.интервал не задевает ноль — разница значима
Распределение разницы B − A, п.п.

Не подглядывайте. Решение принимают один раз, когда набрана заранее рассчитанная выборка. Если проверять p-value каждый день и остановиться при первом «значимо», доля ложных побед вырастает в разы.

Расчёт идёт в вашем браузере — введённые данные никуда не отправляются.

Как пользоваться

  1. Выберите режимДо запуска — «Выборка и срок»: он скажет, сколько посетителей и дней нужно. После — «Проверить результат» или «Байесовский подход».
  2. Введите данныеПосетителей и конверсии для контроля (A) и варианта (B). Конверсии — это пользователи, выполнившие целевое действие, а не события.
  3. Прочитайте выводВердикт наверху объясняет результат словами; ниже — p-value, интервалы и графики распределений. Наведите курсор на график, чтобы увидеть значение и перцентиль.
  4. Поделитесь ссылкойПараметры сохраняются в адресе страницы. Кнопка «Скопировать ссылку» отдаёт URL, по которому коллега увидит тот же расчёт.

Как калькулятор считает значимость

В режиме «Проверить результат» используется классический z-тест для двух долей — тот же, что в большинстве калькуляторов A/B-тестов. Нулевая гипотеза: конверсии A и B одинаковы, а наблюдаемая разница — случайность выборки.

Сначала считаются конверсии pA = xA / nA и pB = xB / nB. Для проверки гипотезы стандартная ошибка разницы берётся по объединённой (pooled) доле — потому что при верной нулевой гипотезе у обеих групп одна конверсия:

p̂ = (x_A + x_B) / (n_A + n_B) SE₀ = √( p̂ · (1 − p̂) · (1/n_A + 1/n_B) ) z = (p_B − p_A) / SE₀ p-value = 2 · (1 − Φ(|z|)) — двусторонний тест p-value = 1 − Φ(z) — односторонний, H₁: p_B > p_A

Здесь Φ — функция стандартного нормального распределения. Разница значима, если p-value меньше α = 1 − уровень доверия.

Доверительные интервалы

Интервалы строятся уже без объединения долей — у каждой группы своя дисперсия (интервал Вальда):

SE_A = √( p_A (1 − p_A) / n_A ) CI_A = p_A ± z₁₋α/₂ · SE_A SE_Δ = √( SE_A² + SE_B² ) CI_Δ = (p_B − p_A) ± z₁₋α/₂ · SE_Δ

Интервал для относительного прироста pB/pA − 1 получен дельта-методом. Именно эти нормальные распределения N(p, SE) нарисованы на графиках: затемнённая область — доверительный интервал, пунктирные линии — его границы (например, 2,5-й и 97,5-й перцентили при 95 %), сплошная — медиана.

Мощность и проверка выборок

«Мощность» — наблюдаемая (post-hoc): вероятность, с которой тест такого объёма заметил бы разницу, равную наблюдаемой. Это подсказка «хватает ли данных», а не аргумент в пользу гипотезы: наблюдаемая мощность однозначно связана с p-value и нового знания не добавляет.

Калькулятор также проверяет SRM (sample ratio mismatch) — критерий χ² для равного деления трафика. Если посетители распределились заметно неравно, чаще всего сломан сплит, и сравнивать конверсии бессмысленно.

Размер выборки и длительность теста

Сколько посетителей нужно, зависит от четырёх чисел: текущей конверсии, минимального эффекта, который вы хотите заметить (MDE), уровня значимости α и мощности 1 − β. Калькулятор использует формулу для сравнения двух долей в нормальном приближении — ту же, что в калькуляторе Эвана Миллера, поэтому результаты совпадают:

δ = MDE (в абсолютных долях; относительный MDE умножается на p) n = ( z₁₋α/₂ · √(2p(1 − p)) + z₁₋β · √(p(1 − p) + (p + δ)(1 − p − δ)) )² / δ²

Число n — посетителей в каждом варианте. Срок теста = n × число вариантов ÷ посетителей в день.

Если вариантов больше двух, каждое сравнение с контролем — отдельная возможность ошибиться. Калькулятор применяет поправку Бонферрони: α делится на число сравнений. Она консервативна, зато простая и честная; цена — выборка растёт.

Практические правила:

  • Держите тест целыми неделями — минимум 7 дней, лучше 14: у будней и выходных разная аудитория.
  • Уменьшение MDE вдвое требует примерно вчетверо больше трафика. Если тест выходит на полгода, тестируйте более смелое изменение или метрику ближе к действию.
  • Для онбординга удобнее метрики с высокой базовой конверсией — завершение шага, первое ключевое действие, — чем оплата: выборка для них в разы меньше.

Байесовский подход: вероятность, что B лучше

Байесовский режим отвечает на вопрос, который обычно и задают: с какой вероятностью B лучше A? Конверсия каждого варианта описывается бета-распределением. С априорным Beta(α, β) и данными x конверсий из n посетителей апостериорное распределение — Beta(α + x, β + n − x) (сопряжённая модель бета-биномиального распределения).

P(B > A) = ∫ f_B(x) · F_A(x) dx Риск выбрать B = E[ max(p_A − p_B, 0) ] Риск оставить A = E[ max(p_B − p_A, 0) ]

Вероятность превосходства считается численным интегрированием и сверена в тестах с точной формулой Эвана Миллера для целых параметров и с моделированием методом Монте-Карло. Ожидаемые потери — сколько конверсии в среднем теряется, если выбор окажется неверным. Удобное правило остановки: заканчивать тест, когда риск выбранного варианта ниже порога, который для бизнеса несущественен.

Байесовский вывод не отменяет дисциплину: подглядывание и остановка «при первых 95 %» портят и его. Равномерное априорное распределение Beta(1, 1) почти не влияет на результат при сотнях конверсий; информативное априорное распределение имеет смысл, только если оно честно отражает прошлые тесты.

Как читать результат и каких ошибок избегать

Что значит «статистически значимо»

p-value = 0,03 означает: если бы разницы на самом деле не было, такой или больший разрыв получался бы примерно в 3 % случаев. Это не вероятность того, что B лучше, и не размер эффекта. Размер показывает доверительный интервал: «+0,2…+1,4 п.п.» честнее, чем «+16 %, значимо».

Типичные ошибки

  • Подглядывание. Проверять значимость каждый день и остановиться при первом p < 0,05 — верный способ получить ложную победу. Рассчитайте выборку заранее и принимайте решение один раз.
  • Остановка после «значимо», но до недели. Эффект новизны и дни недели искажают первые дни теста.
  • Много метрик и сегментов. Проверив двадцать метрик, одну «значимую» вы найдёте случайно. Главную метрику выбирайте до запуска, сегменты — только как повод для следующего теста.
  • Неравный сплит (SRM). Если группы разошлись по размеру сильнее, чем допускает случай, ищите баг в распределении трафика, а не победителя.
  • Считать конверсии по событиям. Один пользователь, нажавший кнопку пять раз, — одна конверсия. Тест предполагает независимые наблюдения.
  • «Незначимо» = «нет эффекта». Незначимый результат при малой выборке означает только, что данных не хватило. Смотрите на интервал: если в нём помещается и −5 %, и +10 %, тест ничего не решил.

Если вы тестируете онбординг — тур против его отсутствия или две версии чеклиста, — сравнивайте не «прошёл тур», а активацию: первое ключевое действие. О том, как её поднимать, — в статье «Как повысить активацию пользователей».

Источники

  1. Fleiss J. L., Levin B., Paik M. C. Statistical Methods for Rates and Proportions. 3rd ed. Wiley, 2003 — z-тест для двух долей и размер выборки.
  2. Miller E. Sample Size Calculator — evanmiller.org/ab-testing/sample-size.html; Miller E. Formulas for Bayesian A/B Testing — evanmiller.org/bayesian-ab-testing.html.
  3. Kohavi R., Tang D., Xu Y. Trustworthy Online Controlled Experiments. Cambridge University Press, 2020 — SRM, подглядывание, выбор метрик.
  4. Marsaglia G. Evaluating the Normal Distribution. Journal of Statistical Software, 11(4), 2004 — вычисление Φ(x).
  5. Press W. H. et al. Numerical Recipes. 3rd ed., §6.4 — неполная бета-функция.

Частые вопросы

Как проверить статистическую значимость A/B-теста?

Введите посетителей и конверсии обеих групп в режиме «Проверить результат». Калькулятор посчитает z-тест для двух долей и p-value: если p-value меньше 1 − уровень доверия (например, 0,05 при 95 %), разница статистически значима. Смотрите и на доверительный интервал разницы — он показывает, насколько велик эффект.

Сколько должен длиться A/B-тест?

Столько, сколько нужно, чтобы набрать рассчитанную заранее выборку, но не меньше 7 полных дней. В режиме «Выборка и срок» укажите текущую конверсию, минимальный эффект и трафик в день — калькулятор вернёт число посетителей на вариант и срок в днях.

Какой уровень доверия выбрать: 90, 95 или 99 %?

Стандарт — 95 %. 90 % подходит для дешёвых обратимых изменений, где цена ложной победы мала; 99 % — для рискованных решений вроде цен. Чем выше уровень доверия, тем больше нужна выборка.

Чем односторонний тест отличается от двустороннего?

Двусторонний проверяет, отличается ли B от A в любую сторону; односторонний — только лучше ли B. Односторонний требует меньше данных, но его нужно выбрать до запуска и не замечать падение метрики. Если сомневаетесь, используйте двусторонний.

Что такое MDE?

Минимальный детектируемый эффект — наименьшая разница конверсий, которую тест надёжно (с заданной мощностью) заметит. Его задают до теста: чем меньше MDE, тем больше посетителей нужно — примерно обратно пропорционально квадрату эффекта.

Совпадают ли расчёты с калькулятором Эвана Миллера?

Да. Размер выборки считается по той же формуле; наши автотесты сверяют результат с его калькулятором на нескольких наборах параметров, расхождение — не больше одного посетителя из-за точности обратной функции нормального распределения.

Чем байесовский подход лучше частотного?

Он не лучше, а отвечает на другой вопрос. Частотный тест говорит, насколько данные неожиданны при отсутствии разницы; байесовский — какова вероятность, что B лучше, и сколько вы рискуете потерять. Бизнесу второе объяснять проще, но правила остановки и дисциплина нужны в обоих подходах.

Можно ли тестировать больше двух вариантов?

Можно. Укажите число вариантов в режиме «Выборка и срок»: калькулятор применит поправку Бонферрони и увеличит выборку. При проверке результата сравнивайте каждый вариант с контролем отдельно, используя α, разделённый на число сравнений.

Ещё в разделе «A/B-тестирование»

Открыть подборку →

Подсказки, туры и чеклисты, эффект которых видно в цифрах.

Попробовать Clew бесплатноКак это работаетFree — бесплатно навсегда · Pro и Business — 14 дней без карты

Туры, попапы и онбординг в эпоху ИИ

7 паттернов с числом шагов, правилами текста и метриками, что меняет ИИ, чек-лист перед публикацией. PDF, 2 страницы. Что внутри гайда →