ГлавнаяИнструментыA/B-тестированиеКалькулятор A/B-тестов
Калькулятор A/B-тестов со значимостью, выборкой и сроком
Проверьте, значима ли разница конверсий, узнайте, сколько посетителей и дней нужно тесту, и посмотрите на результат глазами байесовской статистики. Графики распределений с доверительными интервалами и перцентилями — как в классических калькуляторах.
—
| 2,5-й перцентиль | 50-й (медиана) | 97,5-й перцентиль | |
|---|---|---|---|
| A | — | — | — |
| B | — | — | — |
| B − A | — | — | — |
Не подглядывайте. Решение принимают один раз, когда набрана заранее рассчитанная выборка. Если проверять p-value каждый день и остановиться при первом «значимо», доля ложных побед вырастает в разы.
—
Какой эффект тест заметит при вашем трафике
Формула — та же, что в калькуляторе Эвана Миллера (двусторонний тест, нормальное приближение). При нескольких вариантах уровень значимости делится на число сравнений с контролем (поправка Бонферрони).
—
Расчёт идёт в вашем браузере — введённые данные никуда не отправляются.
Как пользоваться
- Выберите режимДо запуска — «Выборка и срок»: он скажет, сколько посетителей и дней нужно. После — «Проверить результат» или «Байесовский подход».
- Введите данныеПосетителей и конверсии для контроля (A) и варианта (B). Конверсии — это пользователи, выполнившие целевое действие, а не события.
- Прочитайте выводВердикт наверху объясняет результат словами; ниже — p-value, интервалы и графики распределений. Наведите курсор на график, чтобы увидеть значение и перцентиль.
- Поделитесь ссылкойПараметры сохраняются в адресе страницы. Кнопка «Скопировать ссылку» отдаёт URL, по которому коллега увидит тот же расчёт.
Как калькулятор считает значимость
В режиме «Проверить результат» используется классический z-тест для двух долей — тот же, что в большинстве калькуляторов A/B-тестов. Нулевая гипотеза: конверсии A и B одинаковы, а наблюдаемая разница — случайность выборки.
Сначала считаются конверсии pA = xA / nA и pB = xB / nB. Для проверки гипотезы стандартная ошибка разницы берётся по объединённой (pooled) доле — потому что при верной нулевой гипотезе у обеих групп одна конверсия:
Здесь Φ — функция стандартного нормального распределения. Разница значима, если p-value меньше α = 1 − уровень доверия.
Доверительные интервалы
Интервалы строятся уже без объединения долей — у каждой группы своя дисперсия (интервал Вальда):
Интервал для относительного прироста pB/pA − 1 получен дельта-методом. Именно эти нормальные распределения N(p, SE) нарисованы на графиках: затемнённая область — доверительный интервал, пунктирные линии — его границы (например, 2,5-й и 97,5-й перцентили при 95 %), сплошная — медиана.
Мощность и проверка выборок
«Мощность» — наблюдаемая (post-hoc): вероятность, с которой тест такого объёма заметил бы разницу, равную наблюдаемой. Это подсказка «хватает ли данных», а не аргумент в пользу гипотезы: наблюдаемая мощность однозначно связана с p-value и нового знания не добавляет.
Калькулятор также проверяет SRM (sample ratio mismatch) — критерий χ² для равного деления трафика. Если посетители распределились заметно неравно, чаще всего сломан сплит, и сравнивать конверсии бессмысленно.
Размер выборки и длительность теста
Сколько посетителей нужно, зависит от четырёх чисел: текущей конверсии, минимального эффекта, который вы хотите заметить (MDE), уровня значимости α и мощности 1 − β. Калькулятор использует формулу для сравнения двух долей в нормальном приближении — ту же, что в калькуляторе Эвана Миллера, поэтому результаты совпадают:
Число n — посетителей в каждом варианте. Срок теста = n × число вариантов ÷ посетителей в день.
Если вариантов больше двух, каждое сравнение с контролем — отдельная возможность ошибиться. Калькулятор применяет поправку Бонферрони: α делится на число сравнений. Она консервативна, зато простая и честная; цена — выборка растёт.
Практические правила:
- Держите тест целыми неделями — минимум 7 дней, лучше 14: у будней и выходных разная аудитория.
- Уменьшение MDE вдвое требует примерно вчетверо больше трафика. Если тест выходит на полгода, тестируйте более смелое изменение или метрику ближе к действию.
- Для онбординга удобнее метрики с высокой базовой конверсией — завершение шага, первое ключевое действие, — чем оплата: выборка для них в разы меньше.
Байесовский подход: вероятность, что B лучше
Байесовский режим отвечает на вопрос, который обычно и задают: с какой вероятностью B лучше A? Конверсия каждого варианта описывается бета-распределением. С априорным Beta(α, β) и данными x конверсий из n посетителей апостериорное распределение — Beta(α + x, β + n − x) (сопряжённая модель бета-биномиального распределения).
Вероятность превосходства считается численным интегрированием и сверена в тестах с точной формулой Эвана Миллера для целых параметров и с моделированием методом Монте-Карло. Ожидаемые потери — сколько конверсии в среднем теряется, если выбор окажется неверным. Удобное правило остановки: заканчивать тест, когда риск выбранного варианта ниже порога, который для бизнеса несущественен.
Байесовский вывод не отменяет дисциплину: подглядывание и остановка «при первых 95 %» портят и его. Равномерное априорное распределение Beta(1, 1) почти не влияет на результат при сотнях конверсий; информативное априорное распределение имеет смысл, только если оно честно отражает прошлые тесты.
Как читать результат и каких ошибок избегать
Что значит «статистически значимо»
p-value = 0,03 означает: если бы разницы на самом деле не было, такой или больший разрыв получался бы примерно в 3 % случаев. Это не вероятность того, что B лучше, и не размер эффекта. Размер показывает доверительный интервал: «+0,2…+1,4 п.п.» честнее, чем «+16 %, значимо».
Типичные ошибки
- Подглядывание. Проверять значимость каждый день и остановиться при первом p < 0,05 — верный способ получить ложную победу. Рассчитайте выборку заранее и принимайте решение один раз.
- Остановка после «значимо», но до недели. Эффект новизны и дни недели искажают первые дни теста.
- Много метрик и сегментов. Проверив двадцать метрик, одну «значимую» вы найдёте случайно. Главную метрику выбирайте до запуска, сегменты — только как повод для следующего теста.
- Неравный сплит (SRM). Если группы разошлись по размеру сильнее, чем допускает случай, ищите баг в распределении трафика, а не победителя.
- Считать конверсии по событиям. Один пользователь, нажавший кнопку пять раз, — одна конверсия. Тест предполагает независимые наблюдения.
- «Незначимо» = «нет эффекта». Незначимый результат при малой выборке означает только, что данных не хватило. Смотрите на интервал: если в нём помещается и −5 %, и +10 %, тест ничего не решил.
Если вы тестируете онбординг — тур против его отсутствия или две версии чеклиста, — сравнивайте не «прошёл тур», а активацию: первое ключевое действие. О том, как её поднимать, — в статье «Как повысить активацию пользователей».
Источники
- Fleiss J. L., Levin B., Paik M. C. Statistical Methods for Rates and Proportions. 3rd ed. Wiley, 2003 — z-тест для двух долей и размер выборки.
- Miller E. Sample Size Calculator — evanmiller.org/ab-testing/sample-size.html; Miller E. Formulas for Bayesian A/B Testing — evanmiller.org/bayesian-ab-testing.html.
- Kohavi R., Tang D., Xu Y. Trustworthy Online Controlled Experiments. Cambridge University Press, 2020 — SRM, подглядывание, выбор метрик.
- Marsaglia G. Evaluating the Normal Distribution. Journal of Statistical Software, 11(4), 2004 — вычисление Φ(x).
- Press W. H. et al. Numerical Recipes. 3rd ed., §6.4 — неполная бета-функция.
Частые вопросы
Как проверить статистическую значимость A/B-теста?
Введите посетителей и конверсии обеих групп в режиме «Проверить результат». Калькулятор посчитает z-тест для двух долей и p-value: если p-value меньше 1 − уровень доверия (например, 0,05 при 95 %), разница статистически значима. Смотрите и на доверительный интервал разницы — он показывает, насколько велик эффект.
Сколько должен длиться A/B-тест?
Столько, сколько нужно, чтобы набрать рассчитанную заранее выборку, но не меньше 7 полных дней. В режиме «Выборка и срок» укажите текущую конверсию, минимальный эффект и трафик в день — калькулятор вернёт число посетителей на вариант и срок в днях.
Какой уровень доверия выбрать: 90, 95 или 99 %?
Стандарт — 95 %. 90 % подходит для дешёвых обратимых изменений, где цена ложной победы мала; 99 % — для рискованных решений вроде цен. Чем выше уровень доверия, тем больше нужна выборка.
Чем односторонний тест отличается от двустороннего?
Двусторонний проверяет, отличается ли B от A в любую сторону; односторонний — только лучше ли B. Односторонний требует меньше данных, но его нужно выбрать до запуска и не замечать падение метрики. Если сомневаетесь, используйте двусторонний.
Что такое MDE?
Минимальный детектируемый эффект — наименьшая разница конверсий, которую тест надёжно (с заданной мощностью) заметит. Его задают до теста: чем меньше MDE, тем больше посетителей нужно — примерно обратно пропорционально квадрату эффекта.
Совпадают ли расчёты с калькулятором Эвана Миллера?
Да. Размер выборки считается по той же формуле; наши автотесты сверяют результат с его калькулятором на нескольких наборах параметров, расхождение — не больше одного посетителя из-за точности обратной функции нормального распределения.
Чем байесовский подход лучше частотного?
Он не лучше, а отвечает на другой вопрос. Частотный тест говорит, насколько данные неожиданны при отсутствии разницы; байесовский — какова вероятность, что B лучше, и сколько вы рискуете потерять. Бизнесу второе объяснять проще, но правила остановки и дисциплина нужны в обоих подходах.
Можно ли тестировать больше двух вариантов?
Можно. Укажите число вариантов в режиме «Выборка и срок»: калькулятор применит поправку Бонферрони и увеличит выборку. При проверке результата сравнивайте каждый вариант с контролем отдельно, используя α, разделённый на число сравнений.
Ещё в разделе «A/B-тестирование»
- Калькулятор RICE и ICE
Какие задачи бэклога брать первыми по RICE или ICE?
- Калькулятор эффекта активации
Сколько выручки принесёт рост активации?
- Калькулятор воронки конверсии
На каком шаге воронки теряются пользователи и какой шаг чинить первым?
- Калькулятор выборки
Сколько ответов нужно опросу при заданной погрешности?