ГлавнаяИнструментыUX-исследованияКалькулятор выборки
Калькулятор выборки и погрешности опроса
Сколько человек нужно опросить, чтобы результат не был случайностью, и насколько точна доля, которую вы уже получили. Формулы Кохрана с поправкой на конечную совокупность, интервал Уилсона и расчёт числа приглашений с учётом отклика.
—
| Погрешность | Выборка | Без поправки | Приглашений |
|---|
Погрешность честна только для случайной выборки. Если опрос в интерфейсе проходят те, кто сам захотел ответить, выборка смещена: самые довольные и самые недовольные отвечают охотнее. Большой объём это смещение не исправляет.
—
Что считается. Погрешность — половина ширины доверительного интервала в нормальном приближении, с поправкой на конечную совокупность, если она задана. Интервал Уилсона точнее для малых выборок и крайних долей; поправку на совокупность он не учитывает.
Расчёт идёт в вашем браузере — введённые данные никуда не отправляются.
Как пользоваться
- Задайте точностьВыберите доверительную вероятность (обычно 95 %) и допустимую погрешность в процентных пунктах. Чем точнее нужен ответ, тем больше выборка — погрешность убывает как 1/√n.
- Уточните совокупностьЕсли опрашиваете конкретную группу — например, 1 200 клиентов на тарифе «Бизнес», — укажите её размер: поправка на конечную совокупность уменьшит выборку.
- Посчитайте приглашенияВведите долю ответивших по прошлым опросам: калькулятор скажет, скольким людям показать приглашение, чтобы набрать нужное число ответов.
- Проверьте результатКогда ответы собраны, откройте вкладку «Погрешность»: введите число ответов и полученную долю — и увидите интервал, в котором лежит истинное значение.
Как рассчитать объём выборки: формула
Калькулятор решает классическую задачу оценки доли: какую часть совокупности составляют люди с нужным признаком — довольные продуктом, пользующиеся функцией, готовые платить. Для простой случайной выборки из большой совокупности объём считается по формуле, которую приводит У. Кохрен в учебнике «Методы выборочного исследования»:
Пример: 95 %, погрешность ±5 п.п., p = 0,5. n₀ = 1,96² · 0,25 / 0,0025 = 384,2 — округляем вверх до 385. Это известное «385 респондентов», которое кочует по методичкам: оно верно только для большой совокупности и случайного отбора.
Поправка на конечную совокупность
Если совокупность невелика — сотрудники компании, клиенты одного тарифа, участники вебинара, — каждый опрошенный заметно уменьшает неопределённость о тех, кого не опросили. Это учитывает поправка на конечность (finite population correction, FPC):
Для N = 1 000 из 385 получается 278, для N = 10 000 — 370, для N = 100 000 — 383. Поправка важна, когда выборка составляет больше 5 % совокупности; для аудитории в сотни тысяч она почти ничего не меняет.
Погрешность уже собранного опроса
Обратная задача — вкладка «Погрешность». Для наблюдаемой доли p̂ в выборке из n ответов:
Второй множитель — та же поправка на конечность; без заданного N он равен единице. Этот нормальный интервал плохо ведёт себя при малых n и долях около 0 или 100 %: он может выйти за границы и накрывает истинную долю реже заявленного. Поэтому калькулятор показывает и интервал Уилсона, который Браун, Кай и ДасГупта рекомендуют как замену интервалу Вальда:
Почему ожидаемая доля 50 % — осторожный выбор
Произведение p · (1 − p) максимально при p = 0,5 и равно 0,25. При p = 0,2 оно равно 0,16, при p = 0,1 — 0,09. Значит, если заранее известно, что признак встречается редко, выборка нужна меньше: при p = 20 % и тех же 95 % и ±5 п.п. хватит 246 человек вместо 385.
Но в анкете почти всегда больше одного вопроса, и доли по ним разные. Выборка, рассчитанная на p = 0,2, даст по вопросу с ответом «50 на 50» погрешность уже около ±6,2 п.п. Поэтому при планировании опроса берут p = 50 %: это гарантирует заявленную погрешность для любого вопроса с двумя вариантами ответа. Меньшую долю закладывайте, только если опрос строится вокруг одной метрики и её уровень известен по прошлым замерам.
Помните и о подгруппах. Если вы хотите сравнивать ответы новых и давних пользователей, погрешность ±5 п.п. нужна в каждой подгруппе — то есть 385 ответов в каждой, а не на всех вместе.
Репрезентативная выборка: сколько человек нужно на самом деле
Объём выборки отвечает только за случайную ошибку. Репрезентативность — другое свойство: выборка похожа на совокупность, если каждый её член имел известный и ненулевой шанс попасть в опрос. Формулы выше предполагают простой случайный отбор, и никакое число ответов не исправит систематическое смещение.
Самоотбор в опросах внутри продукта
Опрос во всплывающем окне или в письме проходят те, кто сам решил ответить. Чаще откликаются активные пользователи и те, у кого сильные эмоции — в обе стороны. Те, кто ушёл из продукта, не видят приглашения вовсе. Такая выборка не случайна, и погрешность ±3 п.п. для неё — формальность: реальная ошибка может быть много больше, и оценить её по самим ответам нельзя. Американская ассоциация исследователей общественного мнения (AAPOR) отдельно предупреждает, что для неслучайных онлайн-выборок классическая погрешность не имеет прежнего смысла.
Что помогает на практике:
- Отбирайте случайно, кому показывать приглашение. Например, каждому десятому пользователю, дошедшему до нужного шага, а не всем подряд.
- Показывайте опрос в осмысленный момент. Спрашивать о ценности продукта при первом входе бессмысленно: человек ещё ничего не сделал. Лучше — после завершения ключевого шага онбординга.
- Сравнивайте ответивших с неответившими по тому, что знаете о них из аналитики: тариф, срок жизни аккаунта, активность. Если группы сильно различаются, результат придётся взвешивать или хотя бы оговаривать.
- Считайте отклик. Доля ответивших = ответы / приглашения. Чем она ниже, тем выше риск, что ответившие отличаются от остальных. Нормы отклика зависят от канала и аудитории, поэтому ориентируйтесь на свои прошлые опросы.
Сколько приглашений разослать
Если нужно 385 ответов, а отвечает обычно каждый пятый, приглашение нужно показать 385 / 0,2 = 1 925 пользователям. Калькулятор считает это автоматически. Если приглашений выходит больше, чем людей в совокупности, — пора менять не выборку, а способ опроса: сократить анкету, добавить напоминание, выбрать другой момент.
Типичные ошибки при расчёте выборки
- Путать процент и процентные пункты. Погрешность ±5 % в калькуляторах выборки — это процентные пункты: доля 30 % означает «от 25 до 35 %», а не «от 28,5 до 31,5 %».
- Считать выборку на всех, а выводы делать по сегментам. Для сравнения групп нужна достаточная выборка в каждой; для проверки разницы между ними — отдельный расчёт, как в A/B-тесте.
- Верить погрешности при самоотборе. Формула описывает только случайную ошибку. Смещение из-за того, кто отвечает, в неё не входит.
- Округлять вниз. Размер выборки всегда округляется вверх: 384,2 — это 385.
- Забывать об отклике и браке. Часть анкет окажется неполной или «прокликанной». Закладывайте запас в число приглашений.
- Путать доверительную вероятность и точность. 99 % не делает результат точнее — интервал становится шире, а выборка для той же погрешности растёт примерно в 1,7 раза.
Если опрос нужен, чтобы сравнить две версии онбординга, считайте не погрешность, а размер выборки для проверки гипотезы — в калькуляторе A/B-тестов.
Источники
- Cochran W. G. Sampling Techniques. 3rd ed. Wiley, 1977 — формула объёма выборки для доли и поправка на конечную совокупность (гл. 4).
- Wilson E. B. Probable Inference, the Law of Succession, and Statistical Inference. Journal of the American Statistical Association, 22(158), 1927 — интервал Уилсона.
- Brown L. D., Cai T. T., DasGupta A. Interval Estimation for a Binomial Proportion. Statistical Science, 16(2), 2001 — сравнение интервалов для доли.
- Groves R. M. et al. Survey Methodology. 2nd ed. Wiley, 2009 — ошибки охвата, неответы, самоотбор.
- AAPOR. Standard Definitions: Final Dispositions of Case Codes and Outcome Rates for Surveys — определения доли ответивших; AAPOR Report on Online Panels, 2010 — о погрешности неслучайных выборок.
Частые вопросы
Сколько человек нужно опросить, чтобы выборка была репрезентативной?
Для большой совокупности при доверительной вероятности 95 % и погрешности ±5 процентных пунктов нужно 385 ответов, при ±3 п.п. — 1 068. Но репрезентативность определяется не числом, а способом отбора: выборка должна быть случайной. 385 ответов от тех, кто сам захотел пройти опрос, репрезентативными не будут.
Как рассчитать объём выборки по формуле?
n₀ = z² · p · (1 − p) / e², где z = 1,96 для 95 %, p — ожидаемая доля (0,5, если неизвестна), e — погрешность в долях. Для конечной совокупности N результат уточняют: n = n₀ / (1 + (n₀ − 1) / N). Результат округляют вверх.
Зависит ли размер выборки от размера генеральной совокупности?
Почти нет, если совокупность большая: для 100 тысяч и для 10 миллионов человек нужно 383–385 ответов при ±5 п.п. Совокупность заметно влияет, только когда выборка составляет больше 5 % от неё, — например, при опросе 1 000 клиентов достаточно 278 ответов.
Что такое погрешность выборки?
Это половина ширины доверительного интервала: насколько доля в выборке может отличаться от доли во всей совокупности из-за случайности отбора. Погрешность ±4 п.п. при доле 60 % и доверительной вероятности 95 % означает, что истинная доля с вероятностью 95 % лежит между 56 и 64 %.
Почему в калькуляторе по умолчанию доля 50 %?
Произведение p(1 − p) максимально при 50 %, поэтому выборка, рассчитанная на эту долю, гарантирует заявленную погрешность для любого вопроса анкеты. Если заранее известно, что доля около 10 или 90 %, выборка может быть меньше, но точность по другим вопросам пострадает.
Чем интервал Уилсона лучше обычного?
Обычный интервал «доля ± погрешность» неточен при малых выборках и долях около 0 или 100 %: он может уйти в отрицательные значения и накрывает истинную долю реже, чем обещает. Интервал Уилсона несимметричен, не выходит за границы 0…100 % и держит заявленную вероятность заметно лучше.
Сколько приглашений отправить, чтобы получить нужное число ответов?
Разделите нужное число ответов на ожидаемую долю ответивших. Если нужно 385 ответов, а отвечает 20 % приглашённых, показать приглашение нужно 1 925 людям. Долю ответивших берите из своих прошлых опросов в том же канале.
Ещё в разделе «UX-исследования»
- Анализ опроса по модели Кано
Какие функции для пользователей обязательные, линейные, а какие — «вау»?
- Калькулятор NPS, CSAT и CES
Какой NPS у этих ответов и какова погрешность?
- Калькулятор CSAT и CES
Какие CSAT и CES у этих результатов опроса?
- Калькулятор SUS
Какой балл SUS у интерфейса и хорошее ли у него юзабилити?