Clew

ГлавнаяИнструментыUX-исследованияКалькулятор выборки

Калькулятор выборки и погрешности опроса

Сколько человек нужно опросить, чтобы результат не был случайностью, и насколько точна доля, которую вы уже получили. Формулы Кохрана с поправкой на конечную совокупность, интервал Уилсона и расчёт числа приглашений с учётом отклика.

● Бесплатно, без регистрацииОбновлено:

Доверительная вероятность
На сколько процентных пунктов результат может отклониться: 5 % — доля 40 % означает «от 35 до 45 %».
Не знаете — оставьте 50 %: это самый осторожный вариант.
Сколько всего людей, о которых вы хотите судить. Пусто — совокупность большая или неизвестна.
Какая часть приглашённых обычно проходит ваш опрос. Нужна, чтобы посчитать число приглашений.

—

 

Размер выборки— 
Без поправки— 
Разослать приглашений— 
Доля совокупности— 
Погрешность в зависимости от размера выборкинаведите курсор на кривую
Погрешность в зависимости от размера выборки
погрешность при заданных параметрах
Размер выборки для разной погрешности
ПогрешностьВыборкаБез поправкиПриглашений

Погрешность честна только для случайной выборки. Если опрос в интерфейсе проходят те, кто сам захотел ответить, выборка смещена: самые довольные и самые недовольные отвечают охотнее. Большой объём это смещение не исправляет.

Расчёт идёт в вашем браузере — введённые данные никуда не отправляются.

Как пользоваться

  1. Задайте точностьВыберите доверительную вероятность (обычно 95 %) и допустимую погрешность в процентных пунктах. Чем точнее нужен ответ, тем больше выборка — погрешность убывает как 1/√n.
  2. Уточните совокупностьЕсли опрашиваете конкретную группу — например, 1 200 клиентов на тарифе «Бизнес», — укажите её размер: поправка на конечную совокупность уменьшит выборку.
  3. Посчитайте приглашенияВведите долю ответивших по прошлым опросам: калькулятор скажет, скольким людям показать приглашение, чтобы набрать нужное число ответов.
  4. Проверьте результатКогда ответы собраны, откройте вкладку «Погрешность»: введите число ответов и полученную долю — и увидите интервал, в котором лежит истинное значение.

Как рассчитать объём выборки: формула

Калькулятор решает классическую задачу оценки доли: какую часть совокупности составляют люди с нужным признаком — довольные продуктом, пользующиеся функцией, готовые платить. Для простой случайной выборки из большой совокупности объём считается по формуле, которую приводит У. Кохрен в учебнике «Методы выборочного исследования»:

n₀ = z² · p · (1 − p) / e² z — квантиль нормального распределения: 1,645 (90 %), 1,960 (95 %), 2,576 (99 %) p — ожидаемая доля (0,5, если ничего не известно) e — допустимая погрешность в долях (5 % → 0,05)

Пример: 95 %, погрешность ±5 п.п., p = 0,5. n₀ = 1,96² · 0,25 / 0,0025 = 384,2 — округляем вверх до 385. Это известное «385 респондентов», которое кочует по методичкам: оно верно только для большой совокупности и случайного отбора.

Поправка на конечную совокупность

Если совокупность невелика — сотрудники компании, клиенты одного тарифа, участники вебинара, — каждый опрошенный заметно уменьшает неопределённость о тех, кого не опросили. Это учитывает поправка на конечность (finite population correction, FPC):

n = n₀ / (1 + (n₀ − 1) / N) N — размер генеральной совокупности

Для N = 1 000 из 385 получается 278, для N = 10 000 — 370, для N = 100 000 — 383. Поправка важна, когда выборка составляет больше 5 % совокупности; для аудитории в сотни тысяч она почти ничего не меняет.

Погрешность уже собранного опроса

Обратная задача — вкладка «Погрешность». Для наблюдаемой доли p̂ в выборке из n ответов:

e = z · √( p̂ (1 − p̂) / n ) · √( (N − n) / (N − 1) )

Второй множитель — та же поправка на конечность; без заданного N он равен единице. Этот нормальный интервал плохо ведёт себя при малых n и долях около 0 или 100 %: он может выйти за границы и накрывает истинную долю реже заявленного. Поэтому калькулятор показывает и интервал Уилсона, который Браун, Кай и ДасГупта рекомендуют как замену интервалу Вальда:

центр = (p̂ + z²/2n) / (1 + z²/n) полуширина = z · √( p̂(1 − p̂)/n + z²/4n² ) / (1 + z²/n)

Почему ожидаемая доля 50 % — осторожный выбор

Произведение p · (1 − p) максимально при p = 0,5 и равно 0,25. При p = 0,2 оно равно 0,16, при p = 0,1 — 0,09. Значит, если заранее известно, что признак встречается редко, выборка нужна меньше: при p = 20 % и тех же 95 % и ±5 п.п. хватит 246 человек вместо 385.

Но в анкете почти всегда больше одного вопроса, и доли по ним разные. Выборка, рассчитанная на p = 0,2, даст по вопросу с ответом «50 на 50» погрешность уже около ±6,2 п.п. Поэтому при планировании опроса берут p = 50 %: это гарантирует заявленную погрешность для любого вопроса с двумя вариантами ответа. Меньшую долю закладывайте, только если опрос строится вокруг одной метрики и её уровень известен по прошлым замерам.

Помните и о подгруппах. Если вы хотите сравнивать ответы новых и давних пользователей, погрешность ±5 п.п. нужна в каждой подгруппе — то есть 385 ответов в каждой, а не на всех вместе.

Репрезентативная выборка: сколько человек нужно на самом деле

Объём выборки отвечает только за случайную ошибку. Репрезентативность — другое свойство: выборка похожа на совокупность, если каждый её член имел известный и ненулевой шанс попасть в опрос. Формулы выше предполагают простой случайный отбор, и никакое число ответов не исправит систематическое смещение.

Самоотбор в опросах внутри продукта

Опрос во всплывающем окне или в письме проходят те, кто сам решил ответить. Чаще откликаются активные пользователи и те, у кого сильные эмоции — в обе стороны. Те, кто ушёл из продукта, не видят приглашения вовсе. Такая выборка не случайна, и погрешность ±3 п.п. для неё — формальность: реальная ошибка может быть много больше, и оценить её по самим ответам нельзя. Американская ассоциация исследователей общественного мнения (AAPOR) отдельно предупреждает, что для неслучайных онлайн-выборок классическая погрешность не имеет прежнего смысла.

Что помогает на практике:

  • Отбирайте случайно, кому показывать приглашение. Например, каждому десятому пользователю, дошедшему до нужного шага, а не всем подряд.
  • Показывайте опрос в осмысленный момент. Спрашивать о ценности продукта при первом входе бессмысленно: человек ещё ничего не сделал. Лучше — после завершения ключевого шага онбординга.
  • Сравнивайте ответивших с неответившими по тому, что знаете о них из аналитики: тариф, срок жизни аккаунта, активность. Если группы сильно различаются, результат придётся взвешивать или хотя бы оговаривать.
  • Считайте отклик. Доля ответивших = ответы / приглашения. Чем она ниже, тем выше риск, что ответившие отличаются от остальных. Нормы отклика зависят от канала и аудитории, поэтому ориентируйтесь на свои прошлые опросы.

Сколько приглашений разослать

Если нужно 385 ответов, а отвечает обычно каждый пятый, приглашение нужно показать 385 / 0,2 = 1 925 пользователям. Калькулятор считает это автоматически. Если приглашений выходит больше, чем людей в совокупности, — пора менять не выборку, а способ опроса: сократить анкету, добавить напоминание, выбрать другой момент.

Типичные ошибки при расчёте выборки

  • Путать процент и процентные пункты. Погрешность ±5 % в калькуляторах выборки — это процентные пункты: доля 30 % означает «от 25 до 35 %», а не «от 28,5 до 31,5 %».
  • Считать выборку на всех, а выводы делать по сегментам. Для сравнения групп нужна достаточная выборка в каждой; для проверки разницы между ними — отдельный расчёт, как в A/B-тесте.
  • Верить погрешности при самоотборе. Формула описывает только случайную ошибку. Смещение из-за того, кто отвечает, в неё не входит.
  • Округлять вниз. Размер выборки всегда округляется вверх: 384,2 — это 385.
  • Забывать об отклике и браке. Часть анкет окажется неполной или «прокликанной». Закладывайте запас в число приглашений.
  • Путать доверительную вероятность и точность. 99 % не делает результат точнее — интервал становится шире, а выборка для той же погрешности растёт примерно в 1,7 раза.

Если опрос нужен, чтобы сравнить две версии онбординга, считайте не погрешность, а размер выборки для проверки гипотезы — в калькуляторе A/B-тестов.

Источники

  1. Cochran W. G. Sampling Techniques. 3rd ed. Wiley, 1977 — формула объёма выборки для доли и поправка на конечную совокупность (гл. 4).
  2. Wilson E. B. Probable Inference, the Law of Succession, and Statistical Inference. Journal of the American Statistical Association, 22(158), 1927 — интервал Уилсона.
  3. Brown L. D., Cai T. T., DasGupta A. Interval Estimation for a Binomial Proportion. Statistical Science, 16(2), 2001 — сравнение интервалов для доли.
  4. Groves R. M. et al. Survey Methodology. 2nd ed. Wiley, 2009 — ошибки охвата, неответы, самоотбор.
  5. AAPOR. Standard Definitions: Final Dispositions of Case Codes and Outcome Rates for Surveys — определения доли ответивших; AAPOR Report on Online Panels, 2010 — о погрешности неслучайных выборок.

Частые вопросы

Сколько человек нужно опросить, чтобы выборка была репрезентативной?

Для большой совокупности при доверительной вероятности 95 % и погрешности ±5 процентных пунктов нужно 385 ответов, при ±3 п.п. — 1 068. Но репрезентативность определяется не числом, а способом отбора: выборка должна быть случайной. 385 ответов от тех, кто сам захотел пройти опрос, репрезентативными не будут.

Как рассчитать объём выборки по формуле?

n₀ = z² · p · (1 − p) / e², где z = 1,96 для 95 %, p — ожидаемая доля (0,5, если неизвестна), e — погрешность в долях. Для конечной совокупности N результат уточняют: n = n₀ / (1 + (n₀ − 1) / N). Результат округляют вверх.

Зависит ли размер выборки от размера генеральной совокупности?

Почти нет, если совокупность большая: для 100 тысяч и для 10 миллионов человек нужно 383–385 ответов при ±5 п.п. Совокупность заметно влияет, только когда выборка составляет больше 5 % от неё, — например, при опросе 1 000 клиентов достаточно 278 ответов.

Что такое погрешность выборки?

Это половина ширины доверительного интервала: насколько доля в выборке может отличаться от доли во всей совокупности из-за случайности отбора. Погрешность ±4 п.п. при доле 60 % и доверительной вероятности 95 % означает, что истинная доля с вероятностью 95 % лежит между 56 и 64 %.

Почему в калькуляторе по умолчанию доля 50 %?

Произведение p(1 − p) максимально при 50 %, поэтому выборка, рассчитанная на эту долю, гарантирует заявленную погрешность для любого вопроса анкеты. Если заранее известно, что доля около 10 или 90 %, выборка может быть меньше, но точность по другим вопросам пострадает.

Чем интервал Уилсона лучше обычного?

Обычный интервал «доля ± погрешность» неточен при малых выборках и долях около 0 или 100 %: он может уйти в отрицательные значения и накрывает истинную долю реже, чем обещает. Интервал Уилсона несимметричен, не выходит за границы 0…100 % и держит заявленную вероятность заметно лучше.

Сколько приглашений отправить, чтобы получить нужное число ответов?

Разделите нужное число ответов на ожидаемую долю ответивших. Если нужно 385 ответов, а отвечает 20 % приглашённых, показать приглашение нужно 1 925 людям. Долю ответивших берите из своих прошлых опросов в том же канале.

Ещё в разделе «UX-исследования»

Открыть подборку →

Подсказки, туры и чеклисты, эффект которых видно в цифрах.

Попробовать Clew бесплатноКак это работаетFree — бесплатно навсегда · Pro и Business — 14 дней без карты

Туры, попапы и онбординг в эпоху ИИ

7 паттернов с числом шагов, правилами текста и метриками, что меняет ИИ, чек-лист перед публикацией. PDF, 2 страницы. Что внутри гайда →