本文适合谁
需要确定问卷调研样本量、或需要向业务方说明”为什么需要这么多样本”的研究人员。
核心结论摘要
- 样本量由置信水平、允许误差、总体比例/方差决定,不是拍脑袋;
- “95% 置信、±5% 误差”不是所有项目的默认答案——精度要求来自决策需求;
- 公式解决随机误差,不解决系统偏差:非概率样本套用公式也不自动具有代表性;
- 细分分析关注每个子群体的有效样本量,而非总样本量;
- 定性研究不适用本类样本量公式(定性样本逻辑见定性研究样本怎么设计)。
样本量为什么不能只凭经验决定
- 样本量不足:估计的置信区间过宽,组间差异被噪音淹没;
- 样本量过大:成本浪费,且大样本下微小差异也会”显著”(业务意义见显著性检验完整指南);
- 正确做法:从期望精度(允许误差)与决策风险倒推。
样本量与置信水平
- 置信水平:重复抽样下,置信区间包含总体真值的比例(常用 95%,即 z≈1.96);
- 置信水平越高(99%),样本量越大;
- 置信水平不是”结论正确的概率”,报告表述需准确(见显著性检验完整指南)。
样本量与允许误差
- 允许误差(margin of error):你能接受的估计偏差(如 ±3%);
- 误差越小,样本量越大(误差减半,样本约需 4 倍);
- 允许误差来自决策需求:份额判断差 ±1% 与 ±5%,决策成本完全不同。
总体比例估计
最常见场景(估计”有多少用户满意/购买”):
n = z² × p × (1 − p) / e²
- z:置信水平对应值(95% → 1.96);
- p:预期比例(无信息时用 0.5,最保守);
- e:允许误差。
示例 1(总体比例):z=1.96,p=0.5,e=0.05:
n = 1.96² × 0.5 × 0.5 / 0.05² ≈ 385
均值估计
估计均值(如满意度 0–10 分均值)时:
n = z² × σ² / e²
- σ:总体标准差(用预测试或历史数据估计);
- 例:σ=2.0,e=0.2 → n ≈ 385。
总体规模有限时的修正
当样本占总体比例明显(如 n/N > 5%)时用有限总体修正(FPC):
n' = n × N / (N + n − 1)
示例 2(有限总体):n=385,N=2000 → n’ ≈ 323。
消费者研究总体通常很大,FPC 影响小;B2B 或区域研究总体小时必须考虑。
设计效应
- 整群/分层等复杂设计会使有效样本量低于名义样本量;
- 设计效应(DEFF):名义样本 ÷ 设计效应 = 有效样本;
- 整群抽样 DEFF 常 >1(有效样本减少),计算时按 1.2–2.0 预留(视群内同质性)。
预计无效率
- 预计无效率:剔除无效样本后的有效率(清洗见问卷数据清洗完整指南);
- 最终投放 = 目标有效样本 ÷ 有效率 ÷ 预估完成率;
- 例:目标 400 有效,有效率 90%,完成率 80% → 投放约 556。
分组比较与子群体分析
示例 3(两个人群比较):比较 A/B 两组比例差异,每组约需:
n/组 ≈ 2 × z² × p(1−p) / d² (d 为可检测的最小差异)
- 可检测差异 d=10% → 每组约 385;d=5% → 每组约 1500;
- 可检测差异越小,样本需求越大——立项时就要明确”要能看出多大的差异”。
多平台分组研究
示例 4(多平台分组):4 个平台各 250 = 总 1000。
- 每组 250 在 p=0.5 时误差约 ±6.2%——组间差异需 >12% 才能显著检出;
- 若业务需要更小差异,需提高每组样本或合并分析单元;
- 关键原则:分几组,就按每组的需求算,而不是按总样本算。
多变量分析与用户细分
- 聚类/回归等分析对样本有最低要求(经验参考:每个变量 10–15 个样本,见聚类分析完整指南与回归分析完整指南);
- 细分分析:计划 K 个细分,每个细分 ≥ 50–100 有效样本(经验参考)→ 总样本按最小组反推;
- 示例 5(细分研究):计划 5 个细分、每细分 ≥ 100 → 总样本 ≥ 500(未含无效与配额损耗)。
实验研究
- 实验(A/B 测试)样本量取决于:基线转化率、最小可检测提升、显著性水平与统计功效(通常 80%);
- 双样本比例检验样本量通常远大于问卷调研(流量实验常见需求);
- 建议使用专门的功效计算工具,不套用问卷样本量公式。
追踪研究
- 追踪研究样本量 = 单波样本 ×(1 + 预期流失率);
- 跨期比较对单期样本与口径一致性要求高(口径见品牌研究如何设计的追踪注意事项)。
常见样本量计算案例汇总
| 场景 | 关键参数 | 每样本量需求(参考) |
|---|---|---|
| 总体比例 | 95% 置信、±5%、p=0.5 | ≈385 |
| 总体比例更精确 | 95% 置信、±3% | ≈1068 |
| 均值估计 | σ=2.0、±0.2 | ≈385 |
| 两组比较 | 检出 10% 差异 | 每组 ≈385 |
| 四平台分组 | 组内 ±6.2% | 每组 ≈250 |
| 5 细分 | 每细分 ≥100 | 总 ≥500+ |
样本量计算表(常用组合参考)
| 允许误差 | 90% 置信 | 95% 置信 | 99% 置信 |
|---|---|---|---|
| ±10% | 68 | 96 | 166 |
| ±5% | 271 | 385 | 664 |
| ±3% | 752 | 1068 | 1842 |
| ±2% | 1692 | 2401 | 4141 |
(p=0.5 最保守情形;实际按 p 与设计效应调整——本表为参考,不是所有项目的答案)
如何根据预算倒推方案
- 预算 → 可投放量 → 有效率 → 有效样本 → 算误差;
- 若误差超出决策可接受范围,三选一:提高预算、放宽精度、调整研究问题(如合并细分、减少分组);
- 报告必须如实呈现”预算约束下的精度局限”,而不是假装精度足够。
样本不足时如何调整研究问题
- 合并相近分组(4 城市 → 2 区域);
- 减少细分数量;
- 放宽显著性要求(探索性结论明确标注);
- 聚焦核心问题,删减边缘分析模块;
- 拆分研究(先快速摸底,再重点深挖)。
常见误区
- 默认”95%/±5%“:精度要求来自决策,不是默认值;
- 套公式就当有代表性:非概率样本无统计推断基础;
- 只看总样本不看子群体:总样本 1000、每个细分 50,细分结论不可靠;
- 忽略设计效应:整群设计名义样本虚高;
- 忽略无效率:目标 400 投 400,清洗后只剩 320;
- 定性研究套公式:定性样本逻辑完全不同(信息充分度,见定性研究样本怎么设计);
- 样本量公式本身写错:计算前核对公式与参数(本文公式为标准比例/均值公式,使用前建议与统计教材核对)。
使用边界与注意事项
- 本文公式为标准统计教材的简单随机抽样公式,实际项目需结合分层/配额与设计效应调整;
- 样本设计(抽样方式、配额、来源)见市场调研样本怎么设计;
- 涉及显著性检验的组间比较,检验逻辑见显著性检验完整指南。
参考资料
- Cochran, W. G. (1977). Sampling Techniques(抽样与样本量经典教材)
- Groves, R. M. et al. (2009). Survey Methodology
工具推荐
上传研究目标与精度要求,使用 SurveyKit Quant 辅助估算样本量并检查子群体样本是否充足。