本文适合谁

需要确定问卷调研样本量、或需要向业务方说明”为什么需要这么多样本”的研究人员。

核心结论摘要

  • 样本量由置信水平、允许误差、总体比例/方差决定,不是拍脑袋;
  • “95% 置信、±5% 误差”不是所有项目的默认答案——精度要求来自决策需求;
  • 公式解决随机误差,不解决系统偏差:非概率样本套用公式也不自动具有代表性;
  • 细分分析关注每个子群体的有效样本量,而非总样本量;
  • 定性研究不适用本类样本量公式(定性样本逻辑见定性研究样本怎么设计)。

样本量为什么不能只凭经验决定

  • 样本量不足:估计的置信区间过宽,组间差异被噪音淹没;
  • 样本量过大:成本浪费,且大样本下微小差异也会”显著”(业务意义见显著性检验完整指南);
  • 正确做法:从期望精度(允许误差)与决策风险倒推。

样本量与置信水平

  • 置信水平:重复抽样下,置信区间包含总体真值的比例(常用 95%,即 z≈1.96);
  • 置信水平越高(99%),样本量越大;
  • 置信水平不是”结论正确的概率”,报告表述需准确(见显著性检验完整指南)。

样本量与允许误差

  • 允许误差(margin of error):你能接受的估计偏差(如 ±3%);
  • 误差越小,样本量越大(误差减半,样本约需 4 倍);
  • 允许误差来自决策需求:份额判断差 ±1% 与 ±5%,决策成本完全不同。

总体比例估计

最常见场景(估计”有多少用户满意/购买”):

n = z² × p × (1 − p) / e²
  • z:置信水平对应值(95% → 1.96);
  • p:预期比例(无信息时用 0.5,最保守);
  • e:允许误差。

示例 1(总体比例):z=1.96,p=0.5,e=0.05:

n = 1.96² × 0.5 × 0.5 / 0.05² ≈ 385

均值估计

估计均值(如满意度 0–10 分均值)时:

n = z² × σ² / e²
  • σ:总体标准差(用预测试或历史数据估计);
  • 例:σ=2.0,e=0.2 → n ≈ 385。

总体规模有限时的修正

当样本占总体比例明显(如 n/N > 5%)时用有限总体修正(FPC):

n' = n × N / (N + n − 1)

示例 2(有限总体):n=385,N=2000 → n’ ≈ 323。

消费者研究总体通常很大,FPC 影响小;B2B 或区域研究总体小时必须考虑。

设计效应

  • 整群/分层等复杂设计会使有效样本量低于名义样本量;
  • 设计效应(DEFF):名义样本 ÷ 设计效应 = 有效样本;
  • 整群抽样 DEFF 常 >1(有效样本减少),计算时按 1.2–2.0 预留(视群内同质性)。

预计无效率

  • 预计无效率:剔除无效样本后的有效率(清洗见问卷数据清洗完整指南);
  • 最终投放 = 目标有效样本 ÷ 有效率 ÷ 预估完成率;
  • 例:目标 400 有效,有效率 90%,完成率 80% → 投放约 556。

分组比较与子群体分析

示例 3(两个人群比较):比较 A/B 两组比例差异,每组约需:

n/组 ≈ 2 × z² × p(1−p) / d²   (d 为可检测的最小差异)
  • 可检测差异 d=10% → 每组约 385;d=5% → 每组约 1500;
  • 可检测差异越小,样本需求越大——立项时就要明确”要能看出多大的差异”。

多平台分组研究

示例 4(多平台分组):4 个平台各 250 = 总 1000。

  • 每组 250 在 p=0.5 时误差约 ±6.2%——组间差异需 >12% 才能显著检出;
  • 若业务需要更小差异,需提高每组样本或合并分析单元;
  • 关键原则:分几组,就按每组的需求算,而不是按总样本算。

多变量分析与用户细分

  • 聚类/回归等分析对样本有最低要求(经验参考:每个变量 10–15 个样本,见聚类分析完整指南与回归分析完整指南);
  • 细分分析:计划 K 个细分,每个细分 ≥ 50–100 有效样本(经验参考)→ 总样本按最小组反推;
  • 示例 5(细分研究):计划 5 个细分、每细分 ≥ 100 → 总样本 ≥ 500(未含无效与配额损耗)。

实验研究

  • 实验(A/B 测试)样本量取决于:基线转化率、最小可检测提升、显著性水平与统计功效(通常 80%);
  • 双样本比例检验样本量通常远大于问卷调研(流量实验常见需求);
  • 建议使用专门的功效计算工具,不套用问卷样本量公式。

追踪研究

  • 追踪研究样本量 = 单波样本 ×(1 + 预期流失率);
  • 跨期比较对单期样本与口径一致性要求高(口径见品牌研究如何设计的追踪注意事项)。

常见样本量计算案例汇总

场景关键参数每样本量需求(参考)
总体比例95% 置信、±5%、p=0.5≈385
总体比例更精确95% 置信、±3%≈1068
均值估计σ=2.0、±0.2≈385
两组比较检出 10% 差异每组 ≈385
四平台分组组内 ±6.2%每组 ≈250
5 细分每细分 ≥100总 ≥500+

样本量计算表(常用组合参考)

允许误差90% 置信95% 置信99% 置信
±10%6896166
±5%271385664
±3%75210681842
±2%169224014141

(p=0.5 最保守情形;实际按 p 与设计效应调整——本表为参考,不是所有项目的答案)

允许误差与所需样本量(教学示例)

如何根据预算倒推方案

  • 预算 → 可投放量 → 有效率 → 有效样本 → 算误差;
  • 若误差超出决策可接受范围,三选一:提高预算、放宽精度、调整研究问题(如合并细分、减少分组);
  • 报告必须如实呈现”预算约束下的精度局限”,而不是假装精度足够。

样本不足时如何调整研究问题

  1. 合并相近分组(4 城市 → 2 区域);
  2. 减少细分数量;
  3. 放宽显著性要求(探索性结论明确标注);
  4. 聚焦核心问题,删减边缘分析模块;
  5. 拆分研究(先快速摸底,再重点深挖)。

常见误区

  1. 默认”95%/±5%“:精度要求来自决策,不是默认值;
  2. 套公式就当有代表性:非概率样本无统计推断基础;
  3. 只看总样本不看子群体:总样本 1000、每个细分 50,细分结论不可靠;
  4. 忽略设计效应:整群设计名义样本虚高;
  5. 忽略无效率:目标 400 投 400,清洗后只剩 320;
  6. 定性研究套公式:定性样本逻辑完全不同(信息充分度,见定性研究样本怎么设计);
  7. 样本量公式本身写错:计算前核对公式与参数(本文公式为标准比例/均值公式,使用前建议与统计教材核对)。

使用边界与注意事项

  • 本文公式为标准统计教材的简单随机抽样公式,实际项目需结合分层/配额与设计效应调整;
  • 样本设计(抽样方式、配额、来源)见市场调研样本怎么设计;
  • 涉及显著性检验的组间比较,检验逻辑见显著性检验完整指南。

参考资料

  • Cochran, W. G. (1977). Sampling Techniques(抽样与样本量经典教材)
  • Groves, R. M. et al. (2009). Survey Methodology
工具推荐 上传研究目标与精度要求,使用 SurveyKit Quant 辅助估算样本量并检查子群体样本是否充足。