本文适合谁

需要确定调研样本来源、结构与配额的定量研究项目负责人与研究人员。

核心结论摘要

  • 样本设计的三要素:目标总体定义 → 抽样方式选择 → 配额与结构设计;
  • 大样本不等于代表性,配额样本不等于概率样本;
  • 样本是否适用取决于研究目标:测市场比例用概率抽样思路,了解用户反馈可接受便利样本但需声明局限;
  • 样本来源偏差是比样本量更常见的质量问题——线上样本库、自有用户样本都有系统性风险。

总体、样本与抽样框的区别

概念定义示例
总体(Population)研究结论要推论到的全部对象全国 18–50 岁智能手机用户
抽样框(Sampling Frame)实际可抽取的名单/入口样本库注册用户、号码池
样本(Sample)实际参与研究的对象从中抽取的 1000 人

关键:抽样框 ≠ 总体。样本库用户、电商买家、App 用户都只是总体的一部分入口,覆盖偏差从这里产生。

研究目标如何决定样本

研究目标样本要求
估计市场比例(渗透率、份额)概率抽样思路 + 严格配额 + 加权
满意度/体验诊断有代表性的使用人群 + 结构可控
概念/价格测试目标品类用户 + 行为甄别
现有用户洞察用户库样本可接受,声明覆盖范围

没有”万能的样本方案”——样本设计必须从研究目标倒推。

目标人群定义

  • 用可操作标准定义:“过去 3 个月购买过咖啡”比”咖啡爱好者”可执行;
  • 明确纳入标准(使用者/决策者/地域/年龄)与排除标准(行业从业者、近期参加调研者);
  • 纳入/排除标准同时用于样本库筛选与问卷甄别;
  • 目标人群定义不清是样本偏差的第一来源。

概率抽样

方法做法适用注意
简单随机抽样每个单元等概率抽取抽样框完整时现实中抽样框常不完整
分层抽样先按特征分层,再层内随机保证关键分组样本量分层变量须与总体分布一致
整群抽样先抽群,群内全查地理分散时降低成本群内同质会增大误差
系统抽样按固定间隔抽取名单有序时名单周期性与间隔重合会偏差

概率抽样的价值:可计算抽样误差、统计推断有依据。但实现成本高,市场研究多数场景使用配额抽样。

非概率抽样

方法做法风险
配额抽样按配额控制样本结构配额内选择仍非随机
便利抽样最容易获得的样本系统性偏差大
滚雪球/自选受访者推荐/自愿参与群体内聚,代表性弱

配额抽样的定位:控制”可见特征”的结构,但无法控制”不可见特征”(态度、行为)的偏差。用于了解现状可以,用于精确推断总体比例需谨慎表述。

样本来源偏差

  • 线上样本库的风险:职业受访者、重复参与、答题模式化(识别方法见定性研究样本怎么设计中的职业受访者识别);
  • 自有用户样本的风险:只覆盖现有用户,活跃度高者更易参与——满意度、使用深度被系统性高估;
  • App/社群招募的风险:用户画像偏”重度+活跃”;
  • 缓解:多渠道来源 + 事后结构与配额比对 + 加权调整(见问卷数据加权完整指南)。

样本配额设计

配额维度选择原则:

  • 选择与分析计划相关的维度(报告要按城市、年龄分段,配额就按这些维度控制);
  • 维度 1–3 个为宜(过多导致配额单元过细、回收困难);
  • 每个配额单元保证最低有效样本(经验参考 ≥ 50,视分析精度需求调整)。

自然分布与等额分组

方式做法适用
自然分布(比例配额)按总体占比分配样本估计总体水平
等额分组(非比例配额)各组样本量相等组间比较(如 4 个城市各 250)
  • 等额分组做组间对比效率高,但分析总体水平时需加权还原比例;
  • 报告中必须说明配额口径(比例/等额)。

全国样本与区域样本

  • 全国研究:按区域层级(一线/新一线/二三线/四线)配额,覆盖城乡;
  • 区域研究:聚焦目标区域,明确报告适用范围;
  • 常见错误:用一线城市样本推断全国结论——城市层级间差异显著(可参见交叉分析入门的分层对比思路)。

核心用户与潜在用户

  • 核心用户(高频/活跃):体验深、反馈具体,但态度可能偏正向;
  • 潜在用户(未使用但有需求):反映增长机会,对认知类指标重要;
  • 样本需同时覆盖两类人群,配额比例按研究目标设定(诊断现有体验以核心用户为主;评估市场机会需加入潜在用户)。

新用户、活跃用户、流失用户

  • 三类人群回答完全不同的问题(新用户看上手与首感,活跃用户看使用与价值,流失用户看离开原因);
  • 配额设计:按研究目标分配三类的比例;
  • 流失用户是重要但常被忽略的样本——流失原因研究必须包含(方法见定性访谈研究如何设计)。

B2B 研究中的企业与角色层级

  • 企业维度:行业、规模、地域分层;
  • 角色维度:使用者 / 影响者 / 决策者(三类角色回答不同问题);
  • 配额按”企业 × 角色”交叉设计,保证每个决策角色有足够样本;
  • B2B 样本量通常小于消费者研究(总体小、精度要求场景化),但每个关键角色单元仍需最低样本(经验参考 30–50,视分析需求调整)。

样本结构表

维度类别总体占比计划样本实际样本完成率备用样本数据来源是否加权
城市一线20%200208104%30样本库A是
城市新一线25%25023192%40样本库A是
………………………

(可下载模板见样本配额表模板)

招募与回收管理

  • 多渠道投放,监控各渠道样本结构与完成率;
  • 配额实时控制:接近上限的配额暂停,未达标的配额加速;
  • 回收结束前检查:配额完成情况、来源分布、异常作答比例(清洗见问卷数据清洗完整指南)。

样本偏差检查

  • 回收后与目标总体结构比对(年龄/性别/地域/关键行为);
  • 检查关键指标在来源渠道间的差异(如 A 渠道满意度显著高于 B);
  • 偏差明显的处理:加权(见问卷数据加权完整指南)或补充回收;
  • 偏差无法修正时,在报告中如实声明样本局限。

常见错误

  1. 样本量大当代表性强:来源偏差无法用数量弥补;
  2. 配额样本当概率样本:报告声称”±3% 误差”但没有概率抽样基础;
  3. 抽样框与总体脱节:只从 App 用户抽却推断全部用户;
  4. 配额维度与分析计划脱节:报告要按城市分段,配额却没有城市;
  5. 只有核心用户:市场机会与潜在需求无从谈起;
  6. B2B 只访问一个角色:决策链信息残缺;
  7. 不检查来源差异:渠道间系统性差异被当真实信号。

使用边界与注意事项

  • 本文为通用框架,样本量计算见市场调研样本量怎么计算;
  • 配额样本的市场研究报告中,避免”总体比例”式表述,使用”样本范围内”等限定;
  • 涉及推断总体比例的研究,优先概率抽样或明确声明局限。

参考资料

  • Groves, R. M. et al. (2009). Survey Methodology(抽样与调查方法经典教材)
  • Lohr, S. L. (2019). Sampling: Design and Analysis(抽样设计教材)
工具推荐 上传样本配额表与回收数据,使用 SurveyKit Quant 辅助检查样本结构与配额完成情况。