本文适合谁
需要确定调研样本来源、结构与配额的定量研究项目负责人与研究人员。
核心结论摘要
- 样本设计的三要素:目标总体定义 → 抽样方式选择 → 配额与结构设计;
- 大样本不等于代表性,配额样本不等于概率样本;
- 样本是否适用取决于研究目标:测市场比例用概率抽样思路,了解用户反馈可接受便利样本但需声明局限;
- 样本来源偏差是比样本量更常见的质量问题——线上样本库、自有用户样本都有系统性风险。
总体、样本与抽样框的区别
| 概念 | 定义 | 示例 |
|---|---|---|
| 总体(Population) | 研究结论要推论到的全部对象 | 全国 18–50 岁智能手机用户 |
| 抽样框(Sampling Frame) | 实际可抽取的名单/入口 | 样本库注册用户、号码池 |
| 样本(Sample) | 实际参与研究的对象 | 从中抽取的 1000 人 |
关键:抽样框 ≠ 总体。样本库用户、电商买家、App 用户都只是总体的一部分入口,覆盖偏差从这里产生。
研究目标如何决定样本
| 研究目标 | 样本要求 |
|---|---|
| 估计市场比例(渗透率、份额) | 概率抽样思路 + 严格配额 + 加权 |
| 满意度/体验诊断 | 有代表性的使用人群 + 结构可控 |
| 概念/价格测试 | 目标品类用户 + 行为甄别 |
| 现有用户洞察 | 用户库样本可接受,声明覆盖范围 |
没有”万能的样本方案”——样本设计必须从研究目标倒推。
目标人群定义
- 用可操作标准定义:“过去 3 个月购买过咖啡”比”咖啡爱好者”可执行;
- 明确纳入标准(使用者/决策者/地域/年龄)与排除标准(行业从业者、近期参加调研者);
- 纳入/排除标准同时用于样本库筛选与问卷甄别;
- 目标人群定义不清是样本偏差的第一来源。
概率抽样
| 方法 | 做法 | 适用 | 注意 |
|---|---|---|---|
| 简单随机抽样 | 每个单元等概率抽取 | 抽样框完整时 | 现实中抽样框常不完整 |
| 分层抽样 | 先按特征分层,再层内随机 | 保证关键分组样本量 | 分层变量须与总体分布一致 |
| 整群抽样 | 先抽群,群内全查 | 地理分散时降低成本 | 群内同质会增大误差 |
| 系统抽样 | 按固定间隔抽取 | 名单有序时 | 名单周期性与间隔重合会偏差 |
概率抽样的价值:可计算抽样误差、统计推断有依据。但实现成本高,市场研究多数场景使用配额抽样。
非概率抽样
| 方法 | 做法 | 风险 |
|---|---|---|
| 配额抽样 | 按配额控制样本结构 | 配额内选择仍非随机 |
| 便利抽样 | 最容易获得的样本 | 系统性偏差大 |
| 滚雪球/自选 | 受访者推荐/自愿参与 | 群体内聚,代表性弱 |
配额抽样的定位:控制”可见特征”的结构,但无法控制”不可见特征”(态度、行为)的偏差。用于了解现状可以,用于精确推断总体比例需谨慎表述。
样本来源偏差
- 线上样本库的风险:职业受访者、重复参与、答题模式化(识别方法见定性研究样本怎么设计中的职业受访者识别);
- 自有用户样本的风险:只覆盖现有用户,活跃度高者更易参与——满意度、使用深度被系统性高估;
- App/社群招募的风险:用户画像偏”重度+活跃”;
- 缓解:多渠道来源 + 事后结构与配额比对 + 加权调整(见问卷数据加权完整指南)。
样本配额设计
配额维度选择原则:
- 选择与分析计划相关的维度(报告要按城市、年龄分段,配额就按这些维度控制);
- 维度 1–3 个为宜(过多导致配额单元过细、回收困难);
- 每个配额单元保证最低有效样本(经验参考 ≥ 50,视分析精度需求调整)。
自然分布与等额分组
| 方式 | 做法 | 适用 |
|---|---|---|
| 自然分布(比例配额) | 按总体占比分配样本 | 估计总体水平 |
| 等额分组(非比例配额) | 各组样本量相等 | 组间比较(如 4 个城市各 250) |
- 等额分组做组间对比效率高,但分析总体水平时需加权还原比例;
- 报告中必须说明配额口径(比例/等额)。
全国样本与区域样本
- 全国研究:按区域层级(一线/新一线/二三线/四线)配额,覆盖城乡;
- 区域研究:聚焦目标区域,明确报告适用范围;
- 常见错误:用一线城市样本推断全国结论——城市层级间差异显著(可参见交叉分析入门的分层对比思路)。
核心用户与潜在用户
- 核心用户(高频/活跃):体验深、反馈具体,但态度可能偏正向;
- 潜在用户(未使用但有需求):反映增长机会,对认知类指标重要;
- 样本需同时覆盖两类人群,配额比例按研究目标设定(诊断现有体验以核心用户为主;评估市场机会需加入潜在用户)。
新用户、活跃用户、流失用户
- 三类人群回答完全不同的问题(新用户看上手与首感,活跃用户看使用与价值,流失用户看离开原因);
- 配额设计:按研究目标分配三类的比例;
- 流失用户是重要但常被忽略的样本——流失原因研究必须包含(方法见定性访谈研究如何设计)。
B2B 研究中的企业与角色层级
- 企业维度:行业、规模、地域分层;
- 角色维度:使用者 / 影响者 / 决策者(三类角色回答不同问题);
- 配额按”企业 × 角色”交叉设计,保证每个决策角色有足够样本;
- B2B 样本量通常小于消费者研究(总体小、精度要求场景化),但每个关键角色单元仍需最低样本(经验参考 30–50,视分析需求调整)。
样本结构表
| 维度 | 类别 | 总体占比 | 计划样本 | 实际样本 | 完成率 | 备用样本 | 数据来源 | 是否加权 |
|---|---|---|---|---|---|---|---|---|
| 城市 | 一线 | 20% | 200 | 208 | 104% | 30 | 样本库A | 是 |
| 城市 | 新一线 | 25% | 250 | 231 | 92% | 40 | 样本库A | 是 |
| … | … | … | … | … | … | … | … | … |
(可下载模板见样本配额表模板)
招募与回收管理
- 多渠道投放,监控各渠道样本结构与完成率;
- 配额实时控制:接近上限的配额暂停,未达标的配额加速;
- 回收结束前检查:配额完成情况、来源分布、异常作答比例(清洗见问卷数据清洗完整指南)。
样本偏差检查
- 回收后与目标总体结构比对(年龄/性别/地域/关键行为);
- 检查关键指标在来源渠道间的差异(如 A 渠道满意度显著高于 B);
- 偏差明显的处理:加权(见问卷数据加权完整指南)或补充回收;
- 偏差无法修正时,在报告中如实声明样本局限。
常见错误
- 样本量大当代表性强:来源偏差无法用数量弥补;
- 配额样本当概率样本:报告声称”±3% 误差”但没有概率抽样基础;
- 抽样框与总体脱节:只从 App 用户抽却推断全部用户;
- 配额维度与分析计划脱节:报告要按城市分段,配额却没有城市;
- 只有核心用户:市场机会与潜在需求无从谈起;
- B2B 只访问一个角色:决策链信息残缺;
- 不检查来源差异:渠道间系统性差异被当真实信号。
使用边界与注意事项
- 本文为通用框架,样本量计算见市场调研样本量怎么计算;
- 配额样本的市场研究报告中,避免”总体比例”式表述,使用”样本范围内”等限定;
- 涉及推断总体比例的研究,优先概率抽样或明确声明局限。
参考资料
- Groves, R. M. et al. (2009). Survey Methodology(抽样与调查方法经典教材)
- Lohr, S. L. (2019). Sampling: Design and Analysis(抽样设计教材)
工具推荐
上传样本配额表与回收数据,使用 SurveyKit Quant 辅助检查样本结构与配额完成情况。