本文适合谁
需要验证问卷量表质量、或要在报告中说明”量表是否可靠”的研究人员。
核心结论摘要
- 信度回答”测得稳不稳定”,效度回答”测的是不是想测的”——两者缺一不可;
- 高信度 ≠ 高效度:一致性不等于正确性;
- 不要将 Alpha > 某值写成所有场景的绝对合格标准;不要只凭 Alpha 判断量表有效;不要为提高 Alpha 机械删除题项;
- 量表开发(探索)与成熟量表复用(验证)的分析路径不同。
信度与效度的区别
| 维度 | 信度(Reliability) | 效度(Validity) |
|---|---|---|
| 回答的问题 | 测量是否稳定一致 | 是否测到了目标概念 |
| 类比 | 尺子量得准不准(每次一致吗) | 尺子是不是能量长度 |
| 检验 | 内部一致性、重测、分半 | 内容、结构、效标 |
| 关系 | 效度的必要非充分条件 | 信度高不一定效度高 |
内部一致性(Cronbach’s Alpha)
- 衡量量表各题项测量同一构念的程度;
- 计算:基于题项间平均相关(公式见统计教材);
- 使用边界:
- 题目数量影响大:题多 Alpha 偏高、题少偏低——短量表(≤5 题)低 Alpha 不一定代表质量差;
- Alpha 高不代表单维(可能测多个维度);
- 报告建议同时给:Alpha + 项目-总分相关 + 删除题项后的 Alpha。
项目总分相关与删除题项
- 项目-总分相关(Corrected Item-Total Correlation):每题与总分(去除该题)的相关;
- 经验参考:相关过低(如 < 0.3)的题目贡献弱,考虑检查措辞或删除;
- 删除题项后的 Alpha:若删除某题 Alpha 明显上升,该题与其他题不一致,需检查语义;
- 删除决策必须基于理论依据,不是数值游戏。
重测信度
- 同一组人隔一段时间重测,计算两次得分相关;
- 适用:测量稳定特质(态度、偏好);
- 注意:间隔过短有记忆效应,过长有真实变化——间隔选择是方法决策;
- 重测成本高,市场研究常用但非必须。
分半信度
- 量表随机分两半,计算两半得分相关(Spearman-Brown 校正);
- 适用:无法重测时的替代;
- 分半方式影响结果,需报告分半方法。
效度的类型
| 类型 | 回答的问题 | 检验方式 |
|---|---|---|
| 内容效度 | 题目是否覆盖概念的全部重要方面 | 专家评审、概念框架对照 |
| 表面效度 | 题目看起来是否在测该概念 | 非专业评审、直觉判断 |
| 结构效度 | 测量结构与理论结构是否一致 | 因子分析 |
| 聚合效度 | 与测同一概念的量表是否相关 | 相关分析(AVE 等) |
| 区分效度 | 与测不同概念的量表是否低相关 | 相关分析 |
| 效标效度 | 与外部效标(行为、结果)是否一致 | 预测/同期相关 |
内容效度与表面效度
- 内容效度:从概念定义出发,检查题项是否覆盖所有维度——量表开发阶段的核心工作(专家评审);
- 表面效度:受访者视角”这题在测什么”——表面效度差的题目(措辞费解)影响作答质量;
- 两者都是”判断式”检验,不产生统计量,但在报告中必须说明。
结构效度(因子分析)
- 探索性因子分析(EFA):不知道结构时,从数据中发现因子结构;
- KMO 与 Bartlett 检验:判断数据是否适合因子分析(KMO 经验参考 > 0.6,Bartlett 显著——均为经验参考,不脱离场景使用);
- 输出:因子载荷、因子数(特征值/碎石图);
- 验证性因子分析(CFA):有预设结构时验证模型拟合(适用于成熟量表复用);
- EFA 用于开发,CFA 用于验证——不要用 EFA 数据既探索又”验证”。
聚合效度与区分效度
- 聚合效度:同一构念的题项间高相关(AVE 经验参考 > 0.5,或载荷显著);
- 区分效度:不同构念的量表间相关显著低于同构念内相关;
- 实现:多特质多方法矩阵或 CFA 比较模型;
- 市场研究中报告简化版本(相关矩阵 + 说明)也可接受。
效标效度
- 量表得分与外部效标(如购买行为、NPS、续费率)的相关;
- 效标效度是量表”有用性”的直接证据——态度量表若能预测行为,业务价值最大;
- 报告需说明效标选择依据与相关强度。
KMO 与 Bartlett 检验
- KMO:抽样充分性(题项间偏相关小则 KMO 高);
- Bartlett:相关矩阵是否为单位矩阵(是否值得做因子分析);
- 经验阈值不能机械使用:KMO 0.6–0.7 是常见参考,但小样本、少题项场景需结合判断;
- 不显著不代表”问卷无效”,可能只是样本或题项结构问题。
不能机械使用固定阈值
| 指标 | 常见参考 | 必须注意 |
|---|---|---|
| Alpha | > 0.7 | 受题数影响;短量表放宽 |
| KMO | > 0.6 | 样本与题项结构影响 |
| 因子载荷 | > 0.4/0.5 | 与样本量、题数相关 |
| AVE | > 0.5 | 简化指标,结合载荷判断 |
以上均为经验参考,不是脱离研究场景的合格线——报告应说明判断依据与局限。
量表开发与成熟量表复用
| 场景 | 路径 |
|---|---|
| 新量表开发 | 内容效度(专家)→ EFA 探索结构 → 信度 → 效标/区分效度 → 多研究验证 |
| 成熟量表复用 | CFA 验证结构 → 信度 → 与历史/基准对标 |
| 翻译量表 | 回译验证 → 文化适配检查 → 目标人群重测信效度 |
成熟量表优先复用:自建量表成本高、验证难;有成熟量表(如 NPS、SUS)时优先使用(SUS 见用户体验研究如何设计)。
信效度分析结果如何写入报告
- 方法说明:量表来源、检验方法、软件与参数;
- 信度结果:Alpha(含 95% 区间可选项)、项目-总分相关、删除题项变化;
- 效度结果:因子分析摘要(KMO、载荷表、因子解释方差)、聚合/区分相关矩阵;
- 局限:阈值判断依据、样本限制;
- 不要把全部载荷表塞正文,关键部分展示、完整放附录。
常见错误
- Alpha > 0.7 当万能标准:忽略题数影响与场景差异;
- 只报 Alpha 不报效度:一致性不等于正确性;
- 为提 Alpha 机械删题:内容效度受损;
- KMO/载荷阈值一刀切:脱离样本与场景;
- EFA 当 CFA 用:探索结构却宣称”验证”;
- 翻译量表不验证:语言与文化差异破坏测量等价性;
- 反向题未反转就计算 Alpha:负相关题项拉低一致性。
使用边界与注意事项
- 信效度分析适用于多题量表(单题指标如 NPS 不做内部一致性检验);
- 样本量要求:因子分析经验参考题项数 × 5–10 或 ≥ 200(视复杂度);
- 量表设计(刻度与锚点)见问卷量表怎么设计;
- 因子分析与细分分析衔接见聚类分析完整指南。
参考资料
- DeVellis, R. F., & Thorpe, C. T. (2021). Scale Development: Theory and Applications
- Nunnally, J. C. (1978). Psychometric Theory(心理测量经典教材)
工具推荐
上传量表数据,使用 SurveyKit Quant 辅助计算内部一致性指标并整理信效度分析素材。