本文适合谁

需要验证问卷量表质量、或要在报告中说明”量表是否可靠”的研究人员。

核心结论摘要

  • 信度回答”测得稳不稳定”,效度回答”测的是不是想测的”——两者缺一不可;
  • 高信度 ≠ 高效度:一致性不等于正确性;
  • 不要将 Alpha > 某值写成所有场景的绝对合格标准;不要只凭 Alpha 判断量表有效;不要为提高 Alpha 机械删除题项;
  • 量表开发(探索)与成熟量表复用(验证)的分析路径不同。

信度与效度的区别

维度信度(Reliability)效度(Validity)
回答的问题测量是否稳定一致是否测到了目标概念
类比尺子量得准不准(每次一致吗)尺子是不是能量长度
检验内部一致性、重测、分半内容、结构、效标
关系效度的必要非充分条件信度高不一定效度高

内部一致性(Cronbach’s Alpha)

  • 衡量量表各题项测量同一构念的程度;
  • 计算:基于题项间平均相关(公式见统计教材);
  • 使用边界:
    • 题目数量影响大:题多 Alpha 偏高、题少偏低——短量表(≤5 题)低 Alpha 不一定代表质量差;
    • Alpha 高不代表单维(可能测多个维度);
    • 报告建议同时给:Alpha + 项目-总分相关 + 删除题项后的 Alpha。

项目总分相关与删除题项

  • 项目-总分相关(Corrected Item-Total Correlation):每题与总分(去除该题)的相关;
  • 经验参考:相关过低(如 < 0.3)的题目贡献弱,考虑检查措辞或删除;
  • 删除题项后的 Alpha:若删除某题 Alpha 明显上升,该题与其他题不一致,需检查语义;
  • 删除决策必须基于理论依据,不是数值游戏。

重测信度

  • 同一组人隔一段时间重测,计算两次得分相关;
  • 适用:测量稳定特质(态度、偏好);
  • 注意:间隔过短有记忆效应,过长有真实变化——间隔选择是方法决策;
  • 重测成本高,市场研究常用但非必须。

分半信度

  • 量表随机分两半,计算两半得分相关(Spearman-Brown 校正);
  • 适用:无法重测时的替代;
  • 分半方式影响结果,需报告分半方法。

效度的类型

类型回答的问题检验方式
内容效度题目是否覆盖概念的全部重要方面专家评审、概念框架对照
表面效度题目看起来是否在测该概念非专业评审、直觉判断
结构效度测量结构与理论结构是否一致因子分析
聚合效度与测同一概念的量表是否相关相关分析(AVE 等)
区分效度与测不同概念的量表是否低相关相关分析
效标效度与外部效标(行为、结果)是否一致预测/同期相关

内容效度与表面效度

  • 内容效度:从概念定义出发,检查题项是否覆盖所有维度——量表开发阶段的核心工作(专家评审);
  • 表面效度:受访者视角”这题在测什么”——表面效度差的题目(措辞费解)影响作答质量;
  • 两者都是”判断式”检验,不产生统计量,但在报告中必须说明。

结构效度(因子分析)

  • 探索性因子分析(EFA):不知道结构时,从数据中发现因子结构;
    • KMO 与 Bartlett 检验:判断数据是否适合因子分析(KMO 经验参考 > 0.6,Bartlett 显著——均为经验参考,不脱离场景使用);
    • 输出:因子载荷、因子数(特征值/碎石图);
  • 验证性因子分析(CFA):有预设结构时验证模型拟合(适用于成熟量表复用);
  • EFA 用于开发,CFA 用于验证——不要用 EFA 数据既探索又”验证”。

聚合效度与区分效度

  • 聚合效度:同一构念的题项间高相关(AVE 经验参考 > 0.5,或载荷显著);
  • 区分效度:不同构念的量表间相关显著低于同构念内相关;
  • 实现:多特质多方法矩阵或 CFA 比较模型;
  • 市场研究中报告简化版本(相关矩阵 + 说明)也可接受。

效标效度

  • 量表得分与外部效标(如购买行为、NPS、续费率)的相关;
  • 效标效度是量表”有用性”的直接证据——态度量表若能预测行为,业务价值最大;
  • 报告需说明效标选择依据与相关强度。

KMO 与 Bartlett 检验

  • KMO:抽样充分性(题项间偏相关小则 KMO 高);
  • Bartlett:相关矩阵是否为单位矩阵(是否值得做因子分析);
  • 经验阈值不能机械使用:KMO 0.6–0.7 是常见参考,但小样本、少题项场景需结合判断;
  • 不显著不代表”问卷无效”,可能只是样本或题项结构问题。

不能机械使用固定阈值

指标常见参考必须注意
Alpha> 0.7受题数影响;短量表放宽
KMO> 0.6样本与题项结构影响
因子载荷> 0.4/0.5与样本量、题数相关
AVE> 0.5简化指标,结合载荷判断

以上均为经验参考,不是脱离研究场景的合格线——报告应说明判断依据与局限。

量表开发与成熟量表复用

场景路径
新量表开发内容效度(专家)→ EFA 探索结构 → 信度 → 效标/区分效度 → 多研究验证
成熟量表复用CFA 验证结构 → 信度 → 与历史/基准对标
翻译量表回译验证 → 文化适配检查 → 目标人群重测信效度

成熟量表优先复用:自建量表成本高、验证难;有成熟量表(如 NPS、SUS)时优先使用(SUS 见用户体验研究如何设计)。

信效度分析结果如何写入报告

  • 方法说明:量表来源、检验方法、软件与参数;
  • 信度结果:Alpha(含 95% 区间可选项)、项目-总分相关、删除题项变化;
  • 效度结果:因子分析摘要(KMO、载荷表、因子解释方差)、聚合/区分相关矩阵;
  • 局限:阈值判断依据、样本限制;
  • 不要把全部载荷表塞正文,关键部分展示、完整放附录。

常见错误

  1. Alpha > 0.7 当万能标准:忽略题数影响与场景差异;
  2. 只报 Alpha 不报效度:一致性不等于正确性;
  3. 为提 Alpha 机械删题:内容效度受损;
  4. KMO/载荷阈值一刀切:脱离样本与场景;
  5. EFA 当 CFA 用:探索结构却宣称”验证”;
  6. 翻译量表不验证:语言与文化差异破坏测量等价性;
  7. 反向题未反转就计算 Alpha:负相关题项拉低一致性。

使用边界与注意事项

  • 信效度分析适用于多题量表(单题指标如 NPS 不做内部一致性检验);
  • 样本量要求:因子分析经验参考题项数 × 5–10 或 ≥ 200(视复杂度);
  • 量表设计(刻度与锚点)见问卷量表怎么设计;
  • 因子分析与细分分析衔接见聚类分析完整指南。

参考资料

  • DeVellis, R. F., & Thorpe, C. T. (2021). Scale Development: Theory and Applications
  • Nunnally, J. C. (1978). Psychometric Theory(心理测量经典教材)
工具推荐 上传量表数据,使用 SurveyKit Quant 辅助计算内部一致性指标并整理信效度分析素材。