什么是回归分析?
回归分析(Regression Analysis)是研究因变量(结果)与自变量(影响因素)之间关系的统计方法。它回答的问题非常直接:“满意度上升 1 分,复购概率变化多少?” 或 “哪个因素对满意度的影响最大?”
市场研究中最常用的两类回归:
- 线性回归(OLS):因变量为连续变量(如满意度 0–10 分、花费金额);
- 逻辑回归(Logistic):因变量为二分类(如买/不买、流失/留存),输出概率。
回归分析是**驱动因素分析(Driver Analysis)**的核心工具:从众多候选因素中识别出真正驱动结果的关键变量,并量化其相对影响力。
什么情况下使用?
回归分析适合回答:
- 满意度驱动因素:哪些服务环节对整体满意度影响最大;
- 购买决策驱动:价格、品牌、功能、渠道哪个是购买的关键;
- 流失预测:哪些用户特征预示流失风险;
- 弹性估算:价格变化对需求量的影响程度。
不适合的场景:
- 变量间高度共线(如两个含义几乎相同的满意度条目同时入模);
- 因果关系倒置(满意度由忠诚度“解释”,逻辑上站不住);
- 非线性关系明显但未做变换(如 U 型关系直接用线性拟合会失真)。
数据要求
样本量:
- 线性回归经验法则:每 1 个自变量至少 10–15 个样本,总样本 ≥ 200(细分建模每组 ≥ 150);
- 逻辑回归对样本更敏感:每个事件类别 ≥ 100 较稳妥。
变量要求:
- 因变量:测量可靠(单一指标或合成指标);
- 自变量:先做相关分析,剔除 |r| > 0.8 的共线变量;
- 分类变量(如地区)转为虚拟变量;
- 标准化:需要比较变量影响力时使用标准化系数(β)。
数据质量:
- 缺失值处理:删除或插补,注意缺失机制;
- 异常值:检查对结果影响(杠杆值、Cook’s distance);
- 检查线性关系:散点图或加入平方项检验。
分析步骤
第一步:相关分析(初筛)
- 计算因变量与所有候选自变量的相关系数;
- 剔除与因变量不相关(|r| < 0.1)的变量,保留相关显著的变量;
- 检查自变量之间的共线性。
第二步:模型构建
- 全模型 + 逐步回归(推荐逐步向前,p < 0.05 进入):
- 或用分层回归:先放控制变量(人口属性),再放核心变量(态度/体验),观察增量贡献;
- 报告中同时给出标准系数与非标准系数。
第三步:模型诊断
- 共线性:VIF < 5(容忍度 > 0.2);
- 残差检验:残差近似正态、无明显的异方差模式;
- 异常影响点:检查并说明处理方式。
第四步:模型评估
- 线性回归看 R²(解释力)与调整 R²;
- 逻辑回归看 准确率/AUC/伪 R²;
- 交叉验证(如 10 折)确认稳定,避免过拟合。
第五步:解释与落地
- 标准化系数 β 排序 = 驱动因素重要性排序;
- 对重要驱动因素做细分与访谈验证,确认业务可行动作。
如何解释
输出示例(线性回归,因变量:整体满意度):
| 驱动因素 | 标准化 β | 显著性 | 解读 |
|---|---|---|---|
| 服务质量 | 0.42 | p<0.001 | 最强驱动 |
| 价格感知 | 0.28 | p<0.001 | 第二驱动 |
| 产品功能 | 0.15 | p<0.01 | 中等驱动 |
| 品牌形象 | 0.08 | p=0.07 | 不显著 |
解释要点:
- β 表示相对影响力:服务质量每提升 1 个标准差,满意度提升 0.42 个标准差;
- p < 0.05 是筛选线,但效应量(β 大小)才决定业务优先级;
- R² 说明“这些因素解释了满意度变异的百分之多少”,低 R² 不意味着模型无用,只说明还有未纳入的因素;
- 显著但 β 很小的因素,业务上通常不值得投入。
如何写入报告
- 方法说明:模型类型、变量、样本、逐步规则与诊断结果;
- 驱动因素排序图:标准化系数条形图(含置信区间);
- 关键发现页:Top 3 驱动因素 + 与满意度/购买行为的关系;
- 行动建议:把“β 大”翻译成“优先改进 XX 环节”;
- 模型局限说明:横截面数据的相关性不等于因果,建议结合实验/纵向数据验证。
常见误区
- 相关性误读为因果:横截面回归只能说“相关”,因果需实验或纵向证据;
- 共线变量强行入模:重要性被稀释甚至符号反转;
- 样本量不足:β 不稳定,p 值不可靠;
- 忽略非线性:满意度与忠诚度常存在阈值效应(如 8 分以上才愿意推荐);
- 只看 p 值不看 β:统计显著 ≠ 业务重要;
- 过度拟合:变量塞得越多越好?不,复杂模型在小样本上泛化差;
- 缺失值处理随意:大量缺失的变量直接入模会系统性偏误。
工具推荐
想自动完成驱动因素分析?使用 SurveyKit Quant,自动完成变量筛选、回归建模与驱动因素报告。