什么是回归分析?

回归分析(Regression Analysis)是研究因变量(结果)与自变量(影响因素)之间关系的统计方法。它回答的问题非常直接:“满意度上升 1 分,复购概率变化多少?”“哪个因素对满意度的影响最大?”

市场研究中最常用的两类回归:

  • 线性回归(OLS):因变量为连续变量(如满意度 0–10 分、花费金额);
  • 逻辑回归(Logistic):因变量为二分类(如买/不买、流失/留存),输出概率。

回归分析是**驱动因素分析(Driver Analysis)**的核心工具:从众多候选因素中识别出真正驱动结果的关键变量,并量化其相对影响力。

什么情况下使用?

回归分析适合回答:

  • 满意度驱动因素:哪些服务环节对整体满意度影响最大;
  • 购买决策驱动:价格、品牌、功能、渠道哪个是购买的关键;
  • 流失预测:哪些用户特征预示流失风险;
  • 弹性估算:价格变化对需求量的影响程度。

不适合的场景:

  • 变量间高度共线(如两个含义几乎相同的满意度条目同时入模);
  • 因果关系倒置(满意度由忠诚度“解释”,逻辑上站不住);
  • 非线性关系明显但未做变换(如 U 型关系直接用线性拟合会失真)。

数据要求

样本量

  • 线性回归经验法则:每 1 个自变量至少 10–15 个样本,总样本 ≥ 200(细分建模每组 ≥ 150);
  • 逻辑回归对样本更敏感:每个事件类别 ≥ 100 较稳妥。

变量要求

  • 因变量:测量可靠(单一指标或合成指标);
  • 自变量:先做相关分析,剔除 |r| > 0.8 的共线变量;
  • 分类变量(如地区)转为虚拟变量;
  • 标准化:需要比较变量影响力时使用标准化系数(β)。

数据质量

  • 缺失值处理:删除或插补,注意缺失机制;
  • 异常值:检查对结果影响(杠杆值、Cook’s distance);
  • 检查线性关系:散点图或加入平方项检验。

分析步骤

第一步:相关分析(初筛)

  • 计算因变量与所有候选自变量的相关系数;
  • 剔除与因变量不相关(|r| < 0.1)的变量,保留相关显著的变量;
  • 检查自变量之间的共线性。

第二步:模型构建

  • 全模型 + 逐步回归(推荐逐步向前,p < 0.05 进入)
  • 或用分层回归:先放控制变量(人口属性),再放核心变量(态度/体验),观察增量贡献;
  • 报告中同时给出标准系数与非标准系数。

第三步:模型诊断

  • 共线性:VIF < 5(容忍度 > 0.2);
  • 残差检验:残差近似正态、无明显的异方差模式;
  • 异常影响点:检查并说明处理方式。

第四步:模型评估

  • 线性回归看 (解释力)与调整 R²;
  • 逻辑回归看 准确率/AUC/伪 R²
  • 交叉验证(如 10 折)确认稳定,避免过拟合。

第五步:解释与落地

  • 标准化系数 β 排序 = 驱动因素重要性排序;
  • 对重要驱动因素做细分与访谈验证,确认业务可行动作。

如何解释

输出示例(线性回归,因变量:整体满意度)

驱动因素标准化 β显著性解读
服务质量0.42p<0.001最强驱动
价格感知0.28p<0.001第二驱动
产品功能0.15p<0.01中等驱动
品牌形象0.08p=0.07不显著

解释要点:

  • β 表示相对影响力:服务质量每提升 1 个标准差,满意度提升 0.42 个标准差;
  • p < 0.05 是筛选线,但效应量(β 大小)才决定业务优先级;
  • 说明“这些因素解释了满意度变异的百分之多少”,低 R² 不意味着模型无用,只说明还有未纳入的因素;
  • 显著但 β 很小的因素,业务上通常不值得投入。

如何写入报告

  • 方法说明:模型类型、变量、样本、逐步规则与诊断结果;
  • 驱动因素排序图:标准化系数条形图(含置信区间);
  • 关键发现页:Top 3 驱动因素 + 与满意度/购买行为的关系;
  • 行动建议:把“β 大”翻译成“优先改进 XX 环节”;
  • 模型局限说明:横截面数据的相关性不等于因果,建议结合实验/纵向数据验证。

常见误区

  1. 相关性误读为因果:横截面回归只能说“相关”,因果需实验或纵向证据;
  2. 共线变量强行入模:重要性被稀释甚至符号反转;
  3. 样本量不足:β 不稳定,p 值不可靠;
  4. 忽略非线性:满意度与忠诚度常存在阈值效应(如 8 分以上才愿意推荐);
  5. 只看 p 值不看 β:统计显著 ≠ 业务重要;
  6. 过度拟合:变量塞得越多越好?不,复杂模型在小样本上泛化差;
  7. 缺失值处理随意:大量缺失的变量直接入模会系统性偏误。
工具推荐 想自动完成驱动因素分析?使用 SurveyKit Quant,自动完成变量筛选、回归建模与驱动因素报告。