什么是聚类分析?
聚类分析(Cluster Analysis)是一种无监督学习方法:在不预设分组标签的情况下,根据样本在多维变量上的相似性,把研究对象自动划分为若干内部相似、组间差异明显的群组。
在市场研究中,聚类分析是**用户细分(Segmentation)**的核心工具。它的产出是一组可命名、可描述的细分人群(如“价格敏感型”“品质导向型”),支撑定位、产品与营销决策。
常用算法:
| 算法 | 特点 | 适用 |
|---|---|---|
| K-means | 快速、可解释性好 | 大样本(>1000),变量连续 |
| 层次聚类 | 无需预设 K,输出树状图 | 小样本,探索阶段 |
| 两阶段聚类 | 先层次后 K-means | 中等样本,市场研究标准做法 |
| DBSCAN | 自动识别噪音与任意形状 | 异常值多、形状不规则 |
什么情况下使用?
聚类分析适合回答:
- 用户有哪些细分? 从行为/态度数据中识别自然形成的群组;
- 各细分人群有多大、长什么样? 输出细分画像;
- 不同细分偏好什么? 为差异化产品与营销提供依据。
不适合的场景:
- 变量间强相关(应先做相关分析或因子分析降维);
- 目标明确为单一维度排序(直接用指标分组);
- 样本 < 100(聚类结果不稳定)。
数据要求
变量选择:
- 使用与细分目标相关的态度/行为变量(如购买动机、使用频率、品牌态度量表);
- 避免直接使用“分类用人口属性”作为聚类输入(年龄、收入等用于事后画像);
- 变量数 5–15 个为宜,过多建议先用因子分析降维。
数据清洗:
- 处理缺失值(删除或插补,比例 > 10% 的变量考虑剔除);
- 检查异常值(极端值会扭曲聚类中心);
- 标准化:不同量纲变量(1–5 量表 vs 金额)必须标准化(Z-score 或 0–1),否则量纲大的变量主导聚类。
样本量:建议 ≥ 300,且 ≥ 10 倍变量数;每个期望细分 ≥ 50。
分析步骤
第一步:变量预处理
- 相关分析:剔除相关系数 > 0.8 的冗余变量;
- 因子分析(可选):将态度量表降维为 3–6 个因子;
- 标准化全部输入变量。
第二步:确定聚类数 K
- 肘部法则:绘制 K 与组内平方和(WSS)曲线,找拐点;
- 轮廓系数:K 在 2–10 间比较,轮廓系数接近 1 最优;
- 结合业务可解释性:K 以 3–6 个为准,太多难以管理。
第三步:执行聚类
- 两阶段法:层次聚类确定中心,再用 K-means 精化(推荐);
- K-means 需多次随机初始中心,选最优结果(稳定且 WSS 小)。
第四步:结果验证
- 判别分析/显著性检验:各细分在聚类变量上差异显著(ANOVA 或 Kruskal-Wallis);
- 稳定验证:随机抽样重复聚类,观察细分结构是否一致;
- 完整的四层验证框架(统计显著/结构稳定/外部有效/业务可行动)见用户细分结果验证方法;
- 交叉验证外部变量(如购买金额、满意度)确认细分的实际意义。
第五步:细分画像
- 用聚类变量 + 事后变量(人口属性、使用行为、态度)描述每个细分;
- 命名:用最鲜明的特征命名(如“品质导向型 35%”)。
如何解释
- 细分内部同质、组间异质是判断聚类质量的核心标准;
- 用均值对比表呈现每个细分在聚类变量上的得分(显著高/低于总体用符号标注);
- 关注细分的规模与价值:大而平庸 vs 小而高价值,决定资源配置;
- 命名要便于业务沟通:避免编号(“聚类1”),用特征命名。
细分画像示例:
| 细分 | 占比 | 核心特征 | 价值取向 |
|---|---|---|---|
| 品质导向型 | 32% | 价格不敏感、品牌忠诚、重体验 | 高端产品线 |
| 功能实用型 | 41% | 重功能参数、理性比较 | 性价比产品线 |
| 潮流尝鲜型 | 27% | 重设计、易受社交影响 | 新品首发人群 |
如何写入报告
- 方法说明:变量、标准化方式、聚类算法、K 选择依据(保证可复现);
- 细分全景图:各细分规模占比 + 核心变量雷达图或对比条形图;
- 画像页:每个细分一页——人群特征、需求、行为、商业含义;
- 机会分析:细分规模 × 增长潜力 × 企业优势矩阵;
- 落地建议:每个细分的定位、产品、渠道与沟通策略;
- 报告全程用命名替代编号,让读者记住细分而非数字。
常见误区
- 不做标准化:量纲大的变量主导聚类,结果失真;
- 变量含强相关:重复信息被放大,聚类偏向冗余维度;
- K 值拍脑袋:不经过肘部法则/轮廓系数评估;
- 用人口属性直接聚类:年龄收入聚出的“细分”没有行为意义;
- 不验证就下结论:未做显著性检验与稳定性验证的细分不可靠;
- 细分太多/太少:过多无法管理,过少失去差异化价值(3–6 个为宜);
- 把聚类结果当唯一真理:聚类是探索性工具,需与业务假设相互校验。
工具推荐
想自动完成聚类细分与画像分析?使用 SurveyKit Quant,自动完成标准化、K 选择、聚类与画像报告。