本文适合谁

已完成或正在进行访谈/开放题编码,需要从编码走向”有解释力的主题”的研究人员。本文与定性编码完整指南互补:编码解决”怎样建立标签结构”,本文解决”怎样形成能回答研究问题的主题”。

核心结论摘要

  • 主题不是高频话题的集合:主题是研究者基于资料与研究问题建构的解释性模式;
  • 主题 ≠ 编码 ≠ 分类标签:编码是单元,主题是模式,分类标签是描述性归类;
  • 主题分析存在不同传统(反思式、编码本式、框架分析、扎根理论),路径不能机械混用
  • 不要把”开放编码—轴向编码—选择性编码”写成所有主题分析都必须遵循的标准流程(它主要属于扎根理论传统);
  • 主题不是客观存在、等待 AI 或研究者发现的固定答案——不同研究者可能形成不同主题,主题的成立依赖证据与解释力。

什么是主题分析

主题分析(Thematic Analysis)是一组用于**识别、分析并报告资料中模式(主题)**的方法。它回答的核心问题是:“这些资料整体上在讲什么?哪些模式对回答研究问题最重要?”

主题分析不是单一方法,而是一个方法家族,不同研究传统对”主题是什么""研究者角色是什么”有不同理解。

主题不等于高频话题

  • 高频话题:被很多人反复提到的内容(“很多人提到价格”);
  • 主题:有解释力的模式(“价格不是障碍,‘不确定值不值’才是——用户不拒绝花钱,拒绝为不确定付费”);
  • 高频是主题的候选信号之一,不是判定标准;
  • 把频率最高的编码直接当核心主题,是把定量逻辑误用进定性分析。

主题与编码的区别

维度编码主题
颗粒度小而具体大而模式化
功能切分与命名文本解释与建构意义
例子“担心数据泄露”“信任是使用意愿的门槛”
数量十几个到几十个通常 3–8 个

编码是主题的原料;主题是编码的解释性组织。

主题与分类标签的区别

  • 分类标签:描述性归类(“抱怨价格的人”)——回答”是什么”;
  • 主题:解释性模式(“价格抱怨背后是价值感知的不确定”)——回答”意味着什么”;
  • 只做分类不做解释,报告会变成”用户说了 A、B、C”,没有洞察。

语义主题与潜在主题

  • 语义主题(Semantic):基于受访者明确说出的话(“用户说客服回复慢”);
  • 潜在主题(Latent):解读话语背后的假设、意义与结构(“用户对’被敷衍’的敏感,反映了对服务确定性的期待”);
  • 选择取决于研究问题与理论立场:描述性研究多用语义层,解释性研究可进入潜在层;
  • 潜在层解读必须明确标注”这是研究者的解释”,并有证据链支撑。

归纳分析与演绎分析

维度归纳分析(自下而上)演绎分析(自上而下)
起点资料本身已有框架/理论/研究问题
主题来源从资料中生成按框架对应
适用探索性研究验证性研究、评估类
风险主题碎片化框架强加于资料

两种路径都可能有效,关键是明示立场,不能假装”纯归纳”却用预设框架筛选。

反思式主题分析

  • 代表:Braun & Clarke 的 Reflexive Thematic Analysis(RTA);
  • 核心立场:
    • 主题是研究者主动建构的,不是资料中”等被发现”的;
    • 研究者自身的经验、立场与理论资源是分析资源而非污染;
    • 编码灵活,不追求编码一致性(不同研究者编码不同可能都合理);
    • 饱和不是机械的停止规则——分析深度由研究者判断。
  • 适用:探索性、解释性研究。

编码本式主题分析

  • 特点:先建立编码本(codebook),编码有操作定义,追求编码间一致性;
  • 适用:较大样本、团队协作、需要可审计性的项目;
  • 与反思式的主要差异:对”编码是否应该一致”的立场不同;
  • 两种路径不能机械混用:用编码本的一致性标准评判反思式分析(或反之),都会误判。

熟悉资料

主题分析的起点是深度熟悉

  • 通读全部资料(不止一遍),记录第一印象;
  • 边读边写反思笔记(这个片段为什么重要?让我想到什么?);
  • 熟悉不是”看一遍”——分析的深度与熟悉程度成正比。

初步编码

  • 对资料逐段标注(编码方法详见定性编码完整指南);
  • 此阶段编码可以多、可以杂(候选素材);
  • 记录编码对应的原文位置(证据追溯的基础)。

候选主题形成

  • 把编码按”看起来在讲同一件事”聚类;
  • 问自己:这些编码放在一起,在讲什么模式
  • 候选主题通常多于最终主题(先广后收);
  • 允许”孤儿编码”暂不归属(最后决定去留)。

主题审查

对每个候选主题审查:

  1. 内部一致性:主题内的编码是否真的在讲同一件事?
  2. 外部区分度:与相邻主题的边界是否清晰?
  3. 解释力:这个主题是否加深了对研究问题的理解?
  4. 证据充分性:是否有足够、相关、有解释力的证据?
  5. 反例处理:有没有与主题矛盾的资料?如何解释?

审查结果:合并、拆分、删除或保留候选主题。

主题边界确定

  • 为每个主题写操作性定义(这个主题包含什么、不包含什么);
  • 边界模糊时回到原始文本逐条核对;
  • 边界清晰的主题才能与其他主题区分、才能被独立解读;
  • 反例帮助确定边界:与主题矛盾的案例是边界的试金石。

主题命名

好名字的标准:

  • 一句话能说清主题核心(“信任是使用意愿的门槛”);
  • 有解释力而非描述性(❌“关于信任的内容”✅“信任是使用意愿的门槛”);
  • 贴近资料语言或研究者提炼语(可混合);
  • 名称修改前后示例见下表。

主题名称修改前后示例

修改前(描述性)修改后(解释性)
用户提到信任问题信任是使用意愿的门槛:顾虑不解决,功能再强也不被采用
关于价格的讨论价值不确定比价格本身更阻碍购买
客服反馈被敷衍的感受:用户要的不是快,而是被认真对待
使用习惯碎片时间驱动的使用:场景塑造行为
竞品对比内容竞品是”参照系”:用户用比较来管理选择风险
对新功能的期待期望管理落差:被过度承诺伤过的用户更谨慎

主题关系构建

  • 主题不是孤立清单,可以构建关系:
    • 层级关系:主主题 → 子主题(如”信任门槛”下含”隐私顾虑""被敷衍感”);
    • 流程关系:主题沿时间/因果展开(如”期待 → 落差 → 流失”);
    • 对比关系:两组主题互为对照(“功能派 vs 情感派”);
  • 输出形式:主题地图(见下)。

回到原始文本验证

  • 每个主题回到原文核对:证据是否真实、引用是否在上下文语境中;
  • 防止”断章取义”:引语需确认在原文语境中的含义;
  • 验证后修正主题表述(发现证据撑不住时调整或放弃)。

处理反例和异常案例

  • 反例不是要删除的噪音,而是边界与条件的证据
  • 处理方式:
    • 检查反例是否指向主题的适用边界(“大多数情况如此,但重度用户例外”);
    • 反例可能指向新主题(被主流掩盖的少数但重要声音);
    • 在报告中明确呈现反例与处理逻辑;
  • 隐藏反例是定性报告最常见的质量问题之一。

研究者反思记录

  • 反思式主题分析要求研究者记录自己的立场与假设:
    • 我为什么觉得这个模式重要?
    • 我的经验/立场可能如何影响解读?
    • 有没有我更想看到的结论(确认偏误自查)?
  • 反思记录是透明度的一部分,重要项目可在附录呈现。

主题地图

主题地图(Thematic Map)是主题结构的可视化:

                研究问题:用户为什么流失

        ┌───────────────┼───────────────┐
    信任门槛          期望落差          替代拉力
   (核心主题)      (过程主题)      (情境主题)
  ┌────┴────┐      ┌────┴────┐      ┌────┴────┐
隐私顾虑 被敷衍感  过度承诺 功能缺口  竞品参照 替代方案
  • 用途:检查主题结构的逻辑、向团队/客户沟通分析框架;
  • 地图随分析演进更新(初稿 → 定稿)。

好主题与坏主题对照

好主题坏主题
有解释力(回答”为什么”)描述性(“用户提到 X”)
边界清晰与其他主题重叠
证据充分且可追溯靠一两条引语支撑
与研究问题相关与问题脱节
能产生行动含义无业务含义
反例已处理反例被隐藏

从主题到报告结论

  • 主题是报告的骨架:每个主题一章,配证据与解释;
  • 主题 → 洞察 → 建议的转化(不把三者混为一谈):
    • 用户原话(证据)→ 研究发现(模式)→ 研究解释(为什么)→ 核心洞察(所以呢)→ 商业建议(做什么);
  • 主题呈现的规范见定性研究报告完整指南

主题分析质量检查清单

  • 主题是解释性模式,不是高频话题清单
  • 主题与编码、分类标签明确区分
  • 分析路径(归纳/演绎、反思式/编码本式)已声明且未混用
  • 资料已深度熟悉(≥2 遍通读)
  • 候选主题经审查(内部一致/外部区分/解释力/证据)
  • 每个主题有操作性定义与清晰边界
  • 主题命名有解释力(非描述性)
  • 主题关系已构建(地图)
  • 已回到原文验证证据
  • 反例已检索并说明处理
  • 研究者反思记录已留存
  • 报告区分了原话/发现/解释/洞察/建议

常见错误

  1. 把高频话题当主题:频率≠重要性;
  2. 把编码清单当主题清单:只有切分没有解释;
  3. 机械套用”开放编码—轴向编码—选择性编码”:那是扎根理论传统的流程,不是所有主题分析的标准;
  4. 规定每主题最少人数:主题成立靠证据与解释力,不是人数(提及人数仅作辅助信息);
  5. 把主题当”客观存在等着被发现”:主题是研究者建构的——不同立场的研究者可能形成不同主题;
  6. 隐藏反例:反例是边界证据,删掉反例等于删掉真实性;
  7. AI 生成主题直接用:AI 聚类不是主题,主题判断必须人工(见AI辅助定性研究);
  8. 不同传统混用:用编码本的一致性标准评判反思式分析。

使用边界与注意事项

  • 本文以 Braun & Clarke 的主题分析框架为参照,同时说明不同传统差异;其他传统(框架分析、扎根理论、解释现象学)各有适用场景,不存在唯一正确的主题分析方法
  • 涉及方法论立场的选择建议咨询资深定性研究者(建议人工复核);
  • 编码基础见定性编码完整指南;资料整理与 AI 辅助见AI辅助定性研究

参考资料

  • Braun, V., & Clarke, V. (2006). Using thematic analysis in psychology. Qualitative Research in Psychology(反思式主题分析原始文献,建议人工复核后再引用
  • Braun, V., & Clarke, V. (2022). Thematic Analysis: A Practical Guide(主题分析专著,建议人工复核后再引用
  • 框架分析参考 Ritchie, J., & Lewis, J. (eds.). Qualitative Research Practice建议人工复核后再引用
工具推荐 使用 QA SurveyKit 辅助整理编码与候选主题,最终主题边界和业务解释仍需研究人员复核。