聚类分析综述
来源:互联网
时间:2026-08-04 14:23:09
在数据分析的各种方法中,聚类分析是一个基础但高频的工具。简单说,它要做的事情就是把数据点按照某种规则分成几个组,让组内的数据尽可能相似,组间的差异尽可能大。这个逻辑听起来很直白,但要把它落到实处理,涉及的细节可不少。

聚类是什么?
直观理解
把观测对象按照某种标准划分成若干类别,核心原则就一条:组内的相似性最大,组间的差异性最大。
(图片由AI生成)
统计理解
把“相近”和“相异”的程度数量化。主要可以从两个视角切入:一是
相似度视角
距离视角
探索性
商业理解
放在市场研究的场景里,聚类分析最典型的用途是
划分不同的消费群体,研究消费者行为
但请注意:聚类不是分类
分类是已经有了现成的划分标准,直接按标准分组即可。聚类则不一样,事先并不知道划分标准,需要靠算法去判断数据之间的相似性。哪个模型最贴合研究实际,最终需要由研究者自己来判断,这也正是它的探索性所在。
聚类分析的操作步骤
实际操作中,一般按以下流程推进:
① 数据预处理
② 数据标准化
③ 检测异常值
④ 选择合适的聚类算法
聚类算法有哪些?
按照聚类对象划分
① R型聚类
含义
变量
实现变量降维
相似系数
(图片由AI生成)
② Q型聚类
含义
样本(数据点)
距离
(图片由AI生成)
按照一般性方法划分
① 层次聚类
也叫系统聚类,它的特点是不需要事先指定要分成几类,而是根据距离或相似系数,一步步把最接近的两类合并,直到所有数据都聚到一个大类里。这是一个典型的非监督学习过程。优点是结果直观,层次关系清晰,但计算量较大,比较适合
小规模数据
② 划分聚类
也叫动态聚类或快速聚类,需要
预先指定最终的类别数K
K-means
大规模数据
③ 密度聚类
这类算法从
数据分布的密度和紧密程度
DBSCAN
(图片由AI生成)
④ 网格聚类
先将数据空间
划分为一系列网格单元
(图片来源于网络)
⑤ 模型聚类
这是一种更高级的方法,它使用
基于统计模型或机器学习模型的框架
在实际的市场调研中,
和K-means
依然是最基础、应用最广泛的两种方法。前者适合簇数量已知、结构清晰的数据,后者则适合对簇数量不明确、需要探索层次关系的场景。而层次聚类
和DBSCAN
则提供了更灵活的解决方案,比如自动识别簇数、处理非球形簇或混合数据类型,甚至应对干扰数据。两步聚类
(图片来源于网络)
一个优秀聚类算法应该具备的特征
在评估和选择算法时,可以从以下几个维度来考量:
① 良好的可伸缩性
② 处理不同类型数据的能力
③ 处理噪声数据的能力
④ 增量聚类和对输入次序的不敏感性
⑤ 高维性
⑥ 易解释性和易用性
聚类分析 vs 主成分分析 vs 因子分析
作为附录,这里把三种常用方法做一个清晰的对比:
目的不同
- 聚类分析:专注于将样本,揭示数据中的自然聚类结构。
分组
- 主成分分析:通过线性变换,保留数据的主要变异信息。
减少数据维度
- 因子分析:旨在通过解释变量间的共变关系,提供更深层次的数据结构解读。
识别潜在因子
数据类型不同
- 聚类分析:适用于各种类型数据(连续型、离散型、有序型等)。
- 主成分分析 & 因子分析:主要适用于。
连续型数据
变量角色不同
- 聚类分析:不需要指定因变量或自变量,完全由数据驱动。
- 主成分分析 & 因子分析:需要指定。
自变量
数据处理
三种方法通常都需要对数据进行标准化或归一化处理。
举例说明
- :做市场细分时,发现消费者之间的相似性和差异。
聚类分析
- :收集消费者行为和偏好数据,将这些数据合并为少数几个主成分,以便从整体层面把握关键影响因素。
主成分分析
- :试图找出消费者行为和偏好背后的潜在因素和结构,比如“品牌忠诚度”、“价格敏感度”这样的隐藏变量。
因子分析
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名