无监督学习算法:降维与聚类的深入解析
1. 高维数据可视化算法
1.1 t - SNE算法
t - 分布随机邻域嵌入(t - SNE)是2010年由Laurens van der Maaten和Geoff Hinton开发的获奖算法,用于检测高维数据中的模式。它采用概率非线性方法,将数据定位在多个不同但相关的低维流形上。
- 算法步骤 :
1. 将高维距离转换为(条件)概率,高概率意味着低距离,反映了基于相似性采样两个点的可能性。通过在每个点上放置正态分布并计算点及其每个邻居的密度来实现,其中困惑度参数控制有效邻居的数量。
2. 在低维空间中排列点,并使用类似计算的低维概率来匹配高维分布。使用Kullback - Leibler散度来衡量分布之间的差异,对在低维中错误放置相似点给予高惩罚。低维概率使用自由度为1的学生t分布,以减少在高维中放置较远点的惩罚,解决拥挤问题。
- 优缺点 :
- 优点 :目前是高维数据可视化的先进技术,能够区分图像类别。
- 缺点 :计算复杂度与点数n的平方成正比,后续基于树的实现将成本降低到n log n;不便于将新数据点投影到低维空间;压缩输出对于基于距离或密度的聚类算法不是非常有用,因为t - SNE对小距离和大距离的处理方式不同。
1.2 UMAP算法
均匀流形逼近和投影(UMAP)是一种较新的可视化和通用降维算法。它假设数据在局部连接的流形上均匀分布,并使用模糊拓扑寻找最接近的低维等价物。它使用的邻居参数对
超级会员免费看
订阅专栏 解锁全文

101

被折叠的 条评论
为什么被折叠?



