聚类:理论与实践方面
1. OPTICS 算法
1.1 相关定义
在聚类分析中,OPTICS 算法有一些重要的定义。对于对象 $o_i$,若 $reachm(o_i) \leq reachm(o_{i + 1})(1 - \xi)$,则称 $o_i$ 为 $\xi$-陡峭上升对象;若 $reachm(o_i)(1 - \xi) \leq reachm(o_{i + 1})$,则称 $o_i$ 为 $\xi$-陡峭下降点。
在对象列表 $L$ 中的区间 $I = [o_s, o_e]$,若满足以下条件,则称其为 $\xi$-陡峭上升区域:
1. $o_s$ 是 $\xi$-陡峭上升对象;
2. $o_e$ 是 $\xi$-陡峭上升对象;
3. 位于 $o_s$ 和 $o_e$ 之间的每个对象的可达距离不减小;
4. $I$ 中连续非 $\xi$-陡峭上升的对象不超过 $m$ 个;
5. $I$ 是满足上述属性的最大区间。
类似地,可以定义 $\xi$-陡峭下降区域。
1.2 算法复杂度
OPTICS 算法运行起来比 DBSCAN 算法更昂贵,这是因为它使用了优先堆,并且最近邻查询比 DBSCAN 的半径查询更复杂。
2. R 语言中的密度聚类
2.1 生成二维人工数据集
可以使用以下代码生成一个由四个高斯聚类组成的二维人工数据集,每个聚类包含 100 个点:
set.seed(665544)
n <- 400
z <
超级会员免费看
订阅专栏 解锁全文

1万+

被折叠的 条评论
为什么被折叠?



