主成分分析(PCA)和局部线性嵌入(LEE)原理详解

李宏毅机器学习2016 第十三讲 无监督学习之非线性降维:流型学习(Mainfold Learning) 视频链接:李宏毅机器学习(2016)_演讲•公开课_科技_bilibili_哔哩哔哩课程资源:Hung-yi Lee课程相关PPT已经打包命名好了:链接:https://pan.baidu.com/s/1c3Jyh6S 密码:77u5我的第十二讲笔记:李宏毅机器学习2016 第十二讲 无监督学习:线性维数约减Unsupervised Learning:Neighbor Embedding1.流型学 阅读详情

k近邻

k邻近学习是一种常用的监督学习。其工作机制:给定测试样本,基于某种度量找出与测试样本最靠近的K个训练样本,在分类任务中是基于K个“邻居”样本的类别投票法来确定测试样本的类别,在回归任务中是基于K个“邻居”样本输出标记的平均值作为预测结果。

k邻近学习缺陷与优点

  • k邻近称为“懒惰学习”:训练阶段仅仅保存训练样本,训练时间开销为0,待收到测试样本后才进行学习
  • 不同距离计算导致不同的结果”
  • 假设样本独立同分布 ,对任意x和任意小整数a,在x的附近a距离总能找到一个训练样本z。则c=argmaxxϵYP(c|x)表示贝叶斯最优分类器。经过推导可以得到K近邻泛化错误不超过贝叶斯最优分类器的2倍。想要维持K邻近低范化错误,则训练样本密度必须足够大。对于高维而言,若每一个属性维度的训练样本的密度都很大,这会导致训练样本数量急剧增加,就出现了’维数灾难‘。
    这里写图片描述

主成分分析PCA

PCA是一种对原始高维空间进行线性变换从而获得低维空间,并期望在所投影的维度上数据的方差最大,以此使用较少的数据维度,同时保留住较多的原数据点的特性。
需要注意PCA属于特征抽取不属于特征选择。给定d维空间中的样本X=(x1,x2,...xm)Rd×m变换之后得到d’<=d维

Z=WTX

W=(w1,w2,...wm)Rd×d 是变换矩阵,Z是新空间中的向量

帮助理解这里有小插曲
这里写图片描述

  • A⋅B=|A||B|cos(a) A与B的内积等于A到B的投影长度乘以B的模。
  • 设向量B的模为1,A⋅B=|A|cos(a),则A与B的内积值等于A向B所在直线投影的矢量长度
    这里写图片描述

  • 要准确描述向量,首先要确定一组基,然后给出在基所在的各个直线上的投影值

  • 在直角坐标系中的向量(x,y)实际上表示线性组合:x(1,0)T+y(0,1)T
  • 两个矩阵相乘的意义是将右边矩阵中的每一列列向量变换到左边矩阵中每一行行向量所表示的空间中去

根据以上的预备知识可以理解原属性xi是在新坐标(一组基)(w1,w2,...wm的作用下得到zixi代表右边矩阵的每一列向量)。若wiwj(i,j不相等)则新坐标系是一个正交坐标系,W为正交变换,则低维新空间中的属性是高维原始空间属性的线性组合

现在进入正题,对于正交属性的空间中的样本点,如何用一个超平面(直线的高维推广)对所有样本进行恰当的表达?

  • 最近重构性:样本点到这个平面的距离都足够近
  • 最大可分性:样本点在这个超平面的投影都尽可能分开

最近重构性和最大可分性可以得到两种主成分的等价推导,以下推导是从最近重构性角度来出发。

  • 假定样本进行了中心化即xi=0
主成分分析PCA原理详解 “微信公众号”本文同步更新在我的微信公众号里,地址:https://mp.weixin.qq.com/s/Xt1vLQfB20rTmtLjiLsmww本文同步更新在我的知乎专栏里面:主成分分析PCA原理详解 - Microstrong的文章 - 知乎https://zhuanlan.zhihu.com/p/377770741.相关背景在许多领域的研究与应用中,通常需要对含有多个变量的数据进行观... 阅读详情

相关推荐

局部线性嵌入(LLE)的代码示例以及详细数学解释

重建误差是原始点基于其邻居的线性组合之间的差异。

h52013141的博客 2938

图像聚类的局部线性表示

相似度图的构造在频谱聚类(SC)算法中起着至关重要的作用。 存在两种构造相似度图的流行方案,即基于逐对距离的方案(PDS)基于线性表示的方案(LRS)。 值得注意的是,以上方案分别遭受一些限制缺点。 具体而言,PDS对噪声离群点敏感,而LRS可能会错误地选择子空间间的点来表示目标点。 这些缺点极大地降低了SC算法的性能。 为了克服这些问题,提出了一种构造相似度图的新方案,其中不同数据点之间的相似度计算取决于它们的成对距离线性表示关系。 此提议的方案称为局部线性表示(LLR),它使用一组数据点对每个数据点进行编码,这些数据点不仅产生最小的重构误差,而且接近目标点,从而使其对噪声异常值均具有鲁棒性,并且避免了选择子空间间的点在很大程度上代表了目标点。

41、主成分分析的多种变体及应用

本文系统介绍了主成分分析PCA)的多种变体及其在不同场景下的应用。内容涵盖局部PCA、增量PCA监督PCA等改进方法,探讨了复值PCA在复数域信号处理中的扩展,以及二维PCA在图像特征提取中的优势。同时,文章还深入讲解了广义特征值分解与奇异值分解(SVD)的理论基础及相关算法,包括Tucker分解互相关不对称PCA网络,展示了这些技术在数据降维、模式识别信号处理等领域的重要作用。根据具体需求选择合适的方法,可显著提升数据分析效果。

berry的博客 55

主成分分析(Principal Component Analysis,PCA

通过这种方式,PCA可以帮助我们减少数据的维度,去除冗余信息,提取关键特征,从而更好地理解分析数据。主成分分析(Principal Component Analysis,PCA)是一种在数据分析中常用的降维技术,通过线性变换将高维数据映射到低维空间,从而保留尽可能多的信息。主成分分析(Principal Component Analysis,PCA)作为一种常用的数据降维技术,具有广泛的应用领域,不仅在数据分析中发挥着重要作用,还在图像处理、特征提取、噪声过滤等方面得到了广泛应用。

深度学习客 1387

LLE算法解密:探索局部线性嵌入的神奇力量

1.背景介绍 局部线性嵌入(Local Linear Embedding,LLE)算法是一种用于降维的计算机视觉技术,它能够将高维数据映射到低维空间,同时尽量保留数据之间的拓扑关系。LLE算法是一种基于局部线性的方法,它假设数据在局部区域内是线性可分的。这种假设使得LLE算法能够在保持数据拓扑结构不变的同时,有效地降低数据的维数。 LLE算法的主要应用领域包括数据可视化、数据压缩、模式识别机...

AI天才研究院 1223

机器学习中常用的降维方法-主成分分析法(PCA

机器学习的主成分分析

qq_37977007的博客 3648

主成分分析PCA详解

主成分分析PCA原理与应用

weixin_60737527的博客 9万+

机器学习非线性降维:局部线性嵌入 LLE

文章摘要 LLE(局部线性嵌入)是一种专门处理非线性流形数据的降维方法,核心思想是通过保持局部线性关系来展开弯曲的高维数据(如瑞士卷)。其算法分为三步:1)找K近邻;2)计算局部重建权重;3)保持权重不变进行低维嵌入。LLE能完美展开复杂流形,但计算量大且对参数敏感。相比PCA等线性方法,LLE擅长处理非线性结构;相比t-SNE等算法,它更注重局部几何保持。适用于中小规模流形数据(如瑞士卷、螺旋结构),但不适合大规模数据或需要保持全局距离的场景。关键技巧包括调整K值、数据标准化使用正则化改进版本。

DeepModel的博客 595

数据降维之局部线性嵌入(LLE)

LLE(局部线性嵌入)数据降维 原理解释 当数据具备某些非线性结构,如流形结构时,我们希望降维后的数据仍然保持这些结构。那么就提出了LLE降维算法。 LLE (Locally linear embedding):在数据降维后仍然保留原始高维数据的拓扑结构,这种拓扑结构表现为数据点的局部邻接关系。 此算法我们首先要寻求每个数据点的k个最近邻,然后将当前数据点用k个最近邻线性表出,那么就有相对...

LSEC小陆的博客 4526

13、非线性降维与数据游览方法详解

本文详细介绍了非线性降维与数据游览方法,涵盖多维尺度分析(MDS)、流形学习(如LLE、ISOMAP、HLLE)、人工神经网络方法(如SOM、GTM)以及深度学习t-SNE等技术。同时系统阐述了数据游览的三大类方法:大游览、插值游览引导游览,重点解析了环面缠绕方法伪大游览的实现原理与代码示例。结合MATLAB实践案例,展示了各类方法在高维数据可视化与结构发现中的应用,并提供了优化策略与综合应用流程,帮助读者全面掌握高维数据探索的核心技术。

nokia的博客 52

多维缩放、主成分分析法、等度量映射、局部线性嵌入等降维方式实现搭建特征工程(内附Python实例)_缩放子轮廓模型 主成分分析(1)

主成分分析(Principal Component Analysis,PCA), 是一种统计方法,通过正交变换将一组可能存在相关性的变量转换为一组线性不相关的变量,转换后的这组变量叫主成分(来源于百度百科舍弃此部分信息后能使样本的采样密度增大,正如上面所说:高维数据到低维数据转换后数据间的密度会大大提高;当数据受到噪声影响时,最小的特征值所对应的特征向量往往与噪声有关,将它们舍弃可以在一定程度上起到去噪的效果;算法描述。

2401_84166278的博客 1031

周志华《机器学习》同步学习笔记 ——第十章降维与度量学习

周志华《机器学习》同步学习笔记 ——第十章降维与度量学习10.1 k近邻学习10.2 低纬嵌入10.3 主成分分析10.4 核化线性降维10.5 流形学习10.6 度量学习 10.1 k近邻学习 k近邻学习即kNN(k-Nearest Neighbor)是一种常用的监督学习方法:给定某个测试样本,基于某种距离度量在训练集中找出与其距离最近的k个带有真实标记的训练样本,然后给基于这k个邻居的真实标记...

克小洛的秘密基地 1640

局部线性嵌入(LLE)原理总结

局部线性嵌入(LLE)原理总结 - 刘建平Pinard - 博客园 网络表示学习概述 - 知乎 网络表征学习笔记 - 简书

qq_41786778的博客 197

主成分分析PCA)一次讲个够

PCA 简介多元统计分析中普遍存在的困难中,有一个困难是多元数据的可视化。matlab 中的 plot 可以显示两个变量之间的关系,plot3 surf 可以显示三维的不同。但是当有多于3个变量时,要可视化变量之间的关系就很困难了。幸运的是,在一组多变量的数据中,很多变量常常是一起变动的。一个原因是很多变量是同一个驱动影响的的结果。在很多系统中,只有少数几个这样的驱动,但是多余的仪器使我们测量了很

黄飞的博客专栏 5万+

通俗易懂的主成分分析法(PCA详解

转载自:http://blog.codinglabs.org/articles/pca-tutorial.html文章分析脉络梳理: 1.向量AB的内积表示的是向量A在B上的投影长度。那么将一个向量与新的基做内积,结果则表示该向量在新的基下的坐标。2.将新选定的基表示成矩阵形式,与原向量相乘,就得到了原向量在新选定的基所表示的空间(或坐标系)中的坐标表示了。3.怎样选定这组基用于数据降维?(目标...

Murray_的博客 15万+

论文浅尝 | 基于正交普鲁克分析的高效知识图嵌入学习

笔记整理:朱渝珊,浙江大学在读博士,研究方向为快速知识图谱的表示学习,多模态知识图谱。1.Motivation知识图谱是许多NLP任务下游应用的核心,如问答、对话代理、搜索引擎推荐系统...

开放知识图谱 2401

matlab调用LEE降维函数,如何用MATLAB中的PCA函数进行数据降维

coeff = pca(X)返回n×p数据矩阵的主成分系数。X的行对应于观察值,就是样本,列对应于变量,也就是特征。系数矩阵是p×p。coeff的每一列包含一个主成分的系数,这些列按成分方差的降序排列。默认情况下,pca以数据为中心,使用奇异值分解(SVD)算法。一般用下面这个函数来进行获取投影矩阵Pro_Matrix。获得投影矩阵后,通过下面这条语句得到降维后的数据。Y=Pro_Matrix'*...

weixin_35335035的博客 370

局部线性嵌入(LLE)

1、介绍本文参考:http://www.cnblogs.com/pinard/p/6266408.html(1)概述LLE属于流形学习(Manifold Learning)的一种,通常流形理解起来比较抽象,在LLE里,我们可以简单的将流形看做一个不闭合的曲面,类似于下图: 而我们的目的就是将其展开到低维,在上图也就是展开到二维,同时数据的结构特征要能够得到最大程度的保持,这个过程就像两个人将流行曲

qrlhl的博客 1万+
下一篇: 支持向量机理论详解
superzzx0920
博客等级 码龄9年 8粉丝 10原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值