【台大李宏毅ML课程】Lecture 13 Unsupervised Learning——Linear Dimension Reduction笔记

李宏ML2022 Spring HW3解析 因为作业不能采用预训练的模型,我尝试了ResNet18,发现要训练的次数比一般自己拼凑的CNN要多得多,计算资源都不太够了,最后用cross validation只训练了3个模型,都跑了600 epochs。我加的都是Random的变换,因为每次获取训练数据的时候,都是把所有的变换操作都执行一遍的,如果不是随机变换,那原图就永远不会参与训练,只有转换以后的图片才会参与训练,那训练效果可能就不好了。TTA是在test阶段的数据增强,即在预测的时候将原图变换出来的多张图片分别进行分类,再综合分类结果的方法。 阅读详情

本节课主要讲了两种线性降维的方法——cluster和PCA,并从两个角度解释了PCA。最后讲了一些关于矩阵分解的知识。

1.cluster

cluster就简单的带过了,主要是k-means和HAC

k-means原理:
(1)先初始化k个中心点ci (i=1,….,k)
(2)如果样本x离ci更近,就划分到第i类
(3)更新每个类别的中心点
(4)重复(2)(3)

如何选择K是个问题~

HAC(Hierarchical Agglomerative Clustering )原理
类似于建立一棵树,每个节点都设置一个阈值

2.PCA(Principle Component Analysis)

PCA降维原理可以从两个来考虑
一是基于最大方差原理,样本点在这个超平面上的投影尽可能分开。
二是基于最小化误差原理,样本点到这个超平面距离都足够近。

2.1基于最大方差原理

(1)需要找到一个投影矩阵W,使得x在W上的投影方差尽可能的大,其中W是由很多个向量组成(w1,w2,w3,…),希望x在w1上投影的方差最大,w2上投影的方差其次……以此类推
这里写图片描述

(2)并且,W是一个单位正交矩阵,即(w1,w2,w3,…)相互正交,且都是单位向量

Lecture 8(Extra Material):Dimension Reduction Dimension Reduction(来源):降维或降维是将数据从高维空间转换到低维空间,以便低维表示保留原始数据的一些有意义的属性,理想情况下接近其intrinsic dimension。由于许多原因,在高维空间中工作是不可取的。由于维数灾难,原始数据通常是稀疏的,并且分析数据通常在计算上是难以处理的(难以控制或处理)。方法通常分为线性方法和非线性方法,也可以分为特征选择和特征提取。降维可以用于降噪、数据可视化、聚类分析,或作为促进其他分析的中间步骤。 阅读详情

相关推荐

ISLR读书笔记十二:模型选择——降维法(dimension reduction methods)

模型选择——降维法前言PCRPLS 前言 前面介绍的两类模型选择的方法,都保留了原始的自变量,而降维法则对原始自变量进行了转化,其大致思想是将原来的 ppp 个自变量,整合成 MMM 个自变量(M<pM<pM<p)。 若令 Z1,Z2,⋯,ZMZ_1,Z_2,\cdots,Z_MZ1​,Z2​,⋯,ZM​ 表示 ppp 个 原始自变量的 MMM 个线性组合,即 Zm=∑j=1pϕjmXjZ_m=\sum_{j=1}^p\phi_{jm}X_jZm​=j=1∑p​ϕjm​Xj​ 然后对这

weixin_43084570的博客 902

数据降维(data dimension reduction)

在机器学习和统计学领域,降维是指在某些限定条件下,降低随机变量个数,得到一组“不相关”主变量的过程。对数据进行降维一方面可以节省计算机的储存空间,另一方面可以剔除数据中的噪声并提高机器学习算法的性能。(实际上通过降维还可以实现数据可视化,但是前提是将原始数据降到2D或者3D才可以)。 数据降维的根本:降低数据维度、降维后的数据能尽可能的代表原始数据。 数据降维和特征选择是存在差异的,二者最终的...

Tonywu2018的博客 1万+

李宏2020机器学习课程笔记(一)- 分类与回归

包含李宏机器学习视频P1-P16的课程梗概

1万+

8.2-无监督学习-线性降维

我把dimension reduction分为两种,一种做的事情叫做“化繁为简”,它可以分为两种:一种是cluster,一种是dimension reduction。所谓的“化繁为简”的意思:现在有很多种不同的input,比如说:你现在找一个function,它可以input看起来像树的东西,output都是抽象的树,把本来比较复杂的input变成比较简单的output。那在做unsupervised learning的时候,你只会有function的其中一边。比如说:我们要找一个function要把所有的

weixin_46227276的博客 512

2021李宏机器学习课程-YouTube第三部分、Network网络架构

2021李宏机器学习课程-YouTube第三部分、Network网络架构

weixin_52836217的博客 342

【机器学习】李宏——Explainable ML(可解释性的机器学习)

本文介绍了Explainable ML(可解释性的机器学习)的相关内容,抱愧这项技术的相关概述、当前发展等等。

FavoriteStar的博客 1614

2021李宏机器学习课程-YouTube第十一部分、终身学习Life long learning

2021李宏机器学习课程-YouTube第十一部分、终身学习Life long learning

weixin_52836217的博客 585

Dimension reduction:ICA

Independent Components Analysis (ICA) PCA的基本思想是在特征空间中寻找一些方向,使得在新的方向上表示数据的误差平方和最小。 ICA的基本思想是在特征空间中寻找最能使得数据相互独立的方向,所以普遍用于盲信号分离。 所以降维的结果每一维属性之间都相互独立。   ICA算法的步骤 a. 假设训练样本X(t) b. 降维后的样本为S(t)...

浪不虚传 448

降维(Dimensionality Reduction)

降维(Dimensionality Reduction)理论的学习

Need not to know 1740

李宏深度学习-机器学习任务攻略

训练的三个基本步骤,如上图所示。我们一般直接跑sample code,往往只能得到baseline的结果,那如何获得更好的结果呢,本节会简略的回答这个问题。攻略:如果说你觉得你对自己的训练结果不满意的话,第一步应该先检查你的training data 的loss,如果你的模型在training data上的loss比较大,那么你需要思考这是model bias还是optimization的问题。

m0_62200355的博客 590

机器学习(李宏)——Meta Learning

机器学习(李宏)——Meta Learning

Dlog的博客 1428

ML起跑线 001李宏老师机器学习(2022)HW1 示例代码学习笔记

same_seed() 函数为神经网络的训练提供一致的随机种子,确保训练结果的可复现性。它的输入 seed 是一个整数,我们可以在1.7.中的config里设置它。train_valid_split() 函数可以根据我们给定的验证集比例(valid_ratio)将原始的训练集随机划分为训练集和验证集,以供训练过程使用。它需要 3 个输入参数:未分割的训练集(data_set),验证集比例(valid_ratio)和随机种子数(seed)。

Lyndon_Ge的博客 2877

机器学习(李宏)——Explainable AI

机器学习(李宏)——Explainable AI

Dlog的博客 1250

Meta Learning李宏老师系列)

Meta v.s. Domain adaptation:Meta中不同的task看做是不同的Domain,那么可以将Meta看做是Domain adaptation的一种方法。将该“学习算法”在所有的“学习任务”上的损失求和,得到total loss。“学习算法”也可以看做一个函数F,它的输入是训练数据,输出是model。最终我们真正关心的是,在“测试任务”上,学习算法。用在在测试任务的测试数据上,可以得到想要的结果。,利用某个任务的训练数据进行训练,得到模型。根据学习内容不同,将元学习的具体方法进行。

Moliay的博客 1324

李宏ML 学习笔记1

李宏2021/2022 ML课程学习

kiyomioo的博客 501

李宏2022ML第六周课程笔记

李宏2022ML第六周课程笔记 GAN(生成对抗网络)

snajdansa的博客 304

机器学习Machine Learning:特征选择Feature Selection 与 数据降维Dimension Reduction的区别?

为什么会有降维和特征选择??? 我们知道机器学习的终极目标就是为了预测,当然预测前我们要对数据进行训练。通常我们不会拿原始数据来训练,为什么呢?可能有些人觉得原始信息(original data)包含了样本最丰富的信息,没有经过任何处理的raw data能最完整表达样本,这个观点没有错。但是用raw data来直接训练的话,有一个问题就是我们设计的分类器在训练集上会得到很好的performanc...

Damion 1463

第二十一节 Dimension Reduction

Reast1nPeace的博客 377
上一篇: 【台大李宏毅ML课程】Lecture 14 Word Embedding笔记
code_caq
博客等级 码龄10年 112粉丝 58原创
评论 2
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值