机器学习稀疏之L1正则化

机器学习正则化项L1和L2的直观理解 正则化(Regularization) 机器学习中几乎都可以看到损失函数后面会添加一个额外项,常用的额外项一般有两种,一般英文称作ℓ11\ell_1-norm和ℓ2ℓ2\ell_2-norm,中文称作L1正则化和L2正则化,或者L1范数和L2范数。 L1正则化和L2正则化可以看做是损失函数的惩罚项。所谓『惩罚』是指对损失函数中的某些参数做一些限制。对于线性回归模型,使用L1正则化的模型建叫做... 阅读详情

一、L1正则化

在L0 正则化中,通常我们有很多特征时, 这样在计算后验形式p(r|D) 有很大的复杂度。即使利用贪心算法,很容易陷入局部拟合情况。

其中一部分原因是因为 rj 特征是离散形式的, 这样造成目标函数的不光滑, 。 在优化领域中,通常的做法是对于离散的约束,我们通过松弛的方法来将其变为连续的约束。 我们可以在spike-and-slab 尖峰与平波模型中,通过在wj =0, 的 阶跃函数 取值处来用一定大小的概率值进行代替,这样通过在wj =0 用一定值代替,来构造成为连续函数的形式,这样来接近原始模型, 比如可以用零均值的laplace 模型代替。 这里我们应用了laplace 具有的长尾,(并且这里对于异常值的鲁棒对长尾的模型是很好的,正太情况将会有很大的异常变化。)


从图中可以看出, u = 0,也存在尖峰的,这样就可以用连续的形式进行代替,从而更好的优化目标函数。


更加精确的我们利用的Laplace 模型作为先验

             

我们用均匀先验的形式在截距项 , , 因而在MAP 估计,其带罚的负log 似然形式为:

             

其中   为 w 的L1模, 利用合适的 , 可得到稀疏的  , 这里 我们认为 LI 正则是L0 非凸函数的 凸近似, 因为 L0 的模值 是0 ,wi, wj , ... 0 ... 每个是离散的, 而L1 模 是 |wj| 的加和, 因而是连续的一个值的过程,因而是凸近似。

所以在 线性回归中 L1 目标函数:

             

通常 用 0均值Laplace 先验参数, 这样的MAP估计就是L1正则,存在着 凸的和非凸的NLL项, 有很多算法设计解决这个问题(这个以后讨论)


二、 为什么 L1 正则产生的是稀疏解

我们现在来说说 L1 产生的是稀疏解, 而L2 不是。我们主要以线性回归为例说明,这个在 逻辑回归和 其他GLMs 中是相似的。 


虽然L1 是连续的,但是 还是不光滑的函数, 所以不光滑的目标函数为:

            

我们将其进行改写, 将后面的作为约束,但是变为光滑的目标函数: (二次函数 约束是线性的)

            

L1正则化(L1 Regularization)和L2正则化(L2 Regularization)的详细解释以及区别,同时详细解释了正则化在损失函数中的功能,解释了正则化为什么可以防止过拟合,提高泛化 正则化是一种重要的技术手段,可以帮助我们提高模型的泛化能力,减少过拟合现象。L1正则化和L2正则化是两种常用的正则化方法,它们各有特点,适用于不同类型的问题。 阅读详情

相关推荐

【深度学习】正则化方法——L1和L2正则化

凡是能解决模型泛化误差而不是训练误差的方法,都被称为正则化。模型的泛化误差主要是由模型过拟合引起的,所以正则化的各种方法用于解决模型过拟合的问题。

第三季度的博客 6328

一文了解L1正则化与L2正则化

其中,L(w)是加了L2正则化的损失函数,Loss(y, y_pred)是模型的原始损失函数(例如,均方误差或交叉熵),w是模型的权重向量,||w||^2是权重向量的L2范数的平方,λ是正则化参数,用于控制正则化的强度。其中,L(w)是加了L1正则化的损失函数,Loss(y, y_pred)是模型的原始损失函数(例如,均方误差或交叉熵),w是模型的权重向量,||w||1是权重向量的L1范数,λ是正则化参数,用于控制正则化的强度。正则化参数λ越大,正则化项在损失函数中的比重就越大,对权重的惩罚也就越大。

qq_37803694的博客 9248

机器学习面试中常问到的算法问题1----L1正则化与L2正则化的区别以及为什么L1正则化可以产生稀疏矩阵,L2正则化可以防止过拟合**

一、L1正则化与L2正则化的区别以及为什么L1正则化可以产生稀疏矩阵,L2正则化可以防止过拟合 正则化(regularization):机器学习中几乎都可以看到损失函数后面会添加一个额外项,常用的额外项一般有两种,一般英文称作L1-norm和L2-norm,中文称作 L1正则化 和 L2正则化,或者 L1范数 和 L2范数。 L1正则化和L2正则化可以看做是损失函数的惩罚项。所谓『惩罚』是指对损失...

qq_41978536的博客 2232

机器学习】L1、L2正则化

L1正则化能够通过使模型稀疏化达到降低模型复杂度的作用。这种稀疏化特性使它能够作为一种特征选择策略,适合在高维且特征相关性不强的场景中使用。 L2正则化能够通过将各项权重系数优化的很小达到降低模型复杂度的目的。它能够减少单个特征的在模型中的作用,避免某个特征主导整个预测方向。L2正则化项是可微的,优化计算效率更高,适合处理低维且特征间具有强相关性的场景。

研究兴趣:开放集识别、开放世界识别、新类发现、增量学习、少样本学习 5377

Google机器学习实践指南(L1(稀疏特征)正则化

使用一种根据权重的绝对值的总和来惩罚权重的正则化方式。在依赖稀疏特征的模型中,L1 正则化有助于使不相关或几乎不相关的特征的权重正好为 0,从而将这些特征从模型中移除。与 L2 正则化相对。Google机器学习(23)-L1(稀疏特征)正则化(约8分钟)经L1筛选后:约3,000个非零权重。二、L1 vs L2 机制对比。L1为什么能精确产生零权重?案例:文本分类中的词袋模型。特征维度 > 10,000。原始特征:50,000维。三、L1正则化优势场景。3. 特征重要性分析。小心重要特征被误剔除。

qq_40821260的博客 1118

机器学习 正则化l1怎么用_「机器学习速成」稀疏正则化:L1正则化

大家好,今天我们学习【机器学习速成】之 稀疏正则化:L1正则化。我们 马上学三点 ,稀疏特征的组合问题L1正则化L1和L2正则化区别大家可以点击下面的“ 了解更多 ”,或搜索“ 马上学123 ”,在线观看PPT讲义。稀疏特征的组合: 举例我们之前的教程中, 学习了特征组合好处。 特征组合可能很棒, 但也可能会带来一些问题。 尤其是将稀疏特征组合起来的时候。举例: 假如我们有一个全球的的住房数据集...

weixin_32001071的博客 284

机器学习正则化ppt_「机器学习速成」稀疏正则化:L1正则化

大家好,今天我们学习【机器学习速成】之 稀疏正则化:L1正则化。我们马上学三点,稀疏特征的组合问题L1正则化L1和L2正则化区别大家可以点击下面的“了解更多”,或搜索“马上学123”,在线观看PPT讲义。稀疏特征的组合: 举例我们之前的教程中, 学习了特征组合好处。 特征组合可能很棒, 但也可能会带来一些问题。 尤其是将稀疏特征组合起来的时候。举例:假如我们有一个全球的的住房数据集, 如果按分(...

weixin_39958138的博客 237

机器学习系列手记(七):优化算法之L1正则化稀疏

优化算法 L1正则化稀疏性       稀疏性,说白了就是模型的很多参数是0。这相当于对模型进行了一次特征选择,只留下一些比较重要的特诊个,提高模型的泛化能力,降低过拟合的可能。在实际应用中,机器学习模型的输入动辄几百上千万维,稀疏性就显得更加重要。下面我们来说说L1正则化使得模型参数具有稀疏性的原理。   &nbs...

yly_3026925713的博客 1279

机器学习知识点总结 - 为什么L1正则化比L2正则化稀疏

机器学习优化过程中的损失函数通常由经验损失和正则项两部分组成。经验损失反映了模型的预测值与真实数据的误差值;而正则项则对模型的复杂程度进行约束,使其不至于对数据进行过分表达,即减少过拟合的风险。 L1和L2范式是比较常用的正则项,相比于L2,L1正则化将产生稀疏的权值。这里面的原因是什么呢? 首先我们来看看L1和L2范式的数学定义: L1:向量元素绝对值之和,也称街区距离(city-bloc...

Raymond_Love的博客 1790

L1正则化:让机器学习中的特征稀疏

在大量的特征中,如何挑选出对我们所关心的目标变量最为相关的特征,成为了机器学习中一个重要的问题。L1正则化采用的是L1范数作为惩罚项,将数据集中不重要的特征系数缩减为0。这样就能够使得机器学习模型仅选择出最相关的特征,达到特征稀疏化的目的。我们可以发现,L1正则化将第二个和第三个特征系数缩减为了0,这两个特征被舍弃,只有第一个特征被保留下来。因此,通过L1正则化,我们能够轻易地进行特征选择,并且得到更加简洁高效的机器学习模型。将第二个和第三个特征系数缩减为了0,这两个特征被舍弃,只有第一个特征被保留下来。

m0_47037246的博客 365

机器学习正则化终极指南:L1与L2正则化对比详解

机器学习模型训练中,**L1/L2正则化**是防止过拟合、提升模型泛化能力的核心技术。无论你是机器学习新手还是进阶学习者,理解这两种正则化方法的差异对于构建稳健模型至关重要。 ## 什么是正则化?为什么需要它? **正则化**通过在损失函数中添加惩罚项来约束模型参数,避免模型过度拟合训练数据。当模型过于复杂时,它会记住训练数据的噪声而不是学习通用模式,这就是过拟合现象。 [![深度置信网络

gitblog_00512的博客 866

正则化的作用以及L1和L2正则化的区别

0 正则化的作用 正则化的主要作用是防止过拟合,对模型添加正则化项可以限制模型的复杂度,使得模型在复杂度和性能达到平衡。 常用的正则化方法有L1正则化和L2正则化。L1正则化和L2正则化可以看做是损失函数的惩罚项。所谓『惩罚』是指对损失函数中的某些参数做一些限制。 L1正则化的模型建叫做Lasso回归,使用L2正则化的模型叫做Ridge回归(岭回归。但是使用正则化来防止过拟合的原理是什么?L1和L...

Lavi的专栏 4万+

百面机器学习13.L1正则化稀疏

文章目录1. 为什么希望模型参数具有稀疏性?2. L1正则化使得模型参数具有稀疏性的原理是什么?角度:解空间形状 1. 为什么希望模型参数具有稀疏性?   稀疏性,说白了就是模型的很多参数是0。这相当于对模型进行了一次特征选择,只留下一些比较重要的特征,提高模型的泛化能力,降低过拟合的可能。在实际应用中,机器学习模型的输入动辄几百上千万维,稀疏性就显得更加重要。 2. L1正则化使得模型参数具有稀疏性的原理是什么? 角度:解空间形状   在二维的情况下,黄色的部分是L2和L1正则项约束后的解空间,绿色的等高

柳杰的博客 801

机器学习中的范数:从L1、L2到L2,1,理解正则化稀疏性的核心原理

机器学习和优化领域,范数(Norm)是一个基础且核心的数学概念,它本质上是衡量向量或矩阵“大小”或“长度”的尺度。其基本原理是将高维数据映射为一个非负实数,从而提供了一种量化的度量方式。从技术价值看,范数不仅是构建损失函数、度量预测误差的关键工具,更是实现正则化、防止模型过拟合的核心机制。通过引入不同的范数作为惩罚项,可以引导模型学习到具有特定性质的解,例如平滑性或稀疏性。在应用场景上,L2范数因其光滑可导的特性,广泛用于岭回归和权重衰减;L1范数因其能诱导稀疏解,成为特征选择(如LASSO)和模型压缩的

weixin_34408717的博客 358

稀疏性在机器学习中的实战应用:从L1正则化到模型优化

本文深入探讨了稀疏性在机器学习中的实战应用,从L1正则化到模型优化的关键技术。通过分析稀疏性的本质与价值,详细介绍了L1正则化的工程实践技巧,以及超越L1的结构化稀疏和动态稀疏训练方法。文章还展示了稀疏性在自然语言处理和自动驾驶等领域的创新应用,并指出了稀疏性优化的常见陷阱与解决方案。

醉三国 166

机器学习中L1L2规则化详解(先验及稀疏性解释)

(作者:陈玓玏) 1、 为什么要正则化? 知乎上有个兄弟说得对(https://www.zhihu.com/question/20924039 这个问题下Stark Einstein的回答),不应该说是正则化,应该说是规则化,也就是说,我们原来是在完全没有任何先验知识的情况下进行的训练,那训练出来的结果有可能会“过”,你不知道哪个特征会有用,于是你找了很多特征,尽可能精确地去拟合你的训练数据,结果...

小白白的博客 8599

Tikhonov regularization 吉洪诺夫正则化(L2正则化

在数学,统计学和计算机科学中,特别是机器学习和反问题,正则化是为了解决不适定问题或防止过拟合而引入额外信息的过程。 1.不适定问题 图像处理中,不适定问题也称为反问题。上世纪90年代法国数学家阿达玛提出了不适定问题的概念: 一个数学物理定解问题的解存在、唯一并且稳定,则称该问题是适定的(WellPosed).如果不满足适定性概念中的上述判据中的一条或几条,称该问题是不适定的。 典型的图像处理不适定...

qq_35045096的博客 3万+

L1 和 L2 正则的区别,从梯度的角度来解释

L1 和 L2 正则的区别,从梯度的角度来解释

叶庭云 成为自己的光 1330
上一篇: 速学 latex 数学公式
下一篇: 机器学习稀疏 L1正则解法- LARS算法简介
MyProgramingLife
博客等级 码龄12年 10粉丝 13原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值