一元线性回归模型

Python一元和多元线性回归模型的原理及评估【附代码】 线性回归模型是利用线性拟合的方式来探寻数据背后的规律,如下图所示,就是通过搭建线性回归模型来寻找这些散点(也称样本点)背后的趋势线(也称回归曲线),而通过这个回归曲线我们就能进行一些简单的预测分析或因果关系分析。线性回归中,我们根据特征变量(也称自变量)来对反应变量(也称因变量)进行预测,根据特征变量的个数可将线性回归模型分为一元线性回归和多元线性回归。通过一个特征变量:工作年限对收入进行预测,就属于一元线性回归;通过多个特征变量:工作年限、行业、所在城市等对收入进行预测,就属于多元线性回归 阅读详情

本文主要介绍线性回归模型,该模型主要应用于监督学习中目标变量是连续数值型的场景。

一元线性回归模型

线性回归模型是数据科学领域最简单的模型,很多复杂的模型 (如多项式回归、逻辑回归、SVM) 都是建立在线性回归模型的基础上的,或者是从其中能找到线性回归模型的影子。最简单的线性回归模型就是一元线性回归模型,其模型的形式就是:
y = a x + b (1) y=ax+b \tag{1} y=ax+b(1)
由式(1)可知,线性回归是针对连续数值型变量的模型,且样本只有一个特征,即只有一个自变量。所谓线性,是指方程是线性的,也就是在寻找一条直线来拟合数据;所谓回归,是指用方程来模拟变量之间是如何关联的。线性回归就是要找一条直线,并且让这条直线尽可能地拟合训练样本中的数据点。

虽然我们可以找到一条拟合训练集的直线,但是同一训练样本可以拟合出很多条直线,我们如何判断那条直线是最适合的?这就引出了如何评价模型结果的好坏,又通过什么样的方式来判断?接下来我们通过损失函数来了解线性回归的评价标准。

损失函数

为了衡量模型的效果,很自然的就会想到衡量预测值与真实值之间的差别。假设预测值为f(x),真实值为y,样本的数量为n,那么就有:
∑ i = 1 n ( f ( x i ) − y i ) 2 (2) \sum_{i=1}^n(f(x_i)-y_i)^2 \tag{2} i=1n(f(xi)yi)2(2)
也就是每一个样本的预测值与真实值差的平方和,取平方是为了消除负数的影响。

式(2)就是均方误差(MSE, Mean Squared Error),它对应了常用的欧氏距离(也就是计算两点之间距离)。均方误差是机器学习中回归问题经常使用的评价方式,在机器学习中称之为损失函数。可以看到一个公式在不同的地方会有不同的名字,很容易搞混,但我们只要理解其中的基本思想就会很清楚了。

所以,现在我们知道了损失函数是衡量回归模型误差的函数,也就是我们要的“直线”的评价标准。这个函数的值越小,说明直线越能拟合我们的数据。

得到损失函数后,又如何求得使损失函数最小的a和b呢,接下来我们通过最小二乘法来获得问题的解。

最小二乘法

回归方程里,求得特征对应的最佳回归系数的方法是最小化误差的平方和,也就是损失函数。

假设式(2)的值为S,将式(1)代入式(2)可得:
S = ∑ i = 1 n ( f ( x i ) − a x i − b ) 2 (3) S =\sum_{i=1}^n(f(x_i)-ax_i-b)^2 \tag{3} S=i=1n(f(xi)axib)2(3)
在xi和yi已知的前提下,式(3)是a和b的二次函数。由微积分的知识可知,要求得a和b的最小值分别对a和b求偏导,当两者的偏导数为0时取得最小值。如下所示:
∂ S ∂ a = 2 ∑ i = 1 n ( y i − a x i − b ) x i = 0 (4) \frac {\partial S } {\partial a }=2\sum_{i=1}^n(y_i - ax_i-b)x_i = 0 \tag{4} aS=2i=1n(yiaxib)xi=0(4)

∂ S ∂ b = 2 ∑ i = 1 n ( y i − a x i − b ) = 0 (5) \frac{\partial S}{\partial b} = 2\sum_{i=1}^n(y_i-ax_i-b)=0 \tag{5} bS=2i=1n(yiaxib)=0(5)

将xi和yi代入(4)和(5)式中就可以得到a和b的最小值。

总结

本文简单介绍了一元线性回归模型及其损失函数,并通过最小二乘法求得线性方程的最小参数。

参考资料

模型之母:简单线性回归&最小二乘法

用人话讲明白线性回归LinearRegression

机器学习眼中的线性回归

用python实现一元线性回归模型 0000下面为你展示如何用 Python 实现一元线性回归模型一元线性回归模型的基本形式为yβ0​β1​xϵ,其中y是因变量,x是自变量,β0​是截距,β1​是斜率,ϵ是误差项。 阅读详情

相关推荐

一元线性回归模型模拟预测

一元线性回归是描述两个变量之间的相关关系最简单的模型。 根据两个变量之间的相关关系,拟合出一条直线来预测因变量变化的轨迹。 下面通过自己模拟的一些数据都进行模型预测 预测值的轨迹 import pandas as pd import numpy as np import random import matplotlib.pyplot as plt from sklearn.linear_mode...

weixin_44941795的博客 4245

一元线性回归及案例(Python)

目录 1 一元线性回归简介 2 一元线性回归数学形式 3案例:不同行业工龄与薪水的线性回归模型 3.1案例背景 3.2具体代码 3.3模型优化 4总体展示 5线性回归模型评估 6模型评估的数学原理 6.1 R-squared 6.2Adj.R-squared 6.3 P值 参考书籍 1 一元线性回归简介 线性回归模型是利用线性拟合的方式探寻数据背后的规律。如下图所示,先通过搭建线性回归模型寻找这些散点(也称样本点)背后的趋势线(也称回归曲线),再利用回归曲线进行...

qq_42433311的博客 4万+

一元线性回归模型(公式推导+举例应用)

本文深入探讨了一元线性回归的原理及应用。通过最小二乘法和协方差方差的推导,得到了求解斜率和截距的两种方法。利用工人工作年限与薪水的数据集进行实验分析,采用最小二乘法和协方差方差法得到的拟合直线均能有效描述变量间的线性关系。这些方法不仅为建模提供了有力工具,也帮助理解回归分析的基本原理。在实际应用中,可根据具体情况选择适宜的方法进行建模和分析。

Nie同学的博客 1万+

一元线性回归模型(保姆级)

一元回归模型的建立和代码实现

DL11007的博客 7636

机器学习笔记1】一元线性回归模型及预测

一元线性回归、代价函数、梯度下降算法、样例(含数据)及代码

issey的博客 9978

一元线性回归模型及其Python案例

线性回归中,根据特征变量(也称自变量)来预测反应变量(也称因变量)。 根据特征变量的个数可将线性回归模型分为一元线性回归和多元线性回归。 例如,通过“人均可制配收入”这一个特征变量来预测“人均消费支出”,就属于一元线性回归; 而通过“人均可制配收入”“行业”“所在城市”等多个特征变量来预测“薪水”,就属于多元线性回归。 薪水会随着工龄的增长而增长,不同行业的薪水增长速度有所不同。本案例要应用一元线性回归模型探寻工龄对薪水的影响,即搭建薪水预测模型模型优化 一元多次线性回归模型

qq_44386182的博客 5407

基于R语言一元线性回归模型实例及代码

基于R语言一元线性回归模型实例及代码题目描述数据特征及可视化建立模型与初步评价(自己写lm()代码)回归诊断模型预测 题目描述 所用数据集——faithful(MASS包) # 加载数据包及查看问题背景 library(MASS) data("faithful") ?data Waiting time between eruptions and the duration of the eruption for the Old Faithful geyser in Yellowstone National

唯欣主义的博客 5401

一元线性回归方程第二部分——一元线性回归模型

一元线性回归知识框架

suansuannainaizi的博客 1756

一元线性回归:从基础到应用及模型处理》

摘要: 本文系统阐述了变量间的相关关系与一元线性回归分析。首先区分了函数关系与统计相关关系,并介绍了相关系数的计算与解释标准(如|r|≥0.8为高度相关)。其次,详述一元线性回归模型的构建,包括最小二乘估计(OLS)方法、参数估计公式(如斜率系数b₁=Σ(Xi-X̄)(Yi-Ȳ)/Σ(Xi-X̄)²)及模型假设(线性、正态性、同方差性)。通过10家厂商的投入产出案例,演示了回归方程(Ŷ=15.8004+1.1818X)的计算过程。最后,探讨了模型检验方法,包括总平方和分解(SSTO=SSR+SSE)、拟合

2302_79239614的博客 1370

一元线性回归(Simple Linear Regression)

一元线性回归,是一种统计分析方法,用于研究一个因变量和一个自变量之间的线性关系。一元线性回归模型通常表示为 y = a*x + b,其中a是斜率,b是截距。其表示的含义是,自变量x每增加一个单位,因变量y平均增加a个单位。一元线性回归是一种强大的统计分析工具,可以用来探索和理解两个变量之间的线性关系。然而,对于非线性关系或其他更复杂的关系时就不适用了,需要其他更复杂的模型,如多元线性回归,逻辑回归,等等。

M冰的博客 3873

线性回归模型

一元线性回归模型 定义: 运用一条直线,近似地表示自变量x与因变量y之间的关系 公式: Y=aX+b 问题: 以下那条直线更能代表x和y的关系? 问题: 如何理解线与散点之间的关系? 目标:一条直线使得实际y与预测y之间的距离整体最短(一条直线使得全局误差最小) 线性回归模型损失函数线性回归模型参数优化目标: 最小二乘法最小二乘法求解上述损失函数的最小值(二次函数的最小值) 关于参数a与b的损失函数: 优化目标: 优化转化:求偏导并令一阶导数为0 代入自变量x和因变量y,即可求

Jepson的博客 9039

机器学习一元线性回归模型

模型一元线性回归模型 回归分析:建立方程模拟两个或者多个变量之间是如何相互关联,被预测的变量称为因变量(结果),用来进行预测的变量称为 自变量(输入参数),当输入参数只有一个(输出1个)时,称为一元回归,反之当输入有多个(输出1个),称为多元回归; 一元线性回归模型如下所示:(我们只需确定此方程的两个参数即可) 第一个参数为截距,第二个参数为斜率(我们只需根据大量的数据集通过训练求解...

)梦想之深邃( 6330

一元线性回归模型及诊断(原理+实例+代码)

利用R语言实现了一元线性回归模型及诊断,包含讲解分析,以及算法代码和结果等。对运行结果和算法进行了详细分析讲解

jd1813346972的博客 2961

【统计学笔记】第十一章 一元线性回归

第十一章 一元线性回归 11.1 变量间的关系的度量 11.1.1 变量间的关系 函数关系:设有两个x和y,y随x一起变化,并完全依赖于x,y是x的函数,y=f(x)y = f(x)y=f(x),x为自变量,y为因变量。 相关关系:变量之前存在的不确定的关系称为相关关系。 一个变量的取值不能由另一个变量唯一确定 当变量x 取某个值时,变量y 的取值对应着一个分布 各观测点分布在直线周围 11.1.2 相关关系的描述与测量 散点图:可以通过散点图判断两个变量之间有无相关关系,并对变量间的关系形态

MYMarcoreus的博客 3万+
上一篇: 简单的数据预处理
下一篇: 梯度下降的原理
Renirvana
博客等级 码龄10年 13粉丝 18原创
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值