伯努利分布的最大似然估计

对于伯努利模型的极大似然估计和贝叶斯估计的讨论 伯努利模型中,极大似然估计的运用是通过最大化结果为成功(或为1)的概率的似然函数来估计参数p的值,从而估计结果为1的概率。但是贝叶斯估计考虑了先验分布和观测数据的不确定性,因此提供了一个更全面的参数估计,随着观测数据的增大或观测数据很大时,先验估计所占的比重会越来越小,最后两者趋于相同。根据后验概率分布P(θ|D),可以使用不同的方法来进行参数的估计,包括取后验分布的均值作为参数的估计值(即贝叶斯估计)、取后验分布的最大值作为参数的估计值(即最大后验估计,MAP估计)等。 阅读详情

前言

昨天晚上参加阿里巴巴的实习面试,各种被虐。面试了将近90分钟,才做了3个题,加上项目的介绍。在机器学习方面,问到了一个伯努利分布的最大似然估计的推导,想到逻辑回归的推导就是利用最大似然估计,然后就套用了其推导过程。可能前面被说的有点迷糊了,导致最后也没有完整的推导出来,最失败的一次面试了。

对于阿里的暑期实习面试,其实问得内容还是都比较基础的。准备了很多关于特征工程、集成学习等内容,结果都没有考察到。反而被考的基础知识没有准备的比较清楚。这里对伯努利分布以及其最大似然估计做了一个详细的推导,其它的概率模型可以套用该模版。

祝看到此文章的小伙伴都能找到好的工作…


伯努利分布

伯努利分布,又名0-1分布,是一个离散概率分布。典型的示例是抛一个比较特殊的硬币,每次抛硬币只有两种结果,正面和负面。抛出硬币正面的概率为 p p p ,抛出负面的概率则为 1 − p 1-p 1p 。因此,对于随机变量 X X X ,则有:

f ( X = 1 ) = p f ( X = 0 ) = 1 − p \begin{aligned} f(X=1) & = p \\ f(X=0) & =1-p \end{aligned} f(X=1)f(X=0)=p=1p

由于随机变量 X X X 只有 0 和 1 两个值, X X X 的概率分布函数可写为:
(1) f ( X ) = p x ( 1 − p ) 1 − x 0 &lt; p &lt; 1 f(X)=p^x(1-p)^{1-x}\qquad\text{$0&lt;p&lt;1$}\tag{1} f(X)=px(1p)1x0<p<1(1)

数学期望

在概率论和统计学中,数学期望(或均值)是试验中每次可能结果的概率乘以其结果的总和。它反映了随机变量平均取值的大小。

离散型

离散型随机变量 X X X数学期望为一切可能的取值 x i x_i xi 与对应的概率 p ( x i ) p(x_i) p(xi) 的乘积之和,即如果随机变量的取值为集合 { x 1 , x 2 , ⋯ &ThinSpace; , x n } \lbrace x_1,x_2,\cdots, x_n \rbrace {x1,x2,,xn} ,每个取值对应的概率为 { p ( x 1 ) , p ( x 2 ) , ⋯ &ThinSpace; , p ( x n ) } \lbrace p(x_1),p(x_2),\cdots, p(x_n) \rbrace {p(x1),p(x2),,p(xn)} ,则有:
(2) E ( X ) = ∑ i = 1 n x n p ( x n ) E(X) =\sum_{i=1}^{n}x_np(x_n) \tag{2} E(X)=i=1nxnp(xn)(2)
因此,对于伯努利分布,其数学期望为:
E ( X ) = 1 ⋅ p + 0 ⋅ ( 1 − p ) = p E(X)=1\cdot p + 0\cdot (1-p)=p E(X)=1p+0(1p)=p
对于随机变量 X ​ X​ X ,其方差和数学期望的公式满足:
(3) V a r ( X ) = E ( ( X − E ( X ) ) 2 ) = E ( x 2 ) − [ E ( x ) ] 2 Var(X)=E((X-E(X))^2)=E(x^2)-[E(x)]^2\tag{3} Var(X)=E((XE(X))2)=E(x2)[E(x)]2(3)

一个随机变量的方差就是衡量随机变量和其数学期望之间的偏离程度。

公式推导如下:
V a r ( X ) = E ( ( X − E ( X ) ) 2 ) = E ( X 2 − 2 X ⋅ E ( X ) + [ E ( X ) ] 2 ) = E ( X 2 ) − 2 ⋅ E ( X ) ⋅ E ( X ) + [ E ( X ) ] 2 = E ( X 2 ) − [ E ( X ) ] 2 \begin{aligned} Var(X)&amp;=E((X-E(X))^2)\\ &amp;=E(X^2-2X\cdot E(X)+[E(X)]^2)\\ &amp;=E(X^2)-2\cdot E(X) \cdot E(X) + [E(X)]^2\\ &amp;=E(X^2)-[E(X)]^2 \end{aligned} Var(X)=E((XE(X))2)=E(X22XE(X)+[E(X)]2)=E(X2)2E(X)E(X)+[E(X)]2=E(X2)[E(X)]2
对于伯努利分布,有 E ( X 2 ) = E ( X ) E(X^2)=E(X) E(X2)=E(X) 。因此,其方差为:
V a r ( X ) = p − p 2 = p ( 1 − p ) Var(X)=p-p^2=p(1-p) Var(X)=pp2=p(1p)


最大似然估计

在统计学中,最大似然估计(MLE),也称为极大似然估计,是用来估计一个概率模型的参数的方法。其目的就是:利用已知的样本结果,反推最有可能导致这样结果的参数值。

由于样本集中的样本都是独立同分布,现以伯努利分布来推导其参数 p p p 最大似然估计。记已知的样本集为:
D = { x 1 , x 2 , ⋯ &ThinSpace; , x n } D=\lbrace x_1,x_2,\cdots,x_n\rbrace D={x1,x2,,xn}
其似然函数为:
(4) L ( p ∣ x 1 , ⋯ &ThinSpace; , x n ) = f ( X ∣ p ) = f ( x 1 , x 2 , ⋯ &ThinSpace; , x n ∣ p ) = ∏ i = 1 n f ( x i ∣ p ) = ∏ i = 1 n p x i ( 1 − p ) 1 − x i \begin{aligned} L(p|x_1,\cdots,x_n)&amp;=f(X|p)\\ &amp;=f(x_1,x_2,\cdots,x_n|p)\\ &amp;=\prod_{i=1}^n{f(x_i|p)}\\ &amp;=\prod_{i=1}^n{p^{x_i}(1-p)^{1-x_i}}\tag{4} \end{aligned} L(px1,,xn)=f(Xp)=f(x1,x2,,xnp)=i=1nf(xip)=i=1npxi(1p)1xi(4)
由于有连乘运算,通常对似然函数取对数来计算,即对数似然函数。因此其对数似然函数为:
(5) L = log ⁡ ∏ i = 1 n f ( x i ∣ p ) = ∑ i = 1 n log ⁡ f ( x i ∣ p ) = ∑ i = 1 n [ x i log ⁡ p + ( 1 − x i ) log ⁡ ( 1 − p ) ] \begin{aligned} L&amp;=\log \prod_{i=1}^nf(x_i|p)\\ &amp;=\sum_{i=1}^n{\log f(x_i|p)}\\ &amp;=\sum_{i=1}^n{[x_i\log p+(1-x_i)\log (1-p)]}\tag{5} \end{aligned} L=logi=1nf(xip)=i=1nlogf(xip)=i=1n[xilogp+(1xi)log(1p)](5)
等式 ( 5 ) (5) (5) 其实就是逻辑回归中使用到的交叉熵了。
p ^ = arg ⁡ max ⁡ p L ( p ∣ X ) = arg ⁡ max ⁡ p ∑ i = 1 n [ x i log ⁡ p + ( 1 − x i ) log ⁡ ( 1 − p ) ] \begin{aligned} \hat{p}&amp;=\arg \max_{p}L(p|X)\\ &amp;=\arg \max_p {\sum_{i=1}^n{[x_i\log p+(1-x_i)\log (1-p)]}} \end{aligned} p^=argpmaxL(pX)=argpmaxi=1n[xilogp+(1xi)log(1p)]
因此,最大似然估计其实就是求似然函数的极值点,将对数似然函数对参数 p p p 求导:
∂ L ∂ p = ∑ i = 1 n [ x i p + 1 − x i p − 1 ] = ∑ i = 1 n p − x i p ( p − 1 ) = 0 \begin{aligned} \frac{\partial L}{\partial p}&amp;=\sum_{i=1}^n{[\frac{x_i}{p}+\frac{1-x_i}{p-1}]}\\ &amp;=\sum_{i=1}^n{\frac{p-x_i}{p(p-1)}}=0 \end{aligned} pL=i=1n[pxi+p11xi]=i=1np(p1)pxi=0
从而得到伯努利的最大似然估计为:
∑ i = 1 n ( p − x i ) = 0 &ThickSpace; ⟹ &ThickSpace; p = 1 n ∑ i = 1 n x i \begin{aligned} &amp;\sum_{i=1}^{n}{(p-x_i)}=0\\ \implies &amp;p=\frac{1}{n}\sum_{i=1}^n{x_i} \end{aligned} i=1n(pxi)=0p=n1i=1nxi


总结

求概率模型的最大似然估计的一般步骤如下:

  1. 写出随机变量的概率分布函数;
  2. 写出似然函数;
  3. 对似然函数取对数,并进行化简整理;
  4. 对参数进行求导,找到似然函数的极值点;
  5. 解似然方程。

相信了解逻辑回归算法的小伙伴已经看出来了,对逻辑回归的推导其实质上也是最大似然估计算法。在逻辑回归中,其概率分布函数不再是 f ( x ) = p x ( 1 − p ) 1 − x f(x)=p^x(1-p)^{1-x} f(x)=px(1p)1x ,而是:
(6) P ( y ∣ x ; θ ) = ( h θ ( x ) ) y ( 1 − h θ ( x ) ) 1 − y P(y|x;\theta)=(h_{\theta}(x))^y(1-h_{\theta}(x))^{1-y}\tag{6} P(yx;θ)=(hθ(x))y(1hθ(x))1y(6)
其中:
(7) h θ ( x ) = 1 1 + e − z = 1 1 + e − θ T x h_{\theta}(x)=\frac{1}{1+e^{-z}}=\frac{1}{1+e^{-\theta^{T} x}}\tag{7} hθ(x)=1+ez1=1+eθTx1(7)
详细过程参见:逻辑回归推导

说明伯努利模型的极大似然估计以及贝叶斯估计中的统计学习方法三要素。假设观测到伯努利模型n次独立的数据生成结果,其中k次的结果为1,这时可以用极大似然估计或贝叶斯估计来估计结果为1的概率。 假设观测到伯努利模型n次独立的数据生成结果,其中k次的结果为1,这时可以用极大似然估计或贝叶斯估计来估计结果为1的概率。设实验结果只有两个即A或Ã,且P(A)=p,P(Ã)=1-p=q,独立的重复的进行n次实验,在n重贝努利模型事件A恰恰出现K次的概率常称为二项概率,通常与实际情况相符,这个概率常称为二项概率。Beta分布是一种连续型概率密度分布,表示为x~Beta(a,b),由两个参数a,b决定,称为形状参数。根据伯努利模型的贝叶斯估计,估计结果为1的概率。即贝叶斯估计等于极大似然估计。 阅读详情

相关推荐

极大似然估计 伯努利分布 高斯分布 正态分布

#极大似然估计 伯努利分布 高斯分布 正态分布 概率分布的参数能以最高的概率产生这些样本。 如果观察到的数据是 D1,D2,D3,...,DND_1, D_2, D_3, ... , D_ND1​,D2​,D3​,...,DN​, 那么极大似然的目标如下: maxP(D1,D2,D3,...,DN)max P(D_1, D_2, D_3, ... , D_N)maxP(D1​,D2​,D3​,.....

DarrenXf的专栏 2396

最大似然估计-伯努利模型

最大似然估计基本原理,最大似然估计伯努利模型

Jason_t1的博客 1884

PRML:二元变量分布

伯努利分布考虑二元随机变量 x∈{0,1}x\in \{0,1\}(抛硬币,正面为 1,反面为 0),其概率分布由参数 μ\mu 决定:p(x=1)=μ p(x=1)=\mu 其中 (0≤μ≤1)(0 \leq\mu \leq 1),并且有 p(x=0)=1−μp(x=0)=1-\mu。这就是伯努利分布(Bernoulli distribution),其概率分布可以写成:Bern(x|μ)=μx(1

qilixuening的博客 2043

伯努利分布的极大似然估计一个示例,详细展开的方程求解步骤

伯努利分布的极大似然估计的一个例子,原是“什么是极大似然估计”文章的一个例子,此处给出了更加详细的方程计算的步骤

彬彬侠的博客 1867

伯努利分布最大似然估计与贝叶斯估计

求概率模型的最大似然估计的一般步骤如下: 写出随机变量的概率分布函数; 写出似然函数; 对似然函数取对数,并进行化简整理; 对参数进行求导,找到似然函数的极值点; 解似然方程。 似然函数是一种关于统计模型参数的函数。给定输出x时,关于参数θ的似然函数L(θ|x)(在数值上)等于给定参数θ后变量X的概率:L(θ|x)=P(X=x|θ)。 关于伯努利分布的贝叶斯估计参见https://blog.csdn.net/lynn_001/article/details/83904835?utm_medium=dist

qq_40598006的博客 3851

二分法求最大似然估计r语言_最大似然估计之-伯努利分布、二项分布、多类别分布、多项分布...

本文记录使用最大似然估计求解伯努利分布、二项分布、categorical分布、多项分布参数的推导过程。伯努利分布: 假设样本 大小为 ,则似然函数 假设 次抛硬币的结果是正面朝上出现了 次,则似然函数可以记为 对上式取 , 对 求偏导,令偏导数等于0, 二项分布: 假设样本 大小为 ,则似然函数 观察上式,等号右边可以拆分为 所以,似然函数可以写为 对上式取 , ...

weixin_35738619的博客 2509

matlab 最大似然估计二项式分布,伯努利分布最大似然估计

极大似然估计法是求点估计的一种方法,最早由高斯提出,后来费歇尔(Fisher)在1912年重新提出。它属于数理统计的范畴。大学期间我们都学过概率论和数理统计这门课程。概率论和数理统计是互逆的过程。概率论可以看成是由因推果,数理统计则是由果溯因。用两个简单的例子来说明它们之间的区别。由因推果(概率论)例1:设有一枚骰子,2面标记的是“正”,4面标记的是“反”。共投掷10次,问:5次“正”面朝上的概率...

weixin_39689506的博客 1426

伯努利分布详解(包含该分布数字特征的详细推导步骤)

由于狄利克雷分布是二项分布扩展到n个变量的

ehomeshasha的专栏 2万+

机器学习-最大似然估计

最大似然估计 假设我们有一组独立同分布的样本X={~},是从某个已知的概率分布簇中取出的数据,其中是未知的参数,我们要通过给定的样本X来估计的取值,我们的任务就是找到一个合适的,使得~这些样本出现的概率最大,每一个样本出现的概率最大,那么就要使达到最大,为了便于计算对该式求对数得,表示在已经知道X样本的情况下估计的值。一般对求偏导,令偏导为0,求出使得改式最大的值。 伯努利密度 伯努利分布两种结果要么发生要么不发生,如下: 当x=1时p(x)=p,当x=0时p(x)=1-p,假设我们有样本X={

qq_39097323的博客 400

最大似然估计(通俗讲解)

最大似然估计是找到最适合这个数据的分布DDD的参数θ\thetaθ(即在所有可能的θ\thetaθ取值中,寻找一个值使这个采样的“可能性”最大化)。从数学上来说,可以在θ\thetaθ的所有可能取值中寻找一个值使得似然函数取到最大值。而这个可能性最大的θθ值即为θ\thetaθ的最大似然估计最大似然估计实际上是样本的函数。笔者能力有限,遂分享自此,倘若大佬发现错误,敬请批评指正;倘若大佬有更加通俗易懂的理解方式,欢迎交流😁!

m0_70832728的博客 1万+

概率分布详解 Bernoulli、Binomial、Beta

Bernoulli、Binomial、Beta 分布是概率统计常用的基础,本文详细介绍、分析,并给出一个应用举例

段哥哥的博客 2万+

新手村:逻辑回归-理解02:逻辑回归中的伯努利分布

伯努利分布在逻辑回归中的潜在含义及其与后续推导的因果关系

寓教于乐。教己助人 1118

瑞利分布概率密度函数推导_统一分布:指数模型家族

本文使用 Zhihu On VSCode 创作并发布本文讲解和「指数族分布」有关的统计计算。机器学习中应用的诸多概率模型都可以统一到「指数族分布」下,这样的统一省去了一些不必要的重复,也为「广义线性模型」(GLM) 奠定了基础。本文md源码地址:AnBlog/统计和机器学习​github.com[TOC]如果你已经了解「指数族分布」,那就来看看「广义线性模型吧」。可以说,指数族分布的计算就是为了「...

weixin_34502341的博客 2688

似然+最大似然估计MLE+伯努利分布+交叉熵+KL散度

本文系统梳理了概率建模中的核心概念链条:从伯努利分布、二项分布等基础概率模型出发,引出联合概率与条件概率的分解方法。重点阐释了似然函数与极大似然估计(MLE)的本质——通过观测数据反推最可能参数,并揭示其数学等价形式:最小化交叉熵和KL散度。文章构建了完整的逻辑框架:有限样本MLE→理论期望形式→交叉熵定义→KL散度视角,最终落地到语言模型训练,说明预训练本质是通过最小化交叉熵(等价MLE)使模型分布逼近真实数据分布。全文强调概念间的内在联系,突出"概率-统计-优化"三个维度的统一性。

weixin_44040169的博客 315

机器学习小组知识点7:伯努利分布(Bernouli Distribution)

伯努利分布是较为简单的一种分布,应用于两种实验结果。要么成功,要么失败,一定程度上是二元的性质。这里,我们假设成功的概率为pp,显然失败的概率就变成了1−p1-p。 概率公式可以表示为f(x)=px(1−p)1−xf(x)=p^x(1-p)^{1-x},xx为0或1,1代表成功,0代表失败。 接下来我们研究以下统计量, 1.数学期望 E(x)=E(x1)+E(x2)+⋯+E(xn)=x1p

Eric2016_Lv的博客 7179

最大似然估计对付各种分布

1伯努利分布基本概念了解或复习:参考链接1 2二项分布,也叫做n重伯努利分布 参考链接2 两者的区别来自知乎 参考链接3 3.均匀分布的参数估计 参考链接4 均匀分布的参数估计 参考链接 就是这么多数的最大值和最小值,分别就是他的a和b 4.正太分布用numpy生成的参数参考链接 一维的正态分布基于MLE的参考链接 ...

weixin_37721058的博客 1919
上一篇: 【Java教学系列】-- 枚举类型
十之
博客等级 码龄9年 20粉丝 10原创
评论 6
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值