朴素贝叶斯分类器(Naive Bayesian Classifier)

机器学习-朴素贝叶斯分类器 贝叶斯分类器是一种基于贝叶斯定理的概率模型,常用于文本分类、垃圾邮件过滤、情析等任务。该分类器基于特征之间的条件独立性假设,即给定类别下特征之间相互独立。它的工作原理是通过计算给定特征条件下类别的概率,并选择具有最高概率的类别作为预测结果。在本次的实验中,主要涉及朴素贝叶斯分类器朴素贝叶斯分类器,它假设每个特征对于类别的影响是相互独立的,即使这在实际情况中并不成立。常见的朴素贝叶斯分类器包括多项式朴素贝叶斯、伯努利朴素贝叶斯和高斯朴素贝叶斯,它们分别适用于不同类型的特征分布。 阅读详情

写作本博文只为学习与分享知识。所以如果本系列教程对你有帮助,麻烦不吝在github的项目上点个star吧!非常感谢!

本博客是基于对周志华教授所著的《机器学习》的“第7章 贝叶斯分类器”部分内容的学习笔记。


朴素贝叶斯分类器,顾名思义,是一种分类算法,且借助了贝叶斯定理。另外,它是一种生成模型(generative model),采用直接对联合概率P(x,c)建模,以获得目标概率值的方法。

预备知识

先验概率与后验概率

先验概率(摘自维基百科):

In Bayesian statistical inference, a prior probability distribution, often simply called the prior, of an uncertain quantity is the probability distribution that would express one's beliefs about this quantity before some evidence is taken into account.

翻译:在贝叶斯统计推断论中,一个未确定数目的先验概率分布(一般简称为先验)是一种表达了某人对于该数目的信仰的一种概率分布,这种信仰是没有考虑到一些(当前的)证据的。

解释:通俗来说,对于某一个概率事件,我们都会有基于自己已有的知识,对于这个概率事件会分别以什么概率出现各种结果会有一个预先的估计,而这个估计并未考虑到任何相关因素。

举例来说,假如你考试没及格,老师要求大家拿卷子回家给爸妈签字,按照你已有的对爸妈脾气的了解,以及他们对自己成绩的要求,你在不考虑其它任何因素的情况下,自己已经有了一个对把卷子拿回家给他们签字的后果预估(先验):

  • 被胖揍一顿:70%
  • 被简单地数落一下:20%
  • 被温情地鼓励:10%

暂停,让我们再来看看后验概率是什么:

In Bayesian statistics, the posterior probability of a random event or an uncertain proposition is the conditional probability that is assigned after the relevant evidence or background is taken into account.  "Posterior", in this context, means after taking into account the relevant evidence related to the particular case being examined.

翻译:在贝叶斯推断中,一个随机事件的后验概率是指:当与事件相关的一些证据或背景也被考虑进来时的条件概率。“后验”在这个语境下即指的是在考虑了与要被检验的特定事件相关的证据。

所以后验概率就是在先验概率的基础上加了一层“考虑”:结合我们已有的知识,将与待检验事件(即我们正在估计概率的随机事件)相关的因素也考虑进去后,我们对随机事件的概率的预估。

回到卷子签字的例子。

假设,你惶恐地拿着卷子回到家中,还没开口说考试的事,就看到爸爸妈妈在那儿雀跃,好似疯了一样。你一问,他们告诉你说家里中了1亿的大奖,以后就直接过上荣华富贵的生活啦!

这时,你小眼珠子一转,根据当前家里中了亿元大奖的情况,对把不及格试卷给爸妈签字的后果有了新的预估(后验):

  • 被胖揍一顿:0%
  • 被简单地数落一下:0%
  • 被温情地鼓励:100%

没错,因为你觉得按现在家里的情况来看,爸妈会觉得你这一次考试没及格算个屁,以后直接花钱把你送到国外去留学,回来继承家产就是了,什么考试啥的见鬼去吧~~

这就是先验概率和后验概率的区别:先验概率基于已有知识对随机事件进行概率预估,但不考虑任何相关因素(P( c ))。后验概率基于已有知识对随机事件进行概率预估,并考虑相关因素(P(c|x))。

贝叶斯定理(Bayesian Theorem)

贝叶斯定义(摘自维基百科):

In probability theory and statistics, Bayes’ theorem (alternatively Bayes’ law or Bayes’ rule) describes the probability of an event, based on prior knowledge of conditions that might be related to the event. For example, if cancer is related to age, then, using Bayes’ theorem, a person’s age can be used to more accurately assess the probability that they have cancer, compared to the assessment of the probability of cancer made without knowledge of the person’s age.

翻译:在概率论与统计学中,贝叶斯定理(或称贝叶斯法则、贝叶斯规则)描述了一个事件的可能性,这个可能性是基于了预先对于一些与该事件相关的情况的知识。举例来说,如果癌症和年龄有关,那么使用贝叶斯定理的话,相比根本不了解关于此人的任何其他信息,知道了它的年龄的话就可以用来更准确地帮助评估它得癌症与否的概率。

那么其实很明显了,这里的“可能性”也是考虑了与随机事件相关的因素的,所以贝叶斯定理所阐述的也就是后验概率的获得方法

用数学公式来表述贝叶斯定理:

P ( c ∣ x ) = P ( c ) P ( x ∣ c ) P ( x ) = P ( x , c ) P ( x ) P(c|x)=\frac{P(c)P(x|c)}{P(x)}=\frac{P(x,c)}{P(x)} P(cx)=P(x)P(c)P(xc)=P(x)P(x,c)

c表示的是随机事件发生的一种情况。x表示的就是证据(evidence)\状况(condition),泛指与随机事件相关的因素。

  • P(c|x):在x的条件下,随机事件出现c情况的概率。(后验概率)
  • P( c ):(不考虑相关因素)随机事件出现c情况的概率。(先验概率)
  • P(x|c):在已知事件出现c情况的条件下,条件x出现的概率。(后验概率)
  • P(x):x出现的概率。(先验概率)

那么,落实到实际的问题当中,我们想获得的核心结果其实也就是P(c|x),即我们想知道,在考虑了一些现有的因素后,随机事件会以多大概率出现各种情况,通过参考这个结果,我们针对性地作出决策。

而从计算上来说,我们需要同时知道P( c ),P(x|c)和P(x)才能算出目标值P(c|x),而P(x)由于是c无关,而且作为共同的分母,在我们计算c的各种取值的可能性时并不会对各结果的相对大小产生影响。因此可以忽略。

比如c可取值 c 1 , c 2 , c 3 c_1,c_2,c_3 c1,c2,c3,并假设已知 p ( c 1 ) = o , p ( c 2 ) = p , p ( c 3 ) = q , P ( x ∣ c 1 ) = a , P ( x ∣ c 2 ) = b , P ( x ∣ c 3 ) = c , p ( x ) = m p(c_1)=o,p(c_2)=p,p(c_3)=q,P(x|c_1)=a,P(x|c_2)=b,P(x|c_3)=c,p(x)=m p(c1)=o,p(c2)=p,p(c3)=qP(xc1)=a,P(xc2)=b,P(xc3)=c,p(x)=m,那么最后计算p(c|x)时,分别会得到结果 p ( c 1 ∣ x ) = o ∗ a m , p ( c 2 ∣ x ) = p ∗ b m , p ( c 3 ∣ x ) = q ∗ c m p(c_1|x)=\frac{o*a}{m},p(c_2|x)=\frac{p*b}{m},p(c_3|x)=\frac{q*c}{m} p(c1x)=moa,p(c2x)=mpb,p(c3x)=mqc,由于 p ( c 1 ∣ x ) + p ( c 2 ∣ x ) + p ( c 3 ∣ x ) p(c_1|x)+p(c_2|x)+p(c_3|x) p(c1x)+p(c2x)

【机器学习】十大算法之一 “朴素贝叶斯 朴素贝叶斯算法是一种监督学习的算法,通过计算条件概率来预测或分类数据。它的核心思想是贝叶斯定理,即后验概率等于先验概率与似然函数的乘积除以证据因子。在文本分类的应用中,假设我们有一个文档和一个文档分类,我们想要判断这个文档属于哪个分类。我们可以将文档中的每个词都看作一个特征,每个特征的值为 0 或 1,0 表示该词不在文档中,1 表示该词在文档中。这样,我们就可以将每个文档表示为一个特征向量。然后,我们可以使用朴素贝叶斯算法来计算每个分类的条件概率,并选择条件概率最大的分类作为文档所属的分类。 阅读详情

相关推荐

Naive Bayesian Classifier(朴素贝叶斯算法)

这里首先学习的是贝叶斯分类器的算法。先验概率:根据以往经验和分析得到的概率。如全概率公式,它往往作为"由因求果"问题中的"因"出现的概率·后验概率:是基于新的信息,修正原来的先验概率后所获得的更接近实际情况的概率估计,后验概率是指通过调查或其它方式获取新的附加信息,利用贝叶斯公式对先验概率进行修正,而后得到的概率。 =========================================

Miracle.Zhao的博客 1318

机器学习之朴素贝叶斯分类器原理详解、公式推导(手推)、面试问题、简单实例(python实现,sklearn调包)

主要内容分为理论推导和代码实现以及面试宝典三个部分。 理论推导主要是贝叶斯的推导以及朴素贝叶斯计算实例。 代码实现包括手动实现朴素贝叶斯和sklearn调用,实例有3个,分别对应离散型诗句和连续型数据两种情况。 面试宝典是一部分《机器学习》中的课后习题和一些面试题。

如果没有躺赢的命,那就站起来奔跑,你的努力一定会对得起这一路的颠沛流离。 2万+

【NLP入门教程】十七、朴素贝叶斯分类器

朴素贝叶斯分类器基于贝叶斯定理,利用特征的条件概率来进行分类。假设有一个样本x=(x₁, x₂, …, xn),其中x₁, x₂, …, xn是特征。朴素贝叶斯分类器的核心思想是假设给定类别C的条件下,特征之间是相互独立的。根据贝叶斯定理,我们可以计算后验概率P(C|x)如下:其中,P©是类别C的先验概率,P(x|C)是在给定类别C的情况下特征x的条件概率,P(x)是特征x的概率。

m0_68629936的博客 653

机器学习笔记07---朴素贝叶斯分类器

朴素贝叶斯分类器

m0_64007201的博客 3944

朴素贝叶斯分类器Naive Bayesian Classifier)及简单的算法实践(识别MNIST手写数字)

文章概述 朴素贝叶斯分类器是基于贝叶斯定理所实现的一种对于数据分类的算法,本文章将先对贝叶斯定理和对于机器学习(数据分类)上的作用进行简单介绍,然后通过代码(python)实现朴素贝叶斯分类器识别MNIST数据集的手写数字。 贝叶斯定理 在机器学习中, 通常为数据(feature),为数据预测的模型(label)。 对于贝叶斯定理每一项的解释: : 先验概率,在观测具体数据前预测某种数据标签(label)的概率。 : 似然值,在预测h下数据的概率。 ...

jeremy0621的博客 7701

贝叶斯分类器朴素贝叶斯分类器Naive Bayesian Classifier,NBC)

根据数据统计每种指标的概率。认为每种指标都是独立的。然后进行分类。 朴素贝叶斯最关键的就是 (强制认为每种指标都是独立的)。

MagicQIT的专栏 2569

Naive Bayesian Classifier 项目常见问题解决方案

Naive Bayesian Classifier 项目常见问题解决方案 1. 项目基础介绍及主要编程语言 该项目是一个用Python编写的简单朴素贝叶斯分类器Naive Bayesian Classifier)。朴素贝叶斯分类器是一种基于贝叶斯定理的简单概率分类器,通常用于文本分类任务,比如垃圾邮件过滤器。这个项目通过统计方法来分类文档,基于文档中的词汇出现频率进行分类。项目的主要编程语言是P...

gitblog_00349的博客 290

机器学习:贝叶斯学习

朴素贝叶斯分类器Naive Bayesian Classifier

每一个不曾起舞的日子,都是对人生的辜负。 653

朴素的贝叶斯分类器Naive Bayesian Classifier

贝叶斯理论是处理不确定性信息的重要工具。作为一种不确定性推理方法,它基于概率和统计理论,具有坚实的数学基础,贝叶斯网络在处理不确定信息的智能化系统中已经得到了广泛的应用,并且成功地用于医疗诊断、统计决策、专家系统等领域。这些成功的应用,充分说明了贝叶斯技术是一种强有力的不确定性推

sulliy的专栏 2万+

Naive Bayesian Classifier

I know nothing but my ignorance. 朴素贝叶斯分类器 贝叶斯公式: P(c∣x)=P(c)P(x∣c)P(x) P(c|x)=\frac{P(c)P(x|c)}{P(x)} P(c∣x)=P(x)P(c)P(x∣c)朴素贝叶斯分类器(naive Bayes classifier) 采用了 “属性条件独立性假设”。基于这种假设,贝叶斯公式可以写成: P(c∣x)...

qq_41736774的博客 315

机器学习笔记之线性分类——朴素贝叶斯分类器(Naive Bayes Classifier)

本节将介绍一个经典的基于线性分类的概率生成模型——朴素贝叶斯分类器(Naive Bayes Classifier)

静静的学习就好 2845

【机器学习】朴素贝叶斯分类器原理(理论+图解)

  简 介:下面是我在学习时候的记录并加上自己的理解。本文意在记录自己近期学习过程中的所学所得,如有错误,欢迎大家指正。   关键词:Python、机器学习、贝叶斯分类器 一、贝叶斯网络 我们都学过贝叶斯公式,就是 p(b∣a)=p(a∣b)p(b)p(a)p(b|a)=\frac{p(a|b)p(b)}{p(a)}p(b∣a)=p(a)p(a∣b)p(b)​,它表明了两个随机变量之间的概率关系,意思是在a条件发生的前提下,b发生的概率为多大。所以我们可以将这个性质利用到我们的建模..

CSDN 精品推荐 3901

机器学习-朴素贝叶斯分类

例如:随着人工智能的不断发展,机器学习这门技术也越来越重要,很多人都开启了学习机器学习,本文就介绍了机器学习的基础内容。提示:以下是本篇文章正文内容,下面案例可供参考优点:1、朴素贝叶斯模型发源于古典数学理论,有着坚实的数学基础,以及稳定的分类效率。2、NBC模型所需估计的参数很少,对缺失数据不太敏感,算法也比较简单。缺点:1、理论上,NBC模型与其他分类方法相比具有最小的误差率。

qq_52233007的博客 2390

朴素贝叶斯分类器Naive Bayes Classifier

尽管它对特征条件独立性的假设在现实世界中很少成立,但朴素贝叶斯仍然在文本分类和情感分析等领域取得了良好的效果。2. 特征提取:将文本样本转换为特征向量表示。4. 计算条件概率:对于每个特征和每个情感类别,计算在该情感类别下该特征出现的条件概率。3. 计算先验概率:根据训练数据集中的标签,计算每个情感类别的先验概率。先验概率指的是在未观察到任何特征的情况下,某个样本属于某个情感类别的概率。5. 预测分类:对于新的文本样本,根据特征向量计算每个情感类别的后验概率,并选择具有最高后验概率的类别作为预测结果。

Yizhibi_CEO的博客 1057

【海量数据挖掘/数据分析】 之 贝叶斯分类算法(朴素贝叶斯分类、贝叶斯分类计算流程、拉普拉斯修正、贝叶斯分类实例计算)

【海量数据挖掘/数据分析】 之 贝叶斯分类算法(朴素贝叶斯分类、贝叶斯分类计算流程、拉普拉斯修正、贝叶斯分类实例计算) 一、 贝叶斯分类器 1 . 贝叶斯分类器 : 2 . 贝叶斯分类器的类型 : 3 . 正向概率 与 逆向概率 : 4 . 贝叶斯公式 : 有两个事件 , 事件 A , 和事件 B ; 二、 贝叶斯分类器处理多属性数据集方案 三、 贝叶斯分类器分类的流程 四、拉普拉斯修正 五、贝叶斯分类器示例 六、 朴素贝叶斯分类器使用 七、 朴素贝叶斯分类的优缺点

仙魁XAN 8526

朴素贝叶斯分类器_机器学习-贝叶斯分类器

目录:1.贝叶斯分类器的基础2.朴素贝叶斯分类器3.朴素贝叶斯分类实例4.关于朴素贝叶斯容易忽略的点5.朴素贝叶斯分类器的优缺点1. 摘要贝叶斯分类器是一类分类算法的总称,这类算法均以贝叶斯定理为基础,故统称为贝叶斯分类器。而朴素贝叶斯分类器是贝叶斯分类器中最简单,也是最常见的一种分类方法。并且,朴素贝叶斯算法仍然是流行的十大挖掘算法之一,该算法是有监督的学习算法,解决的是分类问题。该算法的优点在...

weixin_39639096的博客 1626
上一篇: Python3正则表达式(Python3 Regular Expression)
下一篇: 深度自解码器(Deep Auto-encoder)
蓝色枫魂
博客等级 码龄11年 435粉丝 81原创
评论 39
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值