卡方检验特征选择

SPSS篇—卡方检验 今天依旧跟大家分享一个在SPSS中使用率比较高的分析方法:卡方检验。 在开始做分析之前,我们需要明白两件事情:卡方检验是什么?一般用来干什么?我们只有充分了解分析方法以后才能够正确的使用它。 卡方检验在百科中的解释是:卡方检验是用途非常广的一种假设检验方法,它在分类资料统计推断中的应用,包括:两个率或两个构成比比较的卡方检验;多个率或多个构成比比较的卡方检验以及分类资料的相关分析等。它的原理是... 阅读详情

参考:

https://segmentfault.com/a/1190000003719712

http://blog.csdn.net/shuzfan/article/details/52993427

卡方检验,或称x2检验,是一种常用的特征选择方法,尤其是在生物和金融领域。χ2 用来描述两个事件的独立性或者说描述实际观察值与期望值的偏离程度。χ2值越大,则表明实际观察值与期望值偏离越大,也说明两个事件的相互独立性越弱。

无关性假设

【例1】举个例子,假设我们有一堆新闻标题,需要判断标题中包含某个词(比如吴亦凡)是否与该条新闻的类别归属(比如娱乐)是否有关,我们只需要简单统计就可以获得这样的一个四格表:

组别 属于娱乐 不属于娱乐 合计
不包含吴亦凡 19 24 43
包含吴亦凡 34 10 44
合计 53 34 87  

通过这个四格表我们得到的第一个信息是:标题是否包含吴亦凡确实对新闻是否属于娱乐有统计上的差别,包含吴亦凡的新闻属于娱乐的比例更高,但我们还无法排除这个差别是否由于抽样误差导致。那么首先假设标题是否包含吴亦凡新闻是否属于娱乐是独立无关的,随机抽取一条新闻标题,属于娱乐类别的概率是:(19 + 34) / (19 + 34 + 24 +10) = 60.9%

理论值四格表

第二步,根据无关性假设生成新的理论值四格表:

组别 属于娱乐 不属于娱乐 合计
不包含吴亦凡 43 * 0.609 = 26.2 43 * 0.391 = 16.8 43
包含吴亦凡 44 * 0.609 = 26.8 44 * 0.391 = 17.2 44

显然,如果两个变量是独立无关的,那么四格表中的理论值与实际值的差异会非常小。

x2值的计算

x2的计算公式为:


其中A为实际值,也就是第一个四格表里的4个数据,T为理论值,也就是理论值四格表里的4个数据。

x2用于衡量实际值与理论值的差异程度(也就是卡方检验的核心思想),包含了以下两个信息:

  • 实际值与理论值偏差的绝对大小(由于平方的存在,差异是被放大的)

  • 差异程度与理论值的相对大小

对上述场景可计算x2值为10.01。

卡方分布的临界值

既然已经得到了x2值,我们又怎么知道x2值是否合理?也就是说,怎么知道无关性假设是否可靠?答案是,通过查询卡方分布的临界值表。

这里需要用到一个自由度的概念,自由度等于V = (行数 - 1) * (列数 - 1),对四格表,自由度V = 1

V = 1,卡方分布的临界概率是:


显然10.01 > 7.88,也就是标题是否包含吴亦凡新闻是否属于娱乐无关的可能性小于0.5%,反过来,就是两者相关的概率大于99.5%。

【例2】

比如我们现在有一个生物学问题,我们需要从采样的5个基因 gene1,,gene5 中找到某种疾病的1个致病基因。下表我们分别统计了患病和不患病人群5种基因的出现频率。当我们把一种基因看做一种特征的时候,找到致病基因就可以看做是选择一种特征使得患病-不患病的二分类问题准确率最高。

gene1 gene2 gene3 gene4 gene5
患病 0.73 0.24 0.21 0.54
不患病 0.71 0.26 0.87 0.55

首先,我们做出假设 “患病与gene_x无关”

以gene1为例,分布比较稳定, χ2 值应该比较小,即两事件相互独立性比较强,即假设成立。

再以gene3为例,分布偏差很大, χ2 值应该很大,即两事件相互独立性很弱,即假设不成立,因此最后我们选择gene3作为致病基因。

上述的例子比较简单,也存在一些不合常理的地方,仅仅用于帮助大家理解。

———————— 计算 χ2 值 ————————

接下来我们讲怎样具体地计算 χ2 值。

先直接上公式:

X2(t,c)=et0,1ec0,1(NetecEetec)2Eetec

其中tterm,即某个特征有或无,c:class ,即类别1或0(这里只支持2分类)。N 是观察值, E 是期望值。则 E11 表示出现特征 t 且 类别 c=1

现在,我们以第一节中的 gene3 为例,来计算 χ2 值,当然按照公式我们首先应该计算各种期望和观测值。首先,我们来虚构一个完整的患病-基因数据集。假如我们记录了10个人的gene3出现情况,得到类似于下面的表格:

样本编号 gene3是否出现 是否患病
1 1 0
2 1 0
3 1 1
4 1 0
5 1 0
6 0 1
7 1 0
8 0 1
9 1 0
10 0 1

据此我们可以很容易的计算所有的观测值以及期望值。

首先是观测值

N11=gene3=1

N01=gene3=3

N10=gene3=6

N00=gene3=0

然后是期望值:(因为我们的假设是t和c独立,因此可以直接按照下式计算)

E11=10×P(t=1)×P(c=1)=2.8

N01=10×P(t=0)×P(c=1)=1.2

N10=10×P(t=1)×P(c=0)=4.2

N00=10×P(t=0)×P(c=0)=1.8

代入公式有:

X2(t,c)=(12.8)22.8+(31.2)21.2+(64.2)24.2+(01.8)21.8=6.4286

我们已经得到了 χ2 值,但是这并不够直接明了的说明问题。因此,我们还需要将 χ2 值转化为 p-value。p-value是一种给定原假设为真时样本结果出现的概率,我们可以通过简单查表来进行转化。如下表:自由度=1时的转化表格。(自由度=分类数-1,因此这里自由度=1.)

p-value χ2
0.1 2.71
0.05 3.84
0.01 6.63
0.005 7.88
0.001 10.83

我们的χ2 值为6.4286,转化为p-value约为0.01,意思是假设患病和gene3无关的情况下,只有约0.01的概率会出现这样的样本结果。因此,我们就有约0.99的概率认为原假设错误,则gene3与患病有关。


应用场景

卡方检验的一个典型应用场景是衡量特定条件下的分布是否与理论分布一致,比如:特定用户某项指标的分布与大盘的分布是否差异很大,这时通过临界概率可以合理又科学的筛选异常用户。

另外,x2值描述了自变量与因变量之间的相关程度:x2值越大,相关程度也越大,所以很自然的可以利用x2值来做降维,保留相关程度大的变量。再回到刚才新闻分类的场景,如果我们希望获取和娱乐类别相关性最强的100个词,以后就按照标题是否包含这100个词来确定新闻是否归属于娱乐类,怎么做?很简单,对娱乐类新闻标题所包含的每个词按上述步骤计算x2值,然后按x2值排序,取x2值最大的100个词。

利用卡方检验进行特征选择 1 卡方检验 卡方检验就是统计样本的理论频次和实际频次的吻合程度或拟合优度。卡方值越大,二者偏离程度就越大。卡方值为0,则表明与理论值完全相符。其计算公式如下: 阅读详情

相关推荐

卡方检验(Chi-square test-χ²检验)

统计分析

hgz2020的博客 3万+

特征选择-卡方检验用于特征选择

卡方分布若n个相互独立的随机变量X1X_1、X2X_2、…\ldots、XnX_n,均服从标准正态分布(也称独立同分布于标准正态分布),则这n个随机变量的平方和Q=∑ni=1X2iQ=\sum_{i=1}^nX_i^2构成一个新的随机变量,其分布规律称为卡方分布或χ2\chi^2分布(chi-square distribution),其中参数n为自由度,记为Q∼χ2Q\sim\chi^2。 图片

ldcadai的博客 1万+

机器学习之特征选择-卡方选择

当自由度为1时,卡方分布式一个倾斜的曲线,当自由度逐渐增大是,卡方分布逐步变的平缓。:可以看出当观察值和理论值十分接近的时候,也就是我们做的假设是正确的时候,χ2的值就越趋近于0,也就是说我们计算的偏差越小,那么假设值就越可能是对的,反之偏差值越大,假设值就越不准确。:指的是在特征向量中选择出那些“优秀”的特征,组成新的、更“精简”的特征向量的过程。其中:A 为观察值,E为理论值,k为观察值的个数,最后一个式子实际上就是具体计算的方法了 n 为总的频数,p为理论频率,那么n*p自然就是理论频数(理论值)。

学习中 1408

卡方检验特征选择

卡方检验特征选择中常用的算法之一。 卡方分布(chi-square distribution): 定义:若k个独立的随机变量$z_1,z_2,…,z_k$,且$z_i$~$N(0,1)$(i=1,2,…,k), 则这k个随机变量的平方和$Z=z_1^2+z_2^2+…+z_k^2$为服从自由度为k的卡方分布,记为:$Z$~$x^2(k)$ 卡方分布的期望:$E(x^2)=n$, 方差:$D(...

gengyanpeng's csdn blog 7858

特征筛选方法--卡方检验

卡方检验在一般情况下,卡方检验是针对于离散变量的独立性检验,卡方检验的零假设为两个离散变量相互独立。很明显,如果我们将其用于标签和特征的判别,就能借此判断某特征和标签是不是独立的,如果是,则说明特征对标签的预测毫无帮助。因此在很多时候,卡方检验都是非常重要的剔除无关特征的方法.Step1.提出假设。...

weixin_44820355的博客 3487

python数据分析 - 卡方检验

卡方检验1.卡方检验2.独立性卡方检验与一致性卡方检验2.1 独立性卡方检验2.1.1 python独立性卡方检验2.2 一致性卡方检验3.正态分布卡方检验3.1 python正态分布卡方检验 1.卡方检验 卡方检验也属于假设检验的一种即可以分析一个变量的拟合程度,如拟合优度检验(二项分布、泊松分布和正态分布),即可以分析数据是不是正态分布,在做T检验的时候(前提条件就是数据要符合正态分布)。 还可以用来分析两个变量间的关系:是否相互独立,是否来自一个总体。 2.独立性卡方检验与一致性卡方检验 对于两个变

weixin_42010722的博客 2万+

数据分析之卡方检验

检验某个连续变量的分布是否与某种理论分布相一致。例如是否符合正态分布,均匀分布,Poisson(泊松)分布检验某个分类变量的各类的概率是否等于指定概率检验某两个分类变量是否 相互独立检测两种方法的检测结果是否一致检测控制某种或某几种的变量后,另外两个分类变量是否相互独立。............

当我把这件事情做出来的时候,我想要的东西就已经拿到了 4万+

卡方检验

  1.卡方检验概念 1)卡方检验是一种用途很广的计数资料的假设检验方法,由卡尔·皮尔逊提出。 (1)它属于非参数检验的范畴,主要是比较两个及两个以上样本率( 构成比)以及两个分类变量的关联性分析。 (2)其根本思想就是在于比较理论频数和实际频数的吻合程度或拟合优度问题。 (3)卡方值描述两个事件的独立性或者描述实际观察值与期望值的偏离程度。卡方值越大,表名实际观察值与期望值偏离越大,也说明两个事件的相互独立性越弱。 2)在分类资料统计推断中的...

gengjuan520的博客 3万+

卡方检验详解分析与实例

1.什么是卡方检验 卡方检验是一种用途很广的假设检验方法,属于非参数检验的范畴。 主要是比较两个或两个以上样本率以及两个分类变量的关联性分析。 根本思想是在于比较理论频次与实际频次的吻合程度或拟合优度问题。 (以上简介来自网络相关文档) 2.什么是卡方分布 卡方分布(chi-square distribution,χ2\chi ^2χ2-distribution)是概率统计中常用的一个分布。k个独立的标准正态分布变量的平方和服从自由度为k的卡方分布,即 X=∑i=1kZi2X = \sum_{i=1}^k

bitcarmanlee的博客 5万+

什么是卡方检验

卡方检验,统计学的方法,现在机器学习看变量的时候也会用到。 很多不知道的人,一听到这个名词,会马上联想到, 啊?还要拿张卡来检验吗? 其实卡方检验是英文Chi-Square Test 的谐音。在大数据运营场景中,通常用在某个变量(或特征)值是不是和应变量有显著关系。 我常听到运营和分析师这样的对话, 分析师:“这个变量我做了卡方检验了,不显著,所以我没有放进模型。” 这时候,你要是仔细观察运营经理的话,他们很多人其实是不明白的,有些好学的会直接问什么是卡方检验,有些要面子,会偷偷百度一下什么是卡方

黑马程序员官方博客 6516

【Python】卡方检验

卡方检验是一种用途很广的计数资料的假设检验方法,属于非参数检验范畴。这种检验方法主要用于推断两个总体率之间有无差别、多个总体率之间有无差别、多个样本率之间的多重比较、两个分类变量之间有无关联性和频数分布拟合优度的检验等。某研究者欲比较膳食干预(实验组)和普通健康教育(对照组)对糖尿病患者血糖的控制达标情况,将171例糖尿病患者随机分为两组,干预6个月后结果如下。卡方分布:n个独立分布(标准正态分布)的变量的平方和服从自由度为n的卡方分布。即n个独立的标准正态随机变量的总和Y服从具有n个自由度的卡方分布。

missinghead的博客 6033

一文详解 如何用 R 语言进行卡方检验

本篇文章主要介绍如何用R语言进行 卡方检验,将按以下顺序进行介绍。 一、卡方检验基本概念 1、基本原理:卡方检验就是统计样本的实际观测值与理论推断值之间的偏离程度,实际观测值与理论推断值之间的偏离程度就决定卡方值的大小,如果卡方值越大,二者偏差程度越大;反之,二者偏差越小;若两个值完全相等时,卡方值就为0,表明理论值完全符合。 注意:卡方检验针对分类变量。 2、常见用途:检验两个变量之间是否有关系,比如机器学习中的特征选择,以及医学领域(这块我不了解~~)。 3、计算公式: 3.1通用公式: obser

weixin_44298740的博客 4万+

R语言卡方检验最全总结

完美观看体验请至公众号查看本文。,专注R语言在临床医学中的使用,R语言数据分析和可视化。卡方检验/列联表资料的卡方检验在临床中非常常见!因为最近又有一批临床数据要进行统计,所以趁机把卡方检验的R语言实现再重新梳理一遍。这篇文章涵盖了。课本电子版和配套数据已上传到QQ群,需要的朋友加群下载即可。

医学和生信笔记的博客 1万+

SPSS卡方检验结果解读详解

卡方检验(Chi-Square Test)是由Pearson提出的一种统计方法,在一定的置信水平和自由度下,通过比较卡方统计量和卡方分布函数概率值,判断实际概率与期望概率是否吻合,通过比较理论概率和实际概率的吻合程度,可检验两个分类变量的相关性。用户可利用SPSS软件方便的完成卡方检验,在SPSS软件中,默认H0成立,即观察频数和实际频数无差别,即两组变量相互不产生影响,两组变量不相关,如果检验P值很高,则假设检验通过;如果检验P值很低,则检验不通过,观察频数和实际频数有差别,两组变量相关。SPSS数据检验

nekonekoboom的博客 8万+

SPSS步骤|卡方检验详细操作和结果分析

卡方检验是很常用的一种分析方法,什么情况下使用卡方检验? 如果你手上的数据是一种定类数据,比如性别(男、女)是否患病(是、否)。你还想要分析定类数据和定类数据之间的差异关系。 例如想要分析性别和是否抽烟之间的关系。这一句话里面包含两个词语,分别是:性别,是否抽烟。性别为X,是否抽烟为Y。性别为定类数据,是否抽烟也是定类数据,此时就可以使用卡方检验。 这篇文章分享分别使用两种常见统计分析工具SPSS和SPSSAU完成卡方检验。SPSS是目前常用的统计软件,SPSSAU是更简单的在线数据科学分析工具

m0_37228052的博客 13万+
上一篇: Word2Vec小结
下一篇: 图像纹理复杂度计算
code_caq
博客等级 码龄10年 112粉丝 58原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值