【干货】《基础统计学》(第8章):假设检验

目录

1 假设检验的基础

1.1 假设检验的基本方法

1.2 第一类错误和第二类错误

1.3 统计功效

2 总体比例的假设检验

2.1 正态近似法

2.2 精确法

3 总体均值的假设检验

3.1 总体标准差未知时总体均值的假设检验

3.2 总体标准差已知时总体均值的假设检验

4 总体标准差或方差的假设检验

5 重采样法的假设检验


1 假设检验的基础

1.1 假设检验的基本方法

定义:

  • 在统计学中,假设是一个关于总体性质的命题

  • 假设检验(也被称为显著性检验)是检验关于总体某个性质的某个命题的过程

1. 假设检验步骤:

2. 步骤1~3:通过原命题,建立原假设和备择假设

定义

  • 原假设(也被称为零假设,用H_0表示):总体参数(如比例、均值或标准差)等于某个特定值的假设

  • 备择假设(用H_1H_aH_A表示):参数值与原假设不同的假设,备择假设的表达式必须使用>、<或\neq符号中的一个

3. 步骤4:选择显著性水平

定义

  • 假设检验的显著性水平 α 是一个用作判断界限的概率,该界限用来确定样本何时具有能够显著推翻原假设的证据;根据其性质,显著性水平 α 是原假设为真时,错误地拒绝原假设的概率:

显著性水平 α =P(拒绝H_0|H_0为真)

α 的取值通常为0.05、0.01或0.10,最常见的是0.05

4. 步骤5:选择检验统计量并判断样本分布(如正态分布、t分布、卡方分布)

5. 步骤6:先求检验统计量,再求 p值或临界值

检验统计量提供了对样本统计量与原假设下总体参数之间差值的度量;对于比例来说,检验统计量是样本比例和原假设下总体比例之间差值的度量

定义

  • 检验统计量是一个用于判断原假设的值;当假设原假设为真时,可以通过将样本统计量转换为对应的分数(如 z、t或\chi^2)来计算检验统计量

在确定 p 值和临界值之前,需要先判断该假设检验是双侧检验、左侧检验还是右侧检验

(1)双侧/左侧/右侧

定义:

  • 临界域(或拒绝域)是指可以拒绝原假设的所有检验统计量所在的区域

取决于假设检验的类型,临界域可以在双侧、左侧或右侧

  • 双侧检验:临界域在曲线下的两侧

  • 左侧检验:临界域在曲线下的左侧

  • 右侧检验:临界域在曲线下的右侧

(2)p 值法

可以通过比较 p 值和显著性水平对假设检验做出判断

定义

  • 在假设检验中,p 值是当假设原假设为真时,得到至少与实际样本的检验统计量一样极端的检验统计量的概率

为了求 p值,首先需要找到分布中超出检验统计量的面积,然后遵循以下步骤:

  • 临界域在左侧:p值=检验统计量左侧的面积

  • 临界域在右侧:p值=检验统计量右侧的面积

  • 临界域在两侧:p值=超出检验统计量面积的2倍

(3)临界值法

可以通过比较临界值和检验统计量对假设检验做出判断

定义

  • 在假设检验中,分开临界域(拒绝域)和非临界域的数值被称为临界值

临界值的确定取决于原假设、抽样分布以及显著性水平 α

6. 步骤7:做出拒绝或者不能拒绝原假设$$H_0$$的判断

(1)p 值法的判断标准

  • 当p值≤ α 时,拒绝H_0

  • 当p值> α 时,不能拒绝H_0

(2)临界值法的判断标准

  • 当检验统计量在临界域内时,拒绝H_0

  • 当检验统计量不在临界域内时,不能拒绝H_0

7. 步骤8:非技术用语的总结

假设检验总结模板:

8. 假设检验的置信区间法

总体参数的置信区间估计包含该参数的可能值;如果置信区间不包含原假设的总体参数值,则拒绝原假设

对于双侧检验,构建置信水平为1- α 的置信区间,而对于显著性水平为 α 的单侧检验,则构建置信水平为1- 2α 的置信区间

等价方法

在某些情况下,基于置信区间得出的结论可能与其他两个方法得出的结论不同

从是否能够得出相同结论的角度来讲,p值法和临界值法是等价的

1.2 第一类错误和第二类错误

第一类错误(弃真错误):

当原假设为真时,拒绝原假设的错误,使用 α 表示犯第一类错误的概率

α =P(第一类错误)=P(拒绝$$H_0$$|$$H_0$$为真)

第二类错误(存伪错误):

当原假设为假时,没有拒绝原假设的错误,使用 β 表示犯第二类错误的概率。

β =P(第二类错误)=P(没有拒绝$$H_0$$|$$H_0$$为假)

对第一类错误和第二类错误的控制:

假设检验标准步骤中的步骤4是选择显著性水平 α (如0.05),即犯第一类错误的概率; α 、 β 的值和样本量 n 都是相关的,也就是说,如果确定其中的任意两个,那么第三个将被自动确定(通常还需要一个总体参数的估计值,才能确定 β )

  • 考虑并比较第一类错误和第二类错误的严重性

  • 一种常见的做法是选择显著性水平 α 和一个可行的样本量,就可以自动确定 β

  • 如果降低 α 和 β 的概率是最重要的,那么就选择相应的 α 和 β 的值,然后可以自动确定样本量 n

1.3 统计功效

β 是当原假设为假时,没有拒绝原假设的概率,即 β =P(第二类错误);因此,1- β 是正确拒绝原假设的概率;1- β 也是假设检验有效性的一种度量方式

定义

统计功效(检验功效)是当原假设为假时,正确拒绝原假设的概率,即1- β ;计算统计功效可以通过以下两个变量:①显著性水平 α ;②总体参数的估计值,该值不能等于原假设中的总体参数值

由于统计功效的确定需要一个总体参数估计的真实值来替代原假设中的总体参数值1- β ,因此统计功效取决于该估计的真实值

统计功效的计算比较复杂,建议使用统计软件

2 总体比例的假设检验

2.1 正态近似法

等价方法

在进行总体比例的假设检验时,从是否能够得出相同结论的角度来说,p 值法和临界值法是等价的,置信区间法与这两者都不等价(p值法和临界值法使用的都是原假设中比例p的标准差,而置信区间法使用的是样本比例的标准差),因此,置信区间法可能会得到不同的结论

建议:使用p 值法或临界值法来进行假设检验,而使用置信区间法来估计总体比例

总体比例的假设检验(正态近似法)

目标:总体比例 p的假设检验

条件:

  • 样本为简单随机样本

  • 满足二项分布的所有条件:有固定的试验次数;试验之间相互独立;结果有且仅有两种可能;每次试验的概率不变

  • 同时满足条件 np≥5 和 nq≥5,以确保样本比例的二项分布能够用正态分布近似,即\mu = np\sigma = \sqrt{npq}

检验统计量:

z=\frac{\hat p-p}{\sqrt{\frac{pq}{n}}}

其中 p 值和临界值取自统计软件或统计表

2.2 精确法

精确法不要求 np≥5 和 nq≥5

精确法:假设已知样本量 n、成功次数 x,以及原假设中的总体比例 p,利用统计软件求解二项分布的概率,其总和即为p值

  • 左侧检验:p值=P(在n次试验中,x 或更少的成功次数)

  • 右侧检验:p值=P(在n次试验中,x或更多的成功次数)

  • 双侧检验:p值=2・min(左侧值,右侧值)

双侧检验的精确法并没有统一的方法

改进精确法:对精确法的一个批评是认为其过于保守,因为犯第一类错误的实际概率小于或等于 α,也可能远远小于 α

在精确法中,犯第一类错误的实际概率小于或等于 α,而 α 是犯第一类错误的预期概率

连续性校正:通过对 p值做出调整来改进精确法,该调整是从原 p 值中减去边界上二项概率的一半

精确法的连续性校正

  • 左侧检验:p值=P(x或更少)-1/2 P(x)

  • 右侧检验:p值=P(x或更多)-1/2 P(x)

  • 左侧检验:p值=2・min(左侧值,右侧值)

3 总体均值的假设检验

3.1 总体标准差未知时总体均值的假设检验

等价方法

对于本节中的 t 检验,从是否能够得出相同结论的角度来讲,p 值法、临界值法和置信区间法是等价的

1. \sigma未知时总体均值的假设检验

目标:关于总体均值\mu的假设检验

条件:

  • 样本为简单随机样本

  • 总体服从正态分布或 n>30

检验统计量:

t = \frac{\bar x-\mu_{\bar x}}{\frac{s}{\sqrt{n}}}

p 值和临界值通过统计软件或查df=n-1表可得到

当总体服从正态分布或 n>30的条件不满足时使用的其他方法

本方法需要满足以下两个条件:①样本是简单随机样本;②总体服从正态分布或n>30

如果仅仅是第2个条件不被满足,那么可以使用以下方法:

  • 自助重采样法:通过该方法可以构建用于估计总体参数的置信区间,然后可以根据该置信区间来进行假设检验的判断

  • 置换检验:大意是通过对样本数据的重采样来模拟原假设下的总体参数值,重采样后的数据有助于判断样本统计量是否与原假设的参数值一致

  • 符号检验

  • 威尔科克森符号秩检验

3.2 总体标准差已知时总体均值的假设检验

很少会出现\mu未知,但\sigma已知的情况

$$\sigma$$已知时总体均值的假设检验

条件:

  • 样本为简单随机样本

  • \sigma已知

  • 总体服从正态分布或 n>30

检验统计量:

z=\frac{\bar x-\mu_{\bar x}}{\frac{\sigma}{\sqrt{n}}}

p 值和临界值通过统计软件或查表可得到

4 总体标准差或方差的假设检验

1. 总体标准差或方差的假设检验

目标:总体标准差\sigma或方差\sigma^2的假设检验

条件:

  • 样本为简单随机样本

  • 总体必须服从正态分布

检验统计量:

\chi^2=\frac{(n-1)s^2}{\sigma^2}(保留3位小数)

p 值和临界值通过统计软件或查df=n-1表可得到

等价方法

在进行总体标准差或方差的假设检验时,从是否能够得出相同结论的角度来讲,p值法、临界值法和置信区间法是等价的

2. 当总体为非正态分布时使用的替代方法

本方法需要满足两个条件:①样本为简单随机样本;②总体服从正态分布

如果样本数据不是随机采集的,则本方法不适用;如果样本来自非正态分布的总体,则可以使用假设检验的置信区间法,但使用自助重采样法得到置信区间,也可以使用置换检验

5 重采样法的假设检验

当某些条件不能得到满足时,通常可以使用重采样法,即使用统计软件对原始样本数据进行多次“重采样”

即使在满足所有条件的情况下,重采样法也可以与其他方法一起使用,以提供对数据的额外视角

运用两种或多种不同的方法来达到“整体统计”的目的是可取的,重采样法可以作为一个很好的“第二意见”

1. 重采样法的有效性

重采样法优势:

  • 对数据的分布没有要求,如没有要求数据必须来自正态分布的总体

  • 没有最小样本量的要求

两种重采样法:

  • 自助法:自助重采样法用于构建置信区间,该置信区间可被用于总体参数的假设检验

  • 置换检验:置换检验作为另一种重采样法,用于假设检验

自助法对同一原始数据进行重采样,而置换检验要求对样本数据进行修改,使其与原假设一致

2. 置换检验

定义:

置换检验是一种假设检验的方法,该方法会先修改样本数据使其与原假设中的总体参数一致,然后有放回地重采样

“至少一样极端”的标准:

以下是针对均值的“至少一样极端”的标准,但比例或标准差也适合使用相同的标准

在以下标准中,\bar{x}是原始样本均值,\mu是原假设中的总体均值,“值”指的是每次重采样的样本均值

  • 左侧检验:至少和\bar{x}一样极端的值要小于或等于\bar{x}

  • 右侧检验:至少和\bar{x}一样极端的值要大于或等于\bar{x}

  • 双侧检验:计算d=|\bar x-\mu|,至少和\bar{x}一样极端的值要小于或等于(\mu-d),或者大于或等于(\mu+d)

需要重采样多少次?

一般应该至少重采样1000次,统计学家或相关从业人员通常要重采样1万次或以上

【往期回顾】

【干货】《基础统计学》(第3章):描述与探索数据

【干货】《基础统计学》(第5/6章):离散概率分布和正态分布

【干货】《基础统计学》(第7章):参数估计和样本量确定

人工智能

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值