探索性数据分析方法

本文还有配套的精品资源,点击获取 menu-r.4af5f7ec.gif

第3章 经验分布与探索性数据分析

3.1. 背景

统计思想在气象学和气候学中的一个非常重要的应用就是理解一组新数据。最终目标是洞察生成这些数字背后的过程。如第1章所述,支撑业务和研究工作的气象观测系统和计算机模型产生了大量的数值数据。其中许多大型数据集都可以通过互联网轻松获取,例如在以下网站:www.ncdc.noaa.gov、www.ecmwf.int/en/forecasts/datasets、www.data.gov和www.data.gov.uk。即使处理的是相对较小的数据集,仅初步了解一批新数字并开始对其形成一定认识也可能是一项重要任务。

广义上讲,这项活动被称为探索性数据分析,或EDA。自图基(1977)出版了同名的开创性且非常易读的著作以来,EDA的系统化使用大幅增加。EDA方法大量借助各种图形工具,以帮助分析人员理解可能面对的大批数字。图形是压缩和总结数据的有效手段,能在较小空间内呈现大量信息,并揭示数据集中的异常特征。有时,异常的数据点源于记录或转录错误,尽早发现这些问题十分有益。有时这些异常数据是有效的,甚至可能成为数据集中最有趣且信息量最大的部分。

许多探索性数据分析方法最初设计为通过纸笔手工应用于小型(最多约200个数据点)数据集。现代计算能力极大地拓宽了统计图形的应用范围,现在可以轻松获得各种各样的统计图形(例如,R Development Core Team,2017;特乌斯和乌尔班内克,2009)。

3.1.1. 稳健性与抗扰性

许多经典统计方法在满足关于数据性质的严格假设时效果最佳。例如,通常假设数据将遵循熟悉的高斯分布(第4.4.2节)的钟形曲线。如果所应用的数据不满足这些假设,经典方法可能会表现得很差(即产生相当误导性结果)。

经典统计学的假设并非出于无知,而是出于必要性。在统计学以及其他领域中,采用简化假设使得研究得以取得进展。通过推导出优雅的解析结果,这些结果是相对简单但功能强大的数学公式。与许多定量领域的 情况一样,廉价计算能力的出现使数据分析人员不再完全依赖于这类结果,因为允许采用假设条件不那么严格的替代方法变得切实可行。这并不意味着经典方法已不再有用。然而,在使用经典方法之前,更容易检验给定的数据集是否满足特定的假设,并且在经典方法可能不适用的情况下,存在计算上可行的良好替代方案。

探索性数据分析方法的两个重要特性是稳健性和抗干扰性。稳健性与抗扰性体现了对数据集性质假设的敏感性降低。一种稳健方法在任何特定情况下不一定是最优的,但在大多数情况下表现合理。例如,如果已知一组数据服从高斯分布,则样本均值是对该数据集中心的最佳刻画。然而,如果这些数据明显不服从高斯分布(例如,它们是极端降雨事件的记录),则样本均值可能会对该数据集中心产生误导性的刻画。相比之下,稳健方法通常对数据整体性质的具体假设不敏感。

抗干扰方法不会受到少量离群值或“异常数据”的过度影响。如前所述,这些点经常由于各种错误而在一批数据中出现。即使有小部分数据值发生了剧烈变化,抗干扰方法的结果也几乎不会改变。样本均值不仅不具备稳健性,也不是数据集中心位置的抗干扰度量。考虑一个小的数据集{11, 12, 13, 14, 15, 16, 17, 18, 19},其平均值为15。然而,如果由于录入错误得到了数据集{11, 12, 13, 14, 15, 16, 17, 18, 91},则使用样本均值表征的数据“中心”(错误地)变为23。相比之下,对于本例中将“91”替换“19”的情况,后续将介绍的一些关于一批数据中心位置的稳健度量几乎不会发生变化或完全不变。

3.1.2. 分位数

许多常见的汇总统计量依赖于选定的样本分位数(也称为分数位)。分位数和分数位本质上等同于更为熟悉的术语“百分位数”。样本分位数 qp 是一个具有与数据相同单位的数值,其超过数据中由下标 p 所给出的比例,其中 0<p <1。样本分位数 qp 可以大致解释为:该值预期将以概率 p 超过从数据集中随机选择的一个成员。等价地,样本分位数 qp 可被视为数据集的第 p × 100 百分位数。

确定样本分位数需要先将一批数据按顺序排列。手工对小数据集进行排序问题不大。较大数据集的排序最好通过计算机完成。历史上,排序步骤是稳健和抗干扰方法应用于大型数据集时的主要瓶颈。如今,可以轻松地使用台式计算机上的电子表格或数据分析程序,或通用计算例程集合中的多种排序算法之一来完成排序(例如,普雷斯等,1986)。

来自特定样本的已排序或排了名次的数据值称为该样本的顺序统计量。给定一个数据集 {x1 , x2 , x3 , x4 ,x5 ,…, xn},该样本的顺序统计量就是将这些相同的数字按升序排列。这些已排序的值通常用带括号的下标表示,即集合 {x( 1 ), x( 2 ), x( 3 ), x( 4 ), x( 5 ), …, x(n)}。其中,n个数据值中第i小的数据值记为 x( i )。

某些样本分位数在数据的探索性总结中使用得尤为频繁。最常用的是中位数,即q0.5或第 50百分位数。它表示位于数据集中心的值,意味着有相等比例的数据落在该值的上方和下方。

如果数据集包含奇数个数值,则中位数就是中间顺序统计量。然而,如果数值个数为偶数,则数据集有两个中间值,此时中位数通常取这两个中间值的平均值。形式上,

$$
q_{0.5} =
\begin{cases}
x_{(n+1)/2}, & \text{n 为奇数} \
\frac{x_{(n/2)} + x_{(n/2 + 1)}}{2}, & \text{n 为偶数}
\end{cases}
$$

四分位数(quartiles)、q0.25和q0.75,其使用频率几乎与中位数一样高。通常称它们分别为下四分位数(LQ)和上四分位数(UQ)。它们的位置位于中位数q0.5与极值x(1)和x(n)之间的一半处。按照图基(1977)富有表现力的术语,Tukey(1977)将 q0.25 和 q0.75 称为“铰链”(hinges),形象地想象数据集首先在中位数处折叠,然后再在四分位数处折叠。因此,四分位数就是由 q0.5 到极值之间的两个半数 据集各自的中位数。如果样本量 n 为奇数,则每个半数据集包含 (n+1)/2 个点,且均包含中位数;如果 n 为偶数,则每个半数据集包含 n/2 个点,且互不重叠。上三分位数和下三分位数 q0.333 与 q0.667 将数据集划分为三部分,尽管有时“三分位数”一词也用来指这样划分出的三个等大小数据子集中的任意一个。

其他一些常被命名使用的分位数还包括:四个五分位数 q0.2、q0.4、q0.6 和 q0.8;八个八分位数 q0.125、q0.375、q0.625 和 q0.875(除四分位数和中位数外);以及九个十分位数 q0.1、q0.2、…、q0.9。

例3.1 常见分位数的计算

如果一批数据中有 n 个数据值,则中位数为 q0.5=x(5),或九个中的第五大。下四分位数为 q0.25=x(3),上四分位数为 q0.75=x(7)。

如果样本量n=10,中位数是两个中间值的平均值,四分位数分别是数据上半部分和下半部分的单个中间值。即q0.25, q0.5和q0.75分别为x(3)、[x(5)+x(6)]/2和x(8)。

如果样本量n=11,则存在唯一的中间值,但四分位数是通过对数据的上半部分和下半部分的两个中间值取平均值得到的。即q0.25、q0.5和q0.75分别为[x(3)+x(4)]/2、x(6)和[x(8)+x(9)]/2。

当样本量 n 时,四分位数和中位数均由成对中间值取平均值得出;q0.25、q0.5 和 q0.75 分别为 [x(3) + x(4)]/ 2,[x(6) +x(7)]/2 和 [x(9) +x(10)]/2。

估计中位数和四分位数之外的分位数需要使用更复杂的公式,有多种选择可用(Hyndman and Fan, 1996)。

3.2. 数值汇总度量

一些简单且具有稳健性和抗干扰性的数值汇总度量可用于数据分析,无需依赖手工绘图或计算机图形功能。这些度量通常是在面对一组新的、不熟悉的数据时首先计算的量。接下来的三个小节将分别描述关于位置、离散程度和对称性的数值汇总度量。位置指的是数据值的集中趋势或总体量级。离散程度表示数据值围绕中心的变异或离散度的程度。对称性描述了数据值在其中心周围分布的平衡性。非对称数据往往在高值侧(具有长右尾)或低值侧(具有长左尾)表现出更大的扩散。这三种类型

3.2.1. 位置

中位数 q0.5 是最常用的稳健且抗干扰的集中趋势度量。再次考虑数据集 {11, 12, 13, 14, 15, 16, 17, 18, 19},其中中位数和均值均为 15。如果如前所述,“19”被错误地替换为“91”,则均值

$$
\bar{x} = \frac{1}{n}\sum_{i=1}^{n} x_i
$$

(=23) 受到极大影响,说明其对离群值缺乏抗干扰性。中位数在这种常见的数据错误下保持不变。

三均值是一种稍微复杂的关于位置的度量,它考虑了更多关于数据大小的信息。它是中位数和四分位数的加权平均,其中中位数的权重是每个四分位数权重的两倍:

$$
\text{Trimean} = \frac{q_{0.25} + 2q_{0.5} + q_{0.75}}{4}
$$

截尾均值是另一种抗干扰的位置度量,通过去掉数据分布两端指定比例的最大值和最小值观测值,从而降低其对离群值的敏感性。如果在数据分布的每一端去掉的观测值比例为 α,则该 α‐截尾均值为

$$
\bar{x} \alpha = \frac{1}{n - 2k} \sum {i=k+1}^{n-k} x_{(i)},
$$

其中k是乘积 αn的整数舍入值,表示从每一尾部“截去”的数据值数量。当 α=0时,截尾均值退化为普通均值(公式3.2)。

有关描述位置的其他方法,可参见 Andrews 等人 (1972), Goodall(1983), Rosenberger 和 Gasko (1983) 以及 图基(1977)。

3.2.2. 离散程度

四分位距 (IQR) 是最常见的稳健且抗干扰的离散程度(也称为离散度或尺度)度量。IQR 就是上下四分位数之间的差值:

$$
\text{IQR} = q_{0.75} - q_{0.25}
$$

四分位距是衡量数据集中部离散程度的良好指数,因为它直接指定了中间50%数据的范围。由于它忽略了上下各25%的数据,因此对离群值具有较强的抗干扰性。这一量有时也称为第四散布。

值得将四分位距与数据集尺度的传统度量——样本标准差进行比较

$$
s = \sqrt{\frac{1}{n-1} \sum_{i=1}^{n} (x_i - \bar{x})^2}
$$

样本标准差的平方,s²,被称为样本方差。由于公式3.6中包含平方根,标准差与基础数据具有相同的物理量纲。标准差既不稳健也不抗干扰。它几乎等于数据点与其样本均值之间的平均平方差的平方根。(之所以用n−1而不是n进行除法运算,通常是为了补偿这样一个事实:样本均值下的xi通常比总体真实均值更接近其样本均值;通过n− 1进行除法运算恰好抵消了样本标准差在平均意义上偏小的趋势。)即使出现一个极大数据值,也会产生显著影响,因为它距离均值特别远,而这种差值会在平方过程中被进一步放大。再次考虑集合 {11, 12, 13, 14, 15, 16, 17, 18, 19},其样本标准差为 2.74,但如果“19”被错误地替换为“91”,则样本标准差将大幅上升至 25.6。显然,在这两种情况下,四分位距=4。

四分位距非常容易计算,但它确实存在一个缺点,即没有充分利用大部分数据。中位数绝对偏差(MAD)是一种更为完整且仍较为简单的替代方法。可以通过想象变换 $y_i = |x_i - q_{0.5}|$ 来最直观地理解 MAD。每个变换后的值 $y_i$ 是相应原始数据值与中位数之间差值的绝对值。然后,MAD 就是这些变换后的(yi)值的中位数:

$$
\text{MAD} = \text{median}(|x_i - q_{0.5}|)
$$

尽管这一过程乍一看可能显得有些复杂,但稍加思考就会发现,它类似于标准差的计算,但使用了不强调离群数据的操作。这里从每个数据值中减去的是中位数(而非均值),通过绝对值操作(而非平方)去除任何负号,然后通过这些绝对值差值的中位数(而非均值)来确定其中心位置。

截尾方差是更为复杂的离散程度度量。其思想与截尾均值(公式3.4)类似,即忽略一部分最大值和最小值后,计算样本方差的对应量(公式3.6的平方)

$$
s_\alpha^2 = \frac{1}{n - 2k} \sum_{i=k+1}^{n-k} (x_{(i)} - \bar{x}_\alpha)^2
$$

同样,k是距离 αn 最近的整数,并对一致截尾均值的平方偏差(公式 3.4)进行平均。截尾方差有时会乘以一个调整因子,以使其与普通样本方差更一致,s 2(格雷德尔和克莱纳,1985)。

其他离散程度的度量可参见 霍斯金(1990)和 伊格尔维茨(1983)。

3.2.3. 对称性

样本偏度系数是衡量一批数据对称性的传统基于矩的度量,

$$
\gamma = \frac{\frac{1}{n-1} \sum_{i=1}^{n} (x_i - \bar{x})^3}{s^3}
$$

该统计量既不稳健也不抗干扰。分子类似于样本方差,不同之处在于它是关于均值的立方偏差的平均值。因此,样本偏度系数对离群值比标准差更敏感。为了标准化和无量纲化偏度系数,分子中的平均立方偏差除以样本标准差的立方,从而使不同数据集之间的偏度比较更有意义。

请注意,将数据值与其均值之间的差值进行立方运算可以保留这些差值的符号。由于差值被立方,距离均值最远的数据值将在方程3.9分子的和中占主导地位。如果有少数极大数据值,则样本偏度往往为正。因此,具有长右尾的数据批次被称为右偏或正偏。在物理上被限制在最小值以上的数据(例如降水量或风速,两者都必须是非负的)通常呈正偏。相反,如果存在一些非常小(或大的负值)的数据值,它们会远低于均值。此时,方程3.9分子中的和将由几个大的负项主导,因此样本偏度系数往往为负。具有长左尾的数据被称为左偏或负偏。对于基本对称的数据,偏度系数将接近于零。

尤尔‐肯德尔指数,

$$
\gamma_{YK} = \frac{(q_{0.75} - q_{0.5}) - (q_{0.5} - q_{0.25})}{\text{IQR}} = \frac{q_{0.25} - 2q_{0.5} + q_{0.75}}{\text{IQR}}
$$

是样本偏度的一个稳健且抗干扰的替代方法。它通过比较中位数与两个四分位数之间的距离来计算。如果数据在中间50%的部分呈现右偏,则从中位数到上四分位数的距离将大于到下四分位数的距离。在这种情况下,尤尔‐肯德尔指数将大于零,这与通常将右偏视为正偏的习惯一致。如果正偏度足够强,使得q0.25=q0.50,则 γYK=1。相反,左偏数据的特征是尤尔‐肯德尔指数为负值,如果负偏度足够强,使得q0.75=q0.50,则 γYK=−1。类似于公式3.9,除以四分位距可以对 γYK进行无量纲化(即以一种使物理量纲如米或毫巴相互抵消的方式进行尺度变换),从而提高其在不同数据集之间的可比性。

偏度的其他度量方法可参见 布鲁克斯和卡鲁瑟斯(1953)和 霍斯金(1990)。

3.2.4. 峰度

扩展公式 3.9 并通过增加指数得到峰度系数峰度,

$$
\kappa = \frac{\frac{1}{n-1} \sum_{i=1}^{n} (x_i - \bar{x})^4}{s^4} - 3
$$

尽管这一汇总统计量通常被描述为反映数据分布的“平坦度”或“峰度”,但它实际上是衡量分布尾部相对于分布中心的权重(威斯特法尔,2014)。当 κ>0时的分布称为尖峰的,其具有相对较重的尾部。当 κ<0时的分布称为低峰的,其具有相对较轻的尾部。公式3.11中减去 3是一种惯例,以便与

高斯或钟形曲线分布的峰度进行比较,对于该分布有 κ=0。因此,公式3.11也常被称为超额峰度。

3.3. 图形摘要工具

数值汇总度量计算起来快速简便,易于展示,但只能表达少量细节。此外,它们的视觉冲击有限。为探索性数据分析设计的图形显示只需稍多一点 effort 即可生成。

3.3.1. 茎叶图

茎叶图是一种非常简单但有效的工具,用于生成新数据集的整体视图。同时,它使分析人员能够初步接触各个数据值。在其最简单的形式中,茎叶图根据数据值除最低有效数字外的其余部分对数据进行分组。这些值按升序或降序写在竖线左侧,构成“茎”。每个数据值的最低有效数字则写在竖线右侧,与其所属的较高位数字在同一行。这些最低有效数字构成“叶”。

示意图0

图3.1a展示了表A.1中1987年1月伊萨卡最高温度的茎叶图。数据值以整数度数表示,范围从9°F到53°F。除最低有效数字外的所有数字即为十位数的度数,写在竖线左侧。该图通过逐个遍历数据值,并将其最低有效数字写在相应行上来构建。例如,1月1日的温度是33°F,因此第一个绘制的“叶”是在30多度这一茎上的第一个“3”。2月1日的温度是32°F,因此在1月1日刚绘制的“3”的右侧写上一个“2”。

对于这个特定的数据集,最初的茎叶图有些拥挤,因为大多数值都集中在20多和30多。在这种情况下,可以通过构建第二个图来获得更好的分辨率,如图3.1b所示,其中每个茎被拆分,仅包含0–4或5–9的值。有时会出现相反的问题,初始图过于稀疏。在这种情况下(如果有至少三位有效数字),可以重新绘图,茎标签省略最低的两位有效数字。也可以使用较宽松的分组方式。无论是否需要拆分或

示意图1

合并茎后,将叶值按已排序的方式重写显示会很有用,如图3.1b中所示。

茎叶图非常类似于将数据的直方图侧放后快速绘制出的图形。在图3.1中,例如,可以看出这些温度数据大致是对称的,大多数值落在二十多和三十出头的范围内。此外,对叶值进行排序还有助于提取感兴趣的分位数。在这种情况下,从图3.1b 的极值向内计数很容易发现,中位数为30,两个四分位数分别为26和33。

有时会出现一个或多个离群数据点,这些数据点远离数据集的主体部分。与其绘制许多空白的茎,通常更方便的做法是在展示图的上端和/或下端单独列出这些极端值,如图3.2所示。

该图显示的是风速数据,单位为千米每小时(km/h),精确到十分之一。仅在图表顶部和底部列出两个极大值和两个静风值,就使展示长度减少了超过一半。可以明显看出,数据强烈向右偏斜,这在风速数据中经常出现。

示意图2

图3.2 中的茎叶图还揭示了一些在每日数据的表格列表中可能被忽略的信息。每个茎上的所有叶值都相同。显然,数据经过了舍入处理,了解这一点对后续某些分析可能很重要。在这种情况下,舍入过程包括将数据从原始单位(节)转换为公里每小时。例如,16.6 公里/小时 的四个观测值来源于 9 节的原始观测值。17 公里/小时茎上不可能有任何值,因为 10 节的观测值会转换为 18.5 公里/小时。

3.3.2. 箱线图

由箱线图或箱须图是一种由图基(1977)引入的非常广泛使用的图形工具。它简单地绘制五个样本分位数:最小值x(1);下四分位数q0.25;中位数q0.5;上四分位数q0.75;以及最大值x(n)。利用这五个数值,箱线图本质上给出了基础数据分布的快速概览。

示意图3

图3.3 展示了表A.1中1987年1月伊萨卡最高气温数据的箱线图。图示中间的箱体由上下四分位数界定,因此标示出数据的中间50%。箱体内的横条表示中位数。须从箱体向外延伸至两个极端值。

箱线图可以一目了然地传达大量信息。例如,从图3.3中箱体所占范围较小可以看出,数据非常集中在30°F附近。由于箱线图的这一部分仅基于中位数和四分位数,因此对可能出现的离群值具有很强的抗干扰性。数据的整个范围也是一目了然。最后,我们可以很容易地看出这些数据几乎是对称的,因为中位数位于箱体的中央附近,且须的长度大致相当。

3.3.3. 示意图

箱线图的一个缺点是关于数据分布尾部的信息被高度概括。须延伸到最高值和最低值,但对于数据点在上四分之一区间和下四分之一区间的分布情况则没有提供信息。例如,尽管图3.3 显示最高温度为53°F,但它并未说明这是否是一个孤立的点(其余较高温度低于比如说40°F),或者较暖的温度是否在上四分位数与最大值之间大致均匀分布。

通常,了解极端值的异常程度是有用的。示意图是由图基(1977)提出的,它是对箱线图的一种改进,能够更详细地展示尾部的信息。示意图与箱线图相同,只是将被认为足够异常的极端点单独绘制出来。“足够异常”取决于样本中心部分数据的变异性,即由四分位距反映的情况。如果两个四分位数相距较远(即四分位距较大),则某个给定的极端值被认为异常程度较低;如果两个四分位数彼此接近(四分位距较小),则该极端值被认为异常程度较高。

在图基独特的术语中,区分较不异常和更异常点的分界线被称为“围栏”。根据数据上下方的内栏和外栏,共定义了四个围栏:

$$
\begin{aligned}
&\text{Upper outer fence} = q_{0.75} + 3\text{IQR} \
&\text{Upper inner fence} = q_{0.75} + \frac{3}{2}\text{IQR} \
&\text{Lower inner fence} = q_{0.25} - \frac{3}{2}\text{IQR} \
&\text{Lower outer fence} = q_{0.25} - 3\text{IQR}
\end{aligned}
$$

因此,两个外栏位于上下两个四分位数之外,距离为四分位距的三倍。内栏位于外栏与四分位数之间的中间位置,距离四分位数为四分位距的1.5倍。

在示意图中,内栏范围内的点称为“内部”。内部点的范围由须的延伸范围表示。位于内栏和外栏之间的数据点被称为“外部”,并在示意图中单独绘制。高于上外围栏或低于下外围栏的点称为“远端”,并用不同的符号单独绘制。这些自动生成的边界虽然有些随意,但受到了图基的经验和直觉的影响。与简单箱线图的差异如图3.4所示。与箱线图相同,示意图中的箱体显示了四分位数和中位数的位置。

例 3.2. 构建示意图

图3.4 是1987年1月伊萨卡最高气温数据的示意图。从 图3.1可以看出,这些数据的四分位数为 33°F 和 26°F,四分位距=33−26=7°F。根据这些信息,可轻松计算出内栏的位置为 33+ (3/2)(7)=43.5°F 和 26−(3/2)(7)=15.5°F。类似地,外栏分别为 33+(3)(7)=54°F 和 26−(3)(7)=5 °F。用于定位围栏的虚线通常不包含在示意图中,但在 图3.4中为了清晰起见而显示。

两个最高的温度值,53°F 和 45°F,高于上内围栏,因此用圆圈单独标出。最低的温度值 9°F 低于下内围栏,也被单独标出。须延伸至围栏内部最极端的温度值,即 37°F

以及17°F。如果最高温度是55°F而不是53°F,那么它将落在外栏之外(远端),并会用不同的符号单独标出。用于远端点的这种独立符号通常是一个星号。

示意图或箱线图的一个重要用途是对多个数据批次进行同时的图形比较。这一用途在图 3.5中得到了说明,该图并排展示了表A.1中全部四个温度数据批次的示意图。显然,事先已知最高温度比最低温度更暖和,而比较它们的示意图则显著地突出了这一差异。显然,在此月份期间,卡南代瓜比伊萨卡略暖和一些,尤其是在最低温度方面更为明显。伊萨卡的最低气温显然比卡南代瓜的最低气温更具变异性。对于这两个地点而言,最低温度都比最高温度更具变异性,特别是在由箱体表示的分布中心部分。最低温度示意图中中位数位于箱体上端的位置表明存在负偏度的趋势,伊萨卡最低气温数据的须长不等也说明了这一点。两个地点的最高温度看起来都相对对称。注意,所有最低温度数据均未超出内栏,因此这些数据的箱线图将完全相同。

3.3.4. 其他箱线图变体

麦克吉尔等人(1978年)提出的箱线图或示意图的两种变体有时会被使用,尤其是在比较并列图时。第一种是将每个箱体的宽度绘制为与 √样本量成比例。这种简单的变体使得样本量较大的数据图更加突出,产生更强的视觉冲击。

凹口箱线图或示意图是第二种变体。这些图中的箱体类似于沙漏,其收缩部分或腰部位于中位数处。箱体凹口部分的长度在不同图中有所差异,反映了对预选置信限(第5章)的估计值。

结合这两种技术,即构建带刻痕的变宽度图,是直接可行的。然而,如果刻痕部分需要延伸到四分位数之外,图表的整体外观可能开始显得有些奇怪(可参见格雷德尔和克莱纳,1985中的示例)。作为刻痕的一种替代方法,可以在箱体内部添加阴影区或点状填充以覆盖所计算的区间,而不是通过刻痕改变其轮廓形状。

3.3.5. 直方图

直方图 是用于表示单批数据分布的一种非常熟悉的图形显示装置。数据的范围被划分为类区间或 箱,并统计落入每个区间内的数值个数。直方图由一系列矩形组成,其宽度由组宽所隐含的类限决定,高度则取决于每个箱中的数值个数。示例直方图如 图3.6 所示。直方图可以快速揭示数据分布的位置、离散程度和对称性等特征。如果数据是多峰的(即数据分布中有多个“隆起”部分),这一点也能迅速显现出来。

通常选择相等的箱宽。在这种情况下,直方图条形的高度与频数成正比。纵轴可以标注为每根条形所代表的频数(绝对频率),也可以标注为每根条形所代表的样本比例(相对频率)。然而更准确地说,应该是直方图条形的面积(而非其高度)与概率成正比。当直方图的箱被选择为不等宽度,或需要在直方图上叠加参数概率函数(第4章)时,这一点变得尤为重要。

构建直方图时面临的主要问题是箱宽的选择。过宽的区间会导致数据的重要细节被掩盖(直方图过于平滑)。过窄的区间则会导致图形不规则且难以解释(直方图过窄)

过于粗糙)。一般来说,较大的数据样本支持使用更窄的直方图箱,但数据性质也会影响选择。选择组宽 w 的一个有效方法是从计算开始

$$
w \approx c \frac{\text{IQR}}{n^{1/3}},
$$

其中 c是范围在约 2.0–2.6 的常数。根据 斯科特 (1992) 给出的结果,对于高斯(钟形)数据, c=2.6 是最优的,而对于偏斜和/或多峰数据,则更适合采用较小值。

使用公式3.13计算得到的初始组宽,或根据其他规则得出的组宽,仅应视为一种指导性原则或经验法则。在选择组宽时还需考虑其他因素,例如希望分类边界落在与当前数据相适应的自然数值上,这在实际应用中是可取的。(绘制直方图的计算机程序必须使用类似公式3.13中的规则,而衡量软件编写质量的一个指标就是生成的直方图是否具有自然而非任意的箱边界。) 例如,1987年1月伊萨卡最高气温数据的四分位距为=7°F,样本量n=31。根据公式3.13,由于这些数据的示意图(图3.5)至少近似呈高斯分布,因此采用c = 2.6,最初建议的组宽为 5.7°F。在此情况下,一个合理的选择可能是选用10个宽度为5°F的箱,所得到的直方图将看起来非常类似于图3.1b中的茎叶图。

3.3.6. 核密度平滑

直方图的一种解释是,它作为从数据所来源的基础概率分布的非参数估计器。“非参数”意味着不假设第4章中给出的固定数学形式。然而,直方图在实数轴上的箱对齐方式是一种任意选择,构建直方图实际上要求将每个数据值四舍五入到其所属箱的中心。例如,在图3.6a中,箱被对齐在整数温度值 ±0.25°C处,而同样有效的图3.6b则将其移动了0.25°C。这两个图3.6 中的直方图对数据呈现了稍有不同的印象,尽管两者都表明存在双峰性,这可以通过表A.3中的星号追溯到厄尔尼诺现象的发生。直方图另一个可能较不严重的问题是,其矩形条形呈现出粗糙的外观,并似乎暗示同一箱内的任何数值具有相等的可能性。

核密度平滑是一种替代直方图的方法,不需要将数据任意舍入到箱中心,并且呈现的结果是平滑的。将核平滑应用于数据集的经验频率分布,可得到核密度估计,这是拟合参数概率密度函数的一种

第3章 经验分布与探索性数据分析

3.3.6. 核密度平滑(续)

非参数替代方法(第4章)。可以将核密度平滑理解为直方图的扩展,这样更容易理解。如图3.6所示,在将每个数据值舍入到其对应的箱中心后,直方图可被视为在每个箱中心上方堆叠矩形构建块而构成,构建块的数量等于该箱内数据点的数量。在图3.6 中,数据的分布在每个直方图下方以点图的形式表示,点图使用点来标示每个数据值,并通过点的堆叠来表示重复的数据实例。

图3.6 中的矩形构建块每个的面积都等于组宽(0.5°F),因为纵轴只是每个组中的原始频数。如果相反,纵轴被设定为使每个构建块的面积为 1/n (=1/20 对于这些数据),那么得到的直方图将为基础概率分布的定量估计,因为每种情况下直方图的总面积为1,且总概率之和必须为1。

核密度平滑以类似的方式进行,使用称为核的特征形状,这些形状通常比矩形更平滑。表 3.1 列出了四种常用的平滑核,而图3.7 则图形化地展示了它们的形状。这些均为具有单位面积的非负函数,即在每种情况下,∫ h(t) dt=1,因此每个函数都是一个合适的概率密度函数(将在第4章中更详细地讨论)。此外,所有核都以零为中心。支撑(使t满足h(t)>0的自变量取值)对于三角形、二次型和四次型核为 −1<t<1,而对于高斯核则覆盖整个实数轴。表3.1中列出的核适用于连续数据(在实数轴的全部或部分范围内取值)。适用于离散数据(只能取有限个数值)的一些核见Rajagopalan 等人 (1997)。

核密度平滑不是通过在直方图构建中将矩形核堆叠在区间中点上来实现的(这是看待直方图构建的一种方式),而是通过堆叠与数据值数量相等的核形状来实现,每个堆叠元素以其所代表的数据值为中心。当然,通常情况下核形状不像构建块那样紧密贴合,但核密度平滑通过数学上的堆叠等效实现,即在给定值x₀处,将所有对平滑估计有贡献的核函数的高度相加。

$$
\hat{f}(x_0) = \frac{1}{nw} \sum_{i=1}^{n} h\left(\frac{x_0 - x_i}{w}\right)
$$

核函数中的参数表明,用于平滑的每个核(对应于那些与点x₀足够接近、使得核高度非零的数据值xi)均以其各自的数据值xi为中心,并且其宽度相对于图3.7中绘制的形状通过平滑参数 w 进行缩放。例如,考虑表3.1中的三角核,其形式为t=(x₀−xi)/w。函数h[(x₀−xi)/w]=1−|(x₀−xi)/w|是一个等腰三角形,在xi−w <x₀<xi+w范围内具有支撑(即非零高度),该三角形内的面积为w,因为函数t在支撑区间 −1<t<1上的积分为1,而其底边已被扩大(或缩小)了因子w。因此,在公式3.14中,在数值x₀处堆叠的核高度将对应于那些距离x₀小于w的所有xi。

为了使公式3.14中整个函数下方的面积积分为1(如果目标是估计概率密度函数,则这是期望的),所叠加的n个核中的每一个都应具有面积1/n。这可以通过将每个h[(x₀−xi)/w]除以nw来实现,或者等价地将其总和除以nw。

核类型的选择通常不如平滑参数的选择重要。高斯核直观上吸引人,但由于涉及指数函数调用,且其无限支撑导致所有数据值都会对任意x₀处的平滑估计产生贡献(在方程n项中,3.14永远不会有任何一项为零),因此计算速度较慢。另一方面,使用高斯核得到的函数具有所有阶导数,并在实数轴上的每一点都估计出非零概率,而使用表3.1中列出的其他核所估计的概率密度函数并不具备这些特性。

例3.3 核密度估计在瓜亚基尔温度数据中的应用

图3.8 展示了表A.3中6月瓜亚基尔温度数据的核密度估计,对应于图3.6中的直方图。这四个概率密度估计使用四次核和四个不同的平滑参数w值构造而成,子图(a)到(d)中w的值依次增大。平滑参数的作用类似于直方图箱宽(也称为w),较大值会产生更平滑的形状,逐步抑制细节;较小值则产生更不规则的形状,揭示更多细节,包括更多的抽样变异性。图3.8b使用w=0.6绘制,同时显示了用于生成平滑密度估计的单个核。由于w=0.6且四次核的支撑为−1<t<1(见表3.1),因此图3.8b中每个单个核的宽度为1.2°C。五个重复的数据值23.7、24.1、24.3、24.5和24.8(可对比图3.6底部的点图)由五个较高的核表示,其面积各为2/n。其余10个数据值是唯一的,它们的核面积各为1/n。

比较 图3.8 中的各个子图可以看出,平滑参数 w 的合适选择至关重要。Silverman( 1986)建议,对于高斯核,一个合理的初始选择可能是

$$
w = \min\left(0.9s, \frac{2}{3} \frac{\text{IQR}}{n^{1/5}}\right),
$$

其中 s 是数据的标准差。公式3.15表明,对于较大的样本量n,可以采用较少的平滑(即更小的w),但w不应像直方图箱宽(公式3.13)。由于高斯核的内在宽度比表3.1 中列出的其他核更宽(参见图3.7),因此对于这些核,应使用较小的平滑参数,其比例与核标准差的倒数成正比(斯科特,1992),这些值列在表3.1的最后一列。对于瓜亚基尔温度数据,s=0.98 且四分位距为=0.95,因此 (2/3)×四分位距 小于 0.9s,代入公式3.15可得使用高斯核对这些数据进行平滑时的w=(2/3)(0.95)/20^(1/5)=0.35。但图3.8 是使用更为紧凑的四次核绘制的,其标准差为 1/√7,因此平滑参数的初始选择为w=(√7)(0.35)=0.92(图3.8c)。

当核平滑用于探索性分析或构建美观的数据展示时,根据公式3.15计算出的推荐平滑参数通常可作为通过试错进行初步探索后主观选择的起点,这一过程甚至可能增强探索性数据分析的效果。在核密度估计将用于后续定量分析的情况下,采用类似于第7章中所述的交叉验证方法客观估计平滑参数可能是更优的选择(第7章(斯科特,1992;夏尔马等,1998;西尔弗曼,1986)。采用探索性方法时,w=0.92 (图3.8c) 和 w=0.6(图3.8b) 似乎在展示主要数据特征(此处为与厄尔尼诺相关的双峰性)和抑制不规则抽样变异之间取得了合理的平衡。图3.8a 中,w=0.3,对于大多数用途而言过于粗糙,因为它保留了可能归因于抽样变异的不规则性,并(几乎可以肯定是错误地)显示了接近 25.5°C 的温度概率为零。另一方面,图3.8d 显然过于平滑,因为它完全抑制了数据中的双峰性。

核平滑可以使用乘积核估计器扩展到双变量以及高维数据

$$
\hat{f}(x_0) = \frac{1}{n} \sum_{i=1}^{n} \prod_{k=1}^{K} h\left(\frac{x_{0,k} - x_{i,k}}{w_k}\right)
$$

这里有 K 个数据维度,x₀,k表示在这些维度的第k个维度上生成平滑估计的位置,大写pi表示因子的相乘,类似于大写σ所表示的项的求和。每个维度中使用相同的(单变量)核h(·),尽管其平滑参数wk不一定相同。通常,多变量平滑参数wk需要比对相同数据单独平滑时更大(即,对向量k中的第x个变量进行单变量平滑),并且应随样本量n⁻¹/(K+4)成比例地减小。方程3.16还可以通过使用多变量概率密度(例如,在第12章中描述的多变量正态分布)作为核,进一步扩展以包含K个维度之间核的非独立性(斯科特,1992,夏尔马等,1998,西尔弗曼,1986)。

核密度估计可以与箱线图结合,生成一种称为小提琴图(欣策和尼尔森,1998)的信息丰富的图形。小提琴图通常包含一个中心箱线图,其两侧对称地绘制了基于相同基础数据的核密度估计。图3.9展示了与之前相同的最高温度和最低温度数据的小提琴图表示。

示意图中的 图3.5。小提琴图比简单的箱线图能展示更多关于数据分布的细节,而其中线上的箱线图则可用于识别平滑分布的中位数和四分位数。一些仅从箱线图中不易察觉的分布特征,在小提琴图中可以被识别出来。例如,双峰分布的小提琴图往往会呈现出其名称所来源的乐器形状。图3.9中伊萨卡最小气温的小提琴图开始显现出这一特征。

最后需要注意的是,核平滑不仅可以用于估计概率分布函数,还可应用于其他场景。在估计一般的平滑函数时(该函数不受积分为1的约束),可以使用Nadaraya‐Watson核加权平均方法,在任意点x₀处计算函数y=f(x)的平滑值。

$$
\hat{f}(x_0) = \frac{\sum_{i=1}^{n} h\left(\frac{x_0 - x_i}{w}\right) y_i}{\sum_{i=1}^{n} h\left(\frac{x_0 - x_i}{w}\right)}
$$

其中 yi是响应变量在 xi处的原始值,该响应变量需要进行平滑处理。例如,图3.10 显示了基于 1980年 80 80至1999年期间每–km网格方格内的每日龙卷风发生次数计算得出的每年龙卷风日的平均数量。该图是在时间维度上采用宽度为w=15天的高斯核进行三维平滑,并在纬度和经度上采用宽度为w=120km的高斯核进行平滑后得到的结果。该图能够对基础数据进行直观解读,而这些数据若以原始形式呈现,则在空间和时间上都表现出极大的不规则性。

有关核平滑方法的更多内容可以在Hastie等人(2009)的第6章中找到。

3.3.7 累积频率分布

累积频率分布是一种与直方图相关的显示方式,也称为经验累积分布函数。累积频率分布是一种二维图,其中纵轴表示与横轴上的数据值相关的累积概率估计。也就是说,该图表示任意或随机的未来数据值不超过横轴上相应值的概率的相对频率估计。因此,累积频率分布类似于组宽任意窄的直方图的积分。

图3.11 展示了两个经验累积分布函数,说明它们是在数据值处发生概率跳跃的阶梯函数。正如直方图可以使用核密度估计器进行平滑一样,经验累积分布函数的平滑版本可以通过对核平滑的结果进行积分获得。

中的纵轴显示了经验累积图3.11分布函数p(x),其表达式为

$$
p(x) \approx \Pr{X \leq x}
$$

这个等式右侧的符号起初可能有些令人困惑,但在统计工作中是标准的。大写字母X代表前一段中提到的通用随机变量或“任意的或随机的未来”值。在公式3.18两侧的小写字母x表示该随机量的一个特定值。在累积频率分布中,这些特定值绘制在横轴上。

为了构建累积频率分布,需要利用顺序统计量x(i)的秩i来估计p(x)。在水文学文献中,这些估计值被称为绘图位置(例如,哈特,1984),反映了它们历史上用于将经验分布与候选参数函数进行图形化比较的用途(第4章)。关于可用于计算绘图位置从而从数据集中估计累积概率的方程已有大量文献,其中大多数是以下公式的特例:

$$
p(x_{(i)}) = \frac{i - a}{n + 1 - 2a}, \quad 0 \leq a \leq 1,
$$

其中常数 a的不同取值会导致不同的绘图位置估计量,其中一些在 表3.2中列出。该表中的名称与提出各种估计量的作者相关,而不是与可能以相同作者命名的特定概率分布相关。

表3.2 中的多个绘图位置是由与顺序统计量相关的累积概率的抽样分布特征所决定的。抽样分布的概念如下:

图3.11 1987年1月伊萨卡最高温度(a)和降水数据(b)的经验累积频率分布函数。温度数据呈现的S形是相对对称的数据特征,而降水数据呈现的向下凹的特征是右偏斜数据的典型特征。

表3.2 对应于第i个顺序统计量x(i)的累积概率的一些常用绘图位置估计量,以及式a在公式3.18中的相应参数值

Name 公式 a 解释
威布尔 i/(n+1) 0 抽样分布的均值
贝纳德和博斯‐莱文巴赫 (i− 0.3)/(样本量 +0.4) 0.3 抽样分布的近似中位数
图基 (i−1/3)/(n+1/3) 1/3 抽样分布的近似中位数
坎南 (i−2/5)/(n+1/5) 2/5 主观选择,水文学中常用
格林戈滕 (i−0.44)/(n+0.12) 0.44 与耿贝尔分布一致(公式4.67)
黑曾 (i−1/2)/n 1/2 [0, 1]上n个等距区间的中点
Gumbel (i−1)/(n−1) 1 抽样分布的众数

抽样分布在 第5章中有更详细的讨论,但简而言之,可以假设从某个未知分布中获取大量大小为 n的数据样本。这些样本的第 i个顺序统计量会彼此略有不同,但每个都对应于数据所来自分布中的某个累积概率。在大量假设样本的整体上,将存在一个分布——即抽样分布——对应于第 i个顺序统计量的累积概率。一种想象这种抽样分布的方式是,将其视为每个样本批次中 n 个值的最小值(或任何其他顺序统计量)的累积概率的直方图。这一关于累积概率抽样分布的概念在 福尔德和安德森(2002) 的气候学背景中得到了更充分的阐述。

第i个顺序统计量对应的累积概率的抽样分布的数学形式已知为贝塔分布(参见第4.4.6节),其参数为 α=i和β=n −i +1,无论x是从何种分布中独立抽取的(Gumbel, 1958)。因此,威布尔(a =0)绘点位置估计量是特定x(i)对应的累积概率在大量假设的样本量为n的样本中的均值。类似地,贝纳德和博斯‐莱文巴赫(a =0.3)以及图基(a =1/3)估计量近似于这些分布的中位数。耿贝尔(a =1)绘点位置则定位众数(单一最频繁出现的)累积概率,尽管它将零和单位累积概率分别赋予x(1)和x(n),从而导致通常不合理的推论,即观测到比这些更极端数据的概率为零。也可以从相反的角度推导绘点位置公式,即考虑对应于特定固定累积概率的数据分位数xi的抽样分布(例如,Cunnane, 1978;Stedinger等, 1993)。由此方法得到的绘图位置依赖于数据所来自的分布,尽管坎南(a =2/5)绘点位置是对其中许多情况的一种折中近似。

实际上,大多数不同的绘图位置公式产生的结果非常相似,尤其是相对于累积概率的抽样分布(公式4.59b)的内在变异性而言,这种变异性远大于表3.2中各种绘图位置之间的差值。通常使用参数a适中的绘图位置(例如图基或坎南方法)可获得非常合理的结果。海德曼和范 (1996)Hyndman and Fan(1996)在回顾和比较各种绘图位置的性质后,总体上更倾向于采用图基估计量。

图3.11a展示了使用图基(a=1/3)绘点位置估计累积概率的1987年1月伊萨卡最高温度数据的累积频率分布。图3.11b以相同方式展示了伊萨卡降水数据。例如,图3.11a中31个温度观测值中最冷的一个是x (1)= 9°F,其p(x(1))的绘点位置为(1−0.333)/(31+0.333)=0.0213。图的中心处陡峭的斜率反映了数据值在分布中心的集中情况,而高温和低温端的平坦度则是由于这些区域的数据较为稀少。该图的S形特征表明数据分布较为对称,在中位数两侧相同距离内的观测值数量大致相等。降水数据的累积分布函数(图3.11b)在左侧迅速上升,因为该区域数据值高度集中,而在图的中部和右侧上升较慢,因为较大的观测值相对较少。因此,该累积分布函数向下凹的特征表明数据为正偏。对于一批负偏数据的累积概率图则会表现出相反的特征:在图示的左侧和中心部分向右急剧上升,形成一个向上凹的函数。

3.4. 重新表达

原始测量尺度可能会掩盖数据集中的重要特征。如果是这样,先对数据进行数学变换,可能有助于分析,或得到更具揭示性的结果。此类变换还有助于使数据符合回归分析的假设(参见第 7.2节),或便于应用假设为高斯分布的多变量统计方法(参见第12章)。在探索性数据分析术语中,这类数据变换被称为数据重表达。

3.4.1. 幂变换

通常会进行数据变换,以使数值的分布更接近对称,而由此产生的对称性可能使得可以使用更为熟悉和传统的统计技术。有时,产生对称性的变换可使探索性分析(例如本章所述的分析)更具揭示性。这些变换还有助于比较不同的数据批次,例如,通过使两个变量之间的关系更接近线性。变换的另一个重要用途是使一个变量的变异或离散度(即离散程度)对另一个变量的取值依赖性降低,这种情况下该变换称为方差稳定化。

毫无疑问,最常用(尽管不是唯一可能的——例如参见 公式12.12)用于产生对称性的变换是 幂变换,它由以下两个密切相关函数之一定义

$$
T_1(x) =
\begin{cases}
x^\lambda, & \lambda > 0 \
\ln(x), & \lambda = 0 \
-(x^{-\lambda}), & \lambda < 0
\end{cases}
$$

and

$$
T_2(x) =
\begin{cases}
\frac{x^\lambda - 1}{\lambda}, & \lambda \neq 0 \
\ln(x), & \lambda = 0
\end{cases}
$$

当处理单峰(单驼峰)分布的严格正的数据变量时,这些变换非常有用。每一个函数都定义了一个由单一参数 λ索引的变换族。“幂变换”这一名称源于这些变换的主要作用——通过指数化或对数据值进行幂运算来改变数据分布的形状。 λ因此,方程3.20a 和 3.20b中的变换集合实际上相当相似,在两种情况下,特定的 λ值会对数据的整体分布形状产生相同的影响。方程 3.20a中的变换形式稍为简单,且因使用更为简便而常被采用。方程3.20a中的变换有时被称为 “图基阶梯”。方程3.20b中的变换也称为Box‐Cox 变换,它们只是对方程3.20a进行了平移和尺度变换,有时

在比较不同变换时更有用。此外,公式3.20b在数学上更为“简洁”,因为当 λ→0趋近于极限时,上述等式中的变换实际上是函数 ln(x)。

在方程 3.20a 和 3.20b中,调整参数 λ的值可以得到一组本质上连续变化的平滑变换中的特定成员。这些变换有时被称为幂变换阶梯。其中一些变换函数绘制在图3.12中。该图中的曲线是由方程 3.20b指定的函数,尽管来自方程 3.20a 的对应曲线具有相同的形状。图3.12 清楚地表明,对 λ=0使用对数变换恰好契合幂变换的谱系。该图还说明了幂变换的另一个性质,即它们都是原始变量x的增函数。这一性质在方程 3.20a 中通过 λ<1的变换中的负号来实现。对于方程 3.20b 中的变换,此符号反转通过除以 λ来实现。幂变换的严格递增性质意味着它们保持顺序不变,因此原始数据集中的最小值将对应于变换后数据集中的最小值,最大值同理。事实上,原始分布与变换后分布的所有顺序统计量之间都存在一一对应关系。因此,原始数据的中位数、四分位数等将被转换为变换后数据中相应的分位数。

显然,当 λ=1时,数据分布的形状保持不变。当 λ>1时,数据值被增大(除非减去1/λ并除以 λ,如果使用公式3.20b),其中较大值的增幅超过较小值。因此,对负偏数据应用幂变换且 λ>1时,有助于产生对称性。对于 λ<1情况则相反,其中较大数据值的减小程度大于较小值。因此,对原本正偏的数据应用幂变换且 λ<1 ,以得到更接近对称的分布。图3.13 说明了该过程在原本正偏数据上的作用机制

偏斜分布(粗线)。应用幂变换 λ<1会降低所有数据值,但对较大值的影响更为显著。适当选择 λ通常可通过此过程至少实现近似对称性(细线)。若将 λ选得过小或为负值,则会导致过度校正,使转换后的分布呈现负偏。

对示意图等探索性图形进行初步检查,可以快速指明一批数据中偏斜的方向和大致量级。因此,通常可以清楚地判断是否需要采用指数为 λ>1或 λ<1的幂变换,但具体的指数值并不明显。已有多种方法被提出用于选择合适的变换参数。其中最简单的是dλ统计量(欣克利, 1977),

$$
d_\lambda = \frac{|\text{mean}( \lambda) - \text{median}( \lambda)|}{\text{spread}( \lambda )}
$$

此处,离散程度是某种抗干扰的离散度度量,例如四分位距或中位数绝对偏差。 λ的每个取值都会在特定数据集中产生不同的均值、中位数和离散程度,这些对 λ的函数依赖关系在方程中表示出来。Hinkley dλ通过试错法用于在幂变换之间进行选择,即针对 λ的多个不同取值分别计算其dλ的值。通常这些试错的 λ取值以1/2或1/4为间隔。使dλ最小的 λ取值将被选中用于变换数据。一种非常简便的计算方法是在台式计算机上使用电子表格程序进行。

dλ统计量的基础在于,对于对称分布的数据,均值和中位数会非常接近。因此,随着幂变换强度逐渐增强(即 λ的取值越来越远离1),数据趋向于对称,式3.21中分子将趋近于零。当变换过强时,分子相对于离散度度量开始增大,导致dλ再次增加。

方程 3.21是一种简单直接的方法,用于寻找一种幂变换,使转换后的数据具有对称性或接近对称性。更复杂的方法最初由博克斯和考克斯(1964)提出,当转换后的数据分布应尽可能接近钟形高斯分布时,该方法尤为适用;例如,在需要通过多元高斯分布或多变量正态分布对多种变换结果进行综合汇总时(参见第12章)。具体而言,博克斯和考克斯建议选择幂

用于最大化高斯分布对数似然函数的变换指数(参见第4.6节)

$$
L(\lambda) = -\frac{n}{2} \ln[s^2(\lambda)] + (\lambda - 1)\sum_{i=1}^{n} \ln[x_i]
$$

这里 n是样本量,而 s²(λ) 是经指数为 λ 的幂变换后的数据的样本方差(计算时除数为 n而非 n−1,参见 方程 4.84b)。需要注意的是,公式 3.22第二项中对数的和是针对 未转换的数据。与使用欣克利统计量(公式 3.21)的情况一样,可以尝试不同的 λ值,并选择使 L(λ) 取得最大值的那个作为最合适的值。由于公式 3.21仅关注转换后数据的对称性,而公式 3.22则试图使数据在高斯分布的所有方面(包括但不限于对称性)上都尽可能匹配,因此两种准则可能会为 λ选出不同的值。但需要注意的是,如果原始数据不适合公式 3.20 中的变换形式,那么通过最大化公式 3.22来选择 λ 并不一定能使转换后的数据接近高斯分布。

方程 3.20 和 3.22 仅在变量x无法取到零或负值时才有效。对于包含某些零或负值的数据的变换,博克斯和考克斯(1964)最初建议通过向每个数据值添加一个正数常数来修改变换,该常数的量级应足够大,以使所有数据都被移动到实数轴的正半轴上。这种简单的方法通常已足够,但它具有一定的任意性,并且如果未来x的某个负值其绝对值大于该常数,则此方法将完全失效。Yeo 和 Johnson (2000)提出了一种统一的 Box‐Cox 变换扩展形式,可适用于实数轴上的任意数据:

$$
T_3(x) =
\begin{cases}
\frac{(x+1)^\lambda - 1}{\lambda}, & x \geq 0 \text{ and } \lambda \neq 0 \
\ln(x+1), & x \geq 0 \text{ and } \lambda = 0 \
-\frac{(-x+1)^{2-\lambda} - 1}{2-\lambda}, & x < 0 \text{ and } \lambda \neq 2 \
-\ln(-x+1), & x < 0 \text{ and } \lambda = 2
\end{cases}
$$

对于x>0,方程3.23与方程3.20b效果相同,尽管曲线向左平移了一个单位。函数T3(x) 的图形与图3.12中的图形相似,只是它们经过原点。选择方程3.23 中变换参数 λ的最简单方法仍是使用欣克利统计量(方程3.21),尽管Yeo 和 Johnson (2000)还提供了一种最大似然估计方法。

例 3.4 选择适当的幂变换

表 3.3 列出了来自–附录A中表A.2的1933年至1982年1月伊萨卡降水数据,按升序排列,并进行了公式3.20b中的幂变换T2(x)处理,指数分别为λ=1、 λ=0.5、 λ=0和 λ=−0.5。对于 λ=1该变换仅需从每个数据值中减去1即可。注意,即使对于负指数 λ=−0.5,原始数据的顺序在所有变换中仍得以保留,因此可以方便地确定原始数据和转换后数据的中位数和四分位数。

图3.14 展示了表 3.3中数据的示意图。未变换数据(最左侧图)明显呈正偏,这在降水量分布中较为常见。以下三种

围栏外部的数据为大额数值,其中最大值为远端。其余三个示意图展示了逐步增强的幂变换结果,其中 λ<1。对数变换(λ=0)在使用四分位距作为离散程度度量时,最小化了Hinkley dλ统计量(公式 3.21),并最大化了高斯对数似然(公式 3.22)。对转换后的数据绘制的示意图所表现出的近似对称性支持了该变换在两种准则下均为最佳选择的结论。而更为极端的逆平方根变换(λ=−0.5)显然过度校正了正偏度,导致三个最小数值现在位于下界之外。

3.4.2. 其他一些非线性变换

为了使转换后的数据分布的形状与其未转换前的分布形状不同,该转换必须是非线性的。公式 3.20和3.3是迄今为止最常用的此类转换,但它们并不是唯一的选择。本节将介绍其他几种在特定情况下可能有用的转换。

当原始数据由单位区间 0<p <1 上的比例、概率或其他量 p 组成时,对其进行变换可能是有用的

$$
x = \ln\left(\frac{p}{1-p}\right),
$$

被称为对数优势、logit或逻辑变换。括号内的量称为优势比。对数优势变换将数据转换到整个实数轴上, −∞<x <∞。

由相关性组成的数据,即 −1<r <1,可使用费舍尔Z(或反双曲正切)转换将其转换到整个实数轴上,

$$
Z = \frac{1}{2} \ln\left(\frac{1+r}{1-r}\right)
$$

其他非线性变换可以设计用于实现特定目标。例如,王等人(2012) 提出了对数双曲正弦变换用于正偏数据 y,

$$
z = \ln\left(\frac{e^y - e^{-y}}{2}\right)
$$

该变换专门设计用于同时具有正偏度且方差随y初始增加但在y较大时趋于稳定的水文数据。相比之下,指数为 λ<1的Box‐Cox变换(方程 3.20 或 3.23)可有效改善正偏数据的对称性,但会对方差产生越来越强的抑制作用。

3.4.3. 标准化异常

线性变换虽然不会改变数据分布的形状,但在我们希望同时处理因位置和/或尺度差异而相关但不完全可比的数据批次时,仍然可能很有用。这种情况的一个实例是数据受到季节变化影响时。例如,直接比较原始月平均温度通常只能显示出季节循环的主导影响:在大多数北半球中纬度地点,创纪录的暖一月仍然会比创纪录的凉爽七月冷得多。在这种情况下,通过标准化异常值对数据进行重新表达可能会非常有帮助。

标准化异常值 z 的计算方法是:从原始数据 x 中减去样本均值,然后除以相应的样本标准差:

$$
z = \frac{x - \bar{x}}{s_x} = \frac{x’}{s_x}
$$

在大气科学术语中,异常值 x’指的是从数据值中减去一个相关的平均值,如公式 3.27的分子部分所示。术语“异常值”并不意味着该数据值或事件是不正常的,甚至也不一定表示它是异常的。公式 3.27中的标准化异常值是通过将分子中的异常值除以对应的标准差得到的。这种变换有时也称为标准化。也可以使用稳健度量来构造标准化异常值,例如减去中位数并除以四分位距,但这种情况很少见。使用标准化异常值的动机与钟形高斯分布相关的思想有关,这些内容在第4.4.2节中进行了解释。然而,为了将一批数据重新表示为标准化异常值,并不需要假设该批数据遵循某种特定分布;并且根据公式3.27对非高斯数据进行变换并不会使其分布形状更接近高斯分布,因为线性变换不会改变数据分布的形状。

标准化异常值的核心思想是尝试消除数据样本中位置和离散程度的影响。原始数据的物理单位会被抵消,因此标准化异常值始终是无量纲量。减去均值后得到一系列偏离均值的数据,即x’,,其位置大致在零附近。再除以标准差,可使不同数据批次中偏离均值的程度处于相同的比较基准上。总体而言,经过转换为标准化异常值的数据样本将呈现出均值为零、标准差为1的特性。

以夏季气温通常比冬季气温变异性小为例。我们可能会发现,某个位置的平均一月气温的标准差约为3°C,而同一位置的平均七月气温接近1°C。那么,比七月长期平均值低 3°C的平均七月气温将是非常异常的,对应的标准化异常值为 −3。而在同一位置,比长期平均一月气温高3°C的平均一月气温则属于较为常见的现象,对应的标准化异常值仅为+1。另一种理解标准化异常值的方式是将其视为数据值与其均值之间的距离度量,以标准差单位表示。

示例 3.5. 非平稳时间序列的标准化

图 3.15 展示了数据标准化的概念,比较了美国波士顿全年各日的平均日气温。显然,原始温度显示出夏季较高的均值和冬季较低的均值,同时也表现出冬季变异性

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值