概率分布采样与常见概率分布解析
在概率和机器学习领域,理解如何从分布中采样以及掌握常见的概率分布是至关重要的。本文将深入探讨从分布中采样的方法,以及一些著名的概率分布,如均匀分布和高斯分布。
1. 从分布中采样
从随机变量的概率分布中抽取样本,会得到可能值集合中的任意一个值。当抽取多个样本时,高概率的值出现的频率会比低概率的值更高。这些采样点会在可能值的定义域内形成一个点云,高概率区域的点会更密集,因此采样点的集合常被称为样本点云。我们希望样本点云能够很好地代表整个总体,通过分析点云中的点,能让我们深入了解整个总体的情况。
在单变量情况下,样本值是一个标量,用数轴上的一个点表示;在多变量情况下,样本值是一个向量,用高维空间中的一个点表示。
为了描述总体,计算聚合统计量(如均值和方差)通常很有用。如果我们知道分布,可以使用封闭形式的表达式来获取这些属性。但很多时候,我们并不知道底层的分布,这时就可以使用样本均值和样本方差。给定一组来自任何分布的 $n$ 个样本 $X = {x_1, x_2, \cdots, x_n}$,样本均值和方差的计算公式如下:
- 样本均值:$\mu_n = \frac{1}{n} \sum_{i=1}^{n} x_i$
- 样本方差:$\sigma_n^2 = \frac{1}{n} \sum_{i=1}^{n} (x_i - \mu_n)^2$
在某些情况下,如高斯分布,可以从理论上证明样本均值和方差是最优的(在给定采样数据的情况下,对真实均值和方差的最佳猜测)。而且,随着样本数量的增加,样本均值会趋近于真实均值,当样本数量足够多时,我们就能得到对真实均值的一个很好的近似。
超级会员免费看
订阅专栏 解锁全文

6040

被折叠的 条评论
为什么被折叠?



