对数正态分布(为什么数据科学家都爱最常见的正态分布)对于深度学习和机器学习工程师来说,正态分布是世界上所有概率模型中最重要的一种。即使没有参与过任何人工智能项目,也一定遇到过高斯模型。今天我们来看看高斯过程为什么这么受欢迎。
高斯分布,也称为正态分布,最早是由A. de moivre在二项式分布的渐近公式中得到的。高斯在研究时从另一个角度导出了测量误差。拉普拉斯和高斯研究了它的性质。它是数学、物理和工程领域中非常重要的概率分布,在统计学的许多方面都有很大的影响。
正常曲线呈钟形,两端低,中间高,左右对称。因为它的曲线是钟形的,所以人们经常称之为钟形曲线。
如果随机变量x服从数学期望和方差为2的正态分布,则记录为n(,2)。其概率密度函数作为正态分布的期望值决定其位置,其标准差决定分布的幅度。当= 0和= 1时的正态分布是标准正态分布。
高斯概率分布的数学表达式
在自然现象中随处可见。
所有的模型都是错的,但有些是有用的。
—乔治·博克斯
扩散粒子的位置可以用正态分布来描述。
正态分布有着极其广泛的实际背景,生产和科学实验中许多随机变量的概率分布都可以用正态分布来近似描述。比如产品在相同生产条件下的强度、抗压强度、口径、长度等指标;同一生物体的长度、重量等指标;同一种子的重量;测量同一物体的误差;冲击点沿某一方向的偏离;某一地区年降水量;以及理想气体分子的速度分量等。
一般来说,如果一个量是许多微小的独立随机因素的结果,那么可以认为这个量具有正态分布。理论上,正态分布具有许多良好的性质,许多概率分布可以用它来近似。一些常用的概率分布就是从它直接推导出来的,如对数正态分布、T分布、F分布等。
数学:中心极限定理
二维随机行走200万步后得到的图案空。
极限定理的内容是大量独立随机变量的和经过适当标准化后接近正态分布,与这些变量的原始分布无关。例如,随机行走的总距离接近正态分布。我们引入如下三种形式的中心极限定理:
独立分布的中心极限定理
让随机变量X1,X2,...Xn,...独立同分布,数学期望和方差有限:E(Xi)= d(Xi)= 2(I = 1,2)...),那么对于任何x,分布函数为
满足
该定理表明,当n较大时,随机变量
近似服从标准正态分布n (0,1)。因此,当n较大时,
近似服从正态分布。这个定理是中心极限定理最简单也是最常用的形式。在实际工作中,只要n足够大,独立同分布的随机变量之和就可以视为正态变量。该方法广泛应用于数理统计中,是处理大样本时的重要工具。
笛福-拉普拉斯定理
设随机变量X(n=1,2,...,)服从参数为n,p(0 p 1)的二项分布,那么对于任意有限区间(a,b),有
定理表明正态分布是二项分布的极限分布。当数量足够大时,我们可以用上面的公式来计算二项式分布的概率。
不同分布的中心极限定理
让随机变量X1,X2,...Xn,...独立同分布,概率密度为fxk(x),E(Xk)=k,d(Xk)= k ^ 2,(k=1,2...)
对于任何正数,都有:
对于任意x,随机变量Yn的分布函数Fn(x)满足:
该定理表明,如果所研究的随机变量是大量独立均匀随机变量的和,那么它的分布将接近正态分布。
改变一万次而不离开最初的目标或立场
与其他许多分布不同,正态分布经过适当的变换后仍然是正态分布。
两个正态分布的乘积仍然是正态分布。
服从正态分布的两个独立随机变量之和服从正态分布。
正态分布或正态分布的高斯卷积
正态分布经过傅里叶变换后仍然是正态分布。
简洁的
奥卡姆剃刀强调一个哲学原则:在所有其他条件相同的情况下,最简单的解决方案就是最好的解决方案。
对于正态分布拟合的任意随机分布,都可能存在多参数、更复杂、更精确的解。但是我们仍然倾向于选择正态分布,因为它在数学上很简单。
它的均值、中位数和众数是一样的。
确定整个分布只需要两个参数。
图形特征:
浓度:正态曲线的峰值位于中心,即均值所在的位置。
对称性:法向曲线以平均值为中心,左右对称,曲线两端从不与横轴相交。
均匀性变异性:正态曲线从平均值所在处开始,分别向左右两侧逐渐均匀递减。
曲线与横轴之间的面积始终等于1,函数的积分等价于概率密度函数从正无穷大到负无穷大的概率为1。也就是说,频率之和是100%。
版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌抄袭侵权/违法违规的内容,请发送邮件至 ZLME@xxxxxxxx@hotmail.com 举报,一经查实,立刻删除。