一篇文章搞定概率论所有概念
Table of Contents
Table of Contents
一、概率论和统计学,到底有什么区别?
假设有一枚硬币。
概率论通常是:
我知道这是一枚公平硬币,正面概率 。 那么扔 100 次,大约会出现多少次正面?
也就是:
而统计学反过来:
我不知道这枚硬币是不是公平的。 我扔了 100 次,其中 63 次正面。 它真正的正面概率 (p) 大概是多少?
也就是:
所以:
概率论是从原因推结果。
统计学是从结果猜原因。
这几乎就是整个学科的核心。
二、先理解“总体”和“样本”
假设我们想研究“新加坡所有大学生的身高”。
所有大学生构成:
但你不可能把所有人都量一遍,所以随机找 1000 人。
这 1000 人叫:
总体真正的平均身高可能是:
这里的 是总体参数 parameter。
但我们不知道它。
于是根据 1000 人算:
这里的 是样本统计量 statistic。
于是统计学最核心的问题来了:
我只看到了样本,能不能推测总体?
之后你学到的:
标准误、置信区间、假设检验、p 值、回归分析……
本质上都在解决这个问题。
三、均值是什么?
假设五个人考试成绩:
总分:
平均分:
公式就是:
但不要只把均值理解成“加起来除以个数”。
更好的理解是:
如果把所有人的东西重新平均分配,每个人最后得到多少?
例如五个人分别有:
平均数还是:
虽然没有任何一个人真的拥有 20。
所以均值描述的是:
你甚至可以想象每个数字都是跷跷板上的重量,均值就是能够把整个跷跷板平衡起来的位置。
四、中位数是什么?
数据:
均值:
但这显然不能很好地表示“典型的人”。
中位数是:
因为一半数据在它左边,一半数据在它右边。
因此:
均值看的是全部数值的大小。
中位数看的是排序以后的位置。
极端值会严重影响均值,却不太影响中位数。
这就是为什么收入、房价这些数据经常喜欢报告中位数。
例如:
平均收入会被最后一个人猛烈拉高。
中位数则依然是:
五、众数是什么?
众数 mode 就是:
出现次数最多的值。
比如:
众数:
它对分类数据特别重要。
例如最受欢迎的手机颜色:
黑、黑、白、黑、蓝……
“平均颜色”没有意义。
但众数有意义。
六、为什么只有平均数还远远不够?
来看两组成绩。
A:
B:
两组平均值都是:
但明显不是一种情况。
A 全部挤在 80 附近。
B 非常分散。
所以我们还需要第二个问题:
数据离平均值有多远?
这就是:
和
存在的原因。
七、方差到底是什么?
假设数据:
平均值:
每个数字离平均值的距离:
如果直接平均:
永远会抵消。
因为均值本来就是数据的平衡点。
所以不能直接平均“偏差”。
数学家想到:
把距离平方。
于是:
平均:
这就是方差。
总体方差:
因此最直觉的理解是:
方差越大:
数据越散。
方差越小:
数据越集中。
八、为什么还需要“标准差”?
方差有一个很讨厌的问题。
假如数据单位是:
那么:
单位就变成:
比如平均身高:
170 cm
方差:
100 cm²
“平方厘米的身高波动”很难直观理解。
怎么办?
开平方。
这就是:
于是单位重新变回 cm。
所以:
方差适合数学计算;标准差适合人的直觉。
如果平均身高:
标准差:
你可以大致理解为:
人们的身高通常在距离 170 cm 几厘米的范围内波动。
因此你可以把标准差粗略想成:
虽然严格来说它不是普通的平均距离。
九、为什么方差要平方,而不是取绝对值?
完全可以定义:
事实上统计学里确实有这种东西:
平均绝对偏差。
但平方有很多数学优势。
例如平方:
是光滑函数,方便微积分。
而且平方会严重惩罚极端偏差:
偏差 2:
偏差 10:
所以方差对异常值非常敏感。
这既可能是优点,也是缺点。
十、极差、四分位数和 IQR
描述离散程度并不只有标准差。
最简单的是:
叫极差。
但极差严重受异常值影响。
因此常用:
四分位数 quartile。
把数据从小到大排列。
25% 的位置:
50% 的位置:
75% 的位置:
然后:
IQR 描述的是:
中间 50% 数据覆盖多大的范围。
箱线图 Box Plot 基本就是围绕这些量建立的。
十一、概率究竟是什么?
最简单的理解:
(P(A)) 表示事件 (A) 发生的不确定程度。
例如骰子:
但概率真正重要的地方并不是“算骰子”。
而是:
给不确定性一种数学语言。
例如:
明天下雨。
一个客户购买。
药物治愈。
机器发生故障。
股票发生某种收益。
模型预测正确。
都可以看成随机事件。
十二、事件、样本空间
扔一个骰子。
所有可能结果:
叫:
事件 A:
出现偶数。
那么:
所以事件其实就是:
这也是为什么概率论和集合论关系非常密切。
十三、并集、交集、补集
如果:
A = 今天下雨
B = 今天刮风
那么:
表示:
又下雨又刮风。
而:
表示:
下雨或者刮风,至少一个发生。
而:
表示:
不下雨。
于是:
十四、条件概率:整个概率论最重要的思想之一
假设:
1000 人中,
100 人患病。
其中 90 人检测阳性。
那么:
这里:
读作:
在已经知道 B 发生的条件下,A 的概率是多少?
公式:
它的思想非常重要:
一旦获得新的信息,你应该重新缩小观察范围。
例如:
“一个随机的人是程序员的概率”
和:
“一个已经知道计算机专业毕业的人是程序员的概率”
显然不同。
因为第二个条件改变了我们的信息。
十五、独立是什么意思?
如果知道 B 是否发生,完全不会改变 A 的概率:
我们说:
相互独立。
例如理想情况下连续扔两次硬币:
第一次正面不会改变第二次正面的概率。
于是:
但是注意:
互斥 ≠ 独立。
例如一次扔骰子:
A = 出现 1
B = 出现 2
它们不可能同时发生,所以互斥。
但显然不独立。
因为如果已经知道出现 1:
十六、贝叶斯公式到底在干嘛?
这是整个数据科学、机器学习里特别重要的思想。
假设:
A = 有病
B = 检测阳性
医生通常知道:
也就是:
有病的人检测阳性的概率。
但患者真正关心:
也就是:
我检测阳性以后,我真正患病的概率是多少?
这两个不是一回事。
贝叶斯公式:
最值得记住的不是公式,而是:
也就是:
Prior 先验
↓
看到数据
↓
Posterior 后验
贝叶斯统计基本就是不断进行这种更新。
十七、随机变量是什么?
这是概率论中一个容易被名字搞晕的概念。
随机变量其实不是“随机变化的变量”这么简单。
它本质上是:
把随机结果映射成数字。
比如扔两次硬币。
可能结果:
HH HT TH TT
定义:
于是:
HH → 2
HT → 1
TH → 1
TT → 0
(X) 就是一个随机变量。
十八、离散随机变量和连续随机变量
如果可能值一个一个可以数:
叫:
例如:
一天收到多少封邮件。
10 次投篮命中几次。
一个家庭有几个孩子。
如果可以连续取值:
叫:
例如:
身高、体重、时间、温度。
十九、概率分布是什么?
随机变量有很多可能结果。
概率分布告诉你:
每种结果有多可能出现。
比如公平骰子:
一直到:
这就是骰子的概率分布。
所以:
这是整个统计学最核心的概念之一。
二十、概率质量函数 PMF
用于离散随机变量。
例如二项分布:
直接告诉你:
的概率。
所以离散情况下一个点真的可以拥有概率。
二十一、概率密度函数 PDF
连续变量就有点特别。
比如人的身高服从某个连续分布。
理论上:
因为可能的小数无限多。
因此连续随机变量看的是:
也就是:
一个区间下面的面积。
所以 PDF 的高度本身不是概率。
这是非常容易搞错的地方。
二十二、CDF 是什么?
CDF:
翻译成人话:
随机变量小于等于 (x) 的概率是多少?
例如:
如果:
意思就是:
48% 的人身高不超过 170。
CDF 会从:
一路增长到:
二十三、期望值是什么?
期望值 expected value 是概率论版本的平均数。
例如赌博:
50% 赢 100 元。
50% 输 20 元。
长期平均:
E(X) ==== # 0.5(100)+0.5(-20) 40因此:
离散情况下:
注意:
期望值不一定是一个实际可能出现的值。
比如骰子:
骰子永远不会出现 3.5。
但如果扔很多很多次:
平均点数会越来越接近 3.5。
二十四、随机变量的方差
随机变量不仅有期望:
还可以有方差:
它描述:
随机结果通常离期望有多分散。
定义:
还有一个非常常用的等价公式:
标准差:
所以“数据里的方差”和“概率分布里的方差”其实是同一个思想。
二十五、正态分布到底是什么?
这可能是整个统计学最著名的分布:
形状就是钟形。
中间最多,两边越来越少。
它由两个数字控制:
决定中心在哪里。
而:
决定曲线有多宽。
所以你现在应该能发现:
均值决定中心。
标准差决定散布。
如果标准差很小:
数据紧紧挤在均值旁边。
如果标准差很大:
数据铺得很开。
二十六、68–95–99.7 法则
对于正态分布:
大约 68% 数据位于:
大约 95% 位于:
大约 99.7% 位于:
比如:
那么大约 68%:
大约 95%:
所以标准差一下就获得了非常直观的意义。
二十七、为什么正态分布到处出现?
并不是因为“所有东西天生都是正态的”。
而是很多现实变量受到大量小因素共同影响。
例如身高受到:
基因、营养、睡眠、疾病、环境、激素……
很多因素加起来以后,经常形成近似钟形。
更深层的原因则来自一个统计学超级核心定理:
我们很快讲。
二十八、标准正态分布和 z-score
不同考试没办法直接比较。
考试 A:
你考:
90。
考试 B:
你考:
70。
哪次表现更突出?
使用:
A:
B:
所以 B 更突出。
z-score 的真正含义就是:
:
正好在平均值。
:
比平均值高一个标准差。
:
比平均值低两个标准差。
它相当于给不同尺度的数据建立了一种共同语言。
二十九、常见概率分布其实是在描述不同的随机机制
你不需要一开始背几十种分布。先理解最重要的几类。
| 分布 | 它在描述什么 |
|---|---|
| Bernoulli 伯努利 | 一次成功/失败 |
| Binomial 二项 | 做 (n) 次,成功多少次 |
| Poisson 泊松 | 一段时间/空间发生多少次 |
| Uniform 均匀 | 区间内各位置一样可能 |
| Normal 正态 | 大量因素共同形成的连续波动 |
| Exponential 指数 | 等待下一次事件要多久 |
比如投一次篮:
连续投 100 次,问命中多少:
一个客服中心每分钟收到多少电话:
可能用 Poisson。
下一通电话多久出现:
可能用 Exponential。
三十、大数定律是什么?
假设公平硬币:
扔 10 次,可能:
70% 正面。
一点也不奇怪。
扔 100 次:
可能 56%。
扔 10,000 次:
可能 50.4%。
扔得越来越多:
这就是:
它告诉我们:
大量重复观察可以让随机波动逐渐被平均掉。
所以赌场为什么赚钱?
不是赌场每一局一定赢。
而是玩的局数足够多以后:
三十一、中心极限定理是统计学真正的“大魔法”
假设总体根本不是正态分布。
甚至长得特别奇怪。
从中随机抽:
算平均值:
重新抽 100 个。
又算:
重复很多很多次。
你得到很多:
这些“样本平均数”形成一个新的分布。
神奇的事情发生了:
在很广泛的条件下,当样本量足够大时,样本均值的分布会趋近正态分布。
也就是:
这解释了为什么正态分布会统治统计学。
不是因为:
所有原始数据都是正态的。
而是因为:
很多统计量的抽样分布近似正态。
这是完全不同的概念。
三十二、抽样分布是什么?
这个概念非常重要,而且很多初学者第一次都会混乱。
假设总体平均值:
每次随机抽 100 人。
第一次:
第二次:
第三次:
……
样本不同,平均数也会变化。
于是:
本身也是随机变量。
所有可能的样本平均数组成的分布,就是:
这句话非常关键:
统计量自己也会随机波动。
统计推断几乎全部建立在这个事实上。
三十三、标准差和标准误千万不要混
这是统计学最经典的混淆之一。
标准差 SD:
描述:
个体之间差异有多大。
例如:
人的身高标准差 8 cm。
而标准误 SE:
描述:
如果重新抽样,你算出来的平均值会波动多大。
对于样本均值:
所以:
也就是说:
样本越大,我们对总体均值估计得越稳定。
一句话区分:
三十四、为什么样本量增加这么重要?
因为:
例如:
再提高到:
样本量增加了 4 倍。
但标准误只是:
所以提高统计精度的成本其实挺高。
想让误差缩小到原来的 1/10:
样本量大约要变成:
倍。
三十五、点估计是什么?
我们不知道总体均值:
抽样以后得到:
于是直接猜:
这叫:
因为给了一个单独的数字。
问题是:
这个数字肯定存在随机误差。
所以最好不要只说:
170.3。
而是给一个范围。
这就出现了置信区间。
三十六、置信区间是什么?
例如估计:
得到:
这就是一个置信区间。
直觉上:
与其假装自己知道准确答案,不如诚实地表达估计的不确定程度。
样本越大:
所以置信区间通常越窄。
数据本身波动越大:
所以区间越宽。
因此:
三十七、95% 置信区间是什么意思?
这是一个非常容易讲错的概念。
经典频率学派定义中,不严格应该说:
“总体参数有 95% 概率位于这个已经算出来的区间里。”
因为总体参数被认为是固定的。
真正的意思是:
如果重复整个抽样过程很多很多次,并且每次都按照相同方法构造置信区间,那么长期来看,大约 95% 的区间会覆盖真正的参数。
不过在日常理解阶段,可以先把它近似理解为:
这是一个具有较高可靠程度的合理参数范围。
等学得更深入以后再严格区分。
三十八、假设检验到底在解决什么?
假设有人说:
“这种药没有效果。”
数学上建立一个:
叫:
零假设 null hypothesis。
比如:
然后收集数据。
如果数据和“没有效果”这个假设非常不协调,我们开始怀疑:
于是可能拒绝它。
整个假设检验的逻辑其实很像:
先暂时假设被告无罪,再问:如果真的无罪,眼前这么极端的证据有多容易出现?
三十九、p-value 到底是什么?
这是统计学被误解最多的东西之一。
p-value 的意思是:
假设 (H_0) 真的成立,那么出现当前这么极端或更加极端数据的概率是多少?
即:
例如:
意思:
如果零假设真的成立,那么看到如此极端结果的概率大约只有 0.3%。
因此我们开始怀疑零假设。
但是 p-value 不是:
所以:
绝对不意味着:
“零假设只有 5% 概率是真的。”
这是最常见的错误解释之一。
四十、显著性水平
通常人为设定:
如果:
经常称:
statistically significant,统计显著。
但 0.05 并不是宇宙真理。
它只是一个传统阈值。
而且:
例如一个药物平均延长寿命:
0.2 天。
如果样本是几百万人,也可能得到:
但实际意义可能很小。
所以一定要同时考虑:
效应大小 effect size。
四十一、一类错误和二类错误
假设检验永远可能犯错。
真实情况有两种:
药没效果。
药有效果。
你的结论也有两种:
拒绝 (H_0)。
不拒绝 (H_0)。
于是产生两个重要错误。
| 情况 | 含义 |
|---|---|
| Type I error | 实际没效果,你却说有效 |
| Type II error | 实际有效,你却没发现 |
第一类错误概率通常由:
控制。
而:
叫统计功效:
表示:
真有一个效果时,你能把它检测出来的概率。
四十二、相关系数是什么?
假设学习时间增加时,成绩通常也增加。
我们想描述两个变量一起变化的程度。
最经典的是 Pearson correlation:
范围:
:
强正线性关系。
:
强负线性关系。
:
没有明显线性关系。
注意最后两个字:
比如:
可能关系非常强,但 Pearson (r) 可能接近 0。
四十三、协方差是什么?
相关系数的前身其实是:
如果:
X 高于自己的平均值时,Y 通常也高于自己的平均值:
协方差为正。
如果 X 高时 Y 通常低:
协方差为负。
问题是协方差带单位,不方便比较。
所以标准化以后:
得到相关系数。
因此可以把相关系数理解成:
四十四、“相关不代表因果”到底为什么?
假设发现:
冰淇淋销量 ↑
溺水人数 ↑
难道冰淇淋导致溺水?
不是。
可能存在第三个变量:
天气越热:
冰淇淋销量 ↑
游泳的人 ↑
溺水人数 ↑
这种第三变量叫:
因此:
并不能自动推出:
因果推断比相关分析困难得多。
四十五、线性回归是什么?
假设:
我们希望找到一条线:
这里:
(b_0):截距。
(b_1):斜率。
例如:
意思:
每多学习 1 小时,模型预测成绩增加约 5 分。
所以回归的本质是:
四十六、残差是什么?
真实成绩:
模型预测:
差:
这叫:
回归模型实际上就是努力让这些残差尽量小。
普通最小二乘回归 OLS 通常最小化:
你会发现:
又平方了。
这和方差中的平方误差思想高度一致。
四十七、 是什么?
假如你完全不知道学习时间。
最好可能只能猜平均成绩。
知道学习时间以后,预测变准确了一些。
衡量的是:
模型解释掉了多少原来的波动。
比如:
粗略理解:
Y 的样本波动中约 70% 可以由这个模型解释。
但高 不等于:
模型正确。
存在因果。
预测未来一定好。
四十八、偏差 Bias 和方差 Variance
机器学习和统计学里还有一组非常重要的概念。
假设用弓箭射靶。
如果箭都集中在错误的位置:
说明系统性偏了。
如果箭到处分散:
说明不稳定。
理想情况:
既准确又稳定。
这就是著名的:
模型太简单:
容易欠拟合 → Bias 高。
模型太复杂:
容易过拟合 → Variance 高。
四十九、偏度 Skewness
并不是所有分布都是对称的。
比如个人收入通常:
大量人集中在中低区域。
少数超级富豪形成长长的右尾。
这是:
右偏分布通常:
因为右边极端大值把平均数拉过去。
左偏则反过来。
所以:
看数据时,不仅要问“中心在哪里”,还要问“形状是什么”。
五十、异常值 Outlier
异常值就是明显远离其他数据的点。
例如:
300 就非常可疑。
但异常值并不一定是“错误数据”。
它可能意味着:
录入错误。
测量错误。
极端但真实的情况。
新的现象。
欺诈。
所以正确态度不是:
看到异常值就删。
而是:
先调查它为什么异常。
五十一、参数统计和非参数统计
很多经典统计方法会假设数据符合某些形式。
例如正态分布。
这类方法经常叫:
如果不想做太强的分布假设,可以用:
例如一些基于排序的方法。
“非参数”并不是完全没有参数,而是对总体分布形式的限制往往更少。
五十二、最大似然估计 MLE
这是现代统计和机器学习的核心思想之一。
假设硬币正面概率是:
不知道 (p)。
实际观察:
HHHTH
那么问:
哪个 (p) 最容易产生我看到的这组数据?
把:
看成 (p) 的函数。
它叫:
即 likelihood,似然。
然后选使它最大的:
这就是:
一句话:
选择一个最能解释已观察数据的模型参数。
很多机器学习训练过程,本质上就是 MLE 或它的变体。
五十三、Probability 和 Likelihood 有什么区别?
这个区别非常漂亮。
概率:
参数 已知。
问:
什么数据可能发生?
似然:
数据已经观察到了。
把同样的:
看成 的函数。
问:
哪个参数最能解释这些数据?
所以:
Probability:固定模型,看数据。
Likelihood:固定数据,看模型。
五十四、频率学派和贝叶斯学派
这是统计学两种重要哲学。
频率学派 Frequentist 通常把参数:
看成固定但未知。
随机的是样本。
而贝叶斯学派 Bayesian允许:
用概率分布表达我们对参数的不确定性。
例如:
数据进来以后:
所以贝叶斯分析会非常自然地说:
根据当前模型和数据,参数位于某区间的后验概率是 95%。
两种体系都有大量实际应用。
五十五、ANOVA 是什么?
假设不是比较两个班,而是:
A 班、B 班、C 班、D 班。
想知道平均成绩有没有差异。
你当然可以两两做很多 t-test。
但测试越多,误报概率就越来越高。
于是使用:
核心思想其实很漂亮:
比较:
和:
如果:
组间差异远远大于组内差异,
就有证据认为不同组的平均值并不完全一样。
五十六、卡方检验是什么?
如果变量不是连续成绩,而是分类数据。
例如:
男性/女性
喜欢 A/B/C
我们可能想知道:
两个分类变量是否有关联?
这时候经常使用:
卡方检验。
它的核心思想依然是:
如果两者相差非常大:
就开始怀疑“没有关系”这个假设。
五十七、统计学几乎可以压缩成三个问题
面对一组数据时,你其实一直在问三件事情。
第一:中心在哪里?
均值
中位数
众数
第二:有多分散?
方差
标准差
IQR
极差
第三:这种现象到底只是随机波动,还是背后真的存在规律?
标准误
置信区间
假设检验
p-value
回归
ANOVA
……
所以很多看似复杂的统计学,其实只是不断深化这三个问题。
五十八、把所有关键概念串成一张图
你可以把整个概率统计想成下面这条链:
↓
存在随机性
↓
定义随机变量
↓
随机变量有规律
↓
分布有中心
↓
分布有宽度
↓
现实中只能观察有限数据
↓
根据样本计算
↓
不同样本会给出不同结果
↓
大样本下很多统计量趋近正态
↓
衡量统计量的不确定性
↓
估计总体
↓
判断证据
↓
研究变量关系
这基本就是一门本科《概率论与数理统计》的骨架。
最后,重点记住这 12 个直觉
- 均值 = 数据的重心。
- 中位数 = 排序以后最中间的位置。
- 方差 = 平均平方偏离程度。
- 标准差 = 数据典型的波动尺度。
- 概率分布 = 随机结果会出现在哪里、各有多可能。
- 期望 = 无限长期重复后的平均结果。
- 正态分布 = 由均值决定中心、标准差决定宽度的钟形分布。
- z-score = 一个值离均值多少个标准差。
- 大数定律 = 样本越来越多,平均结果越来越稳定。
- 中心极限定理 = 大样本下,很多“平均型统计量”的抽样分布趋近正态。
- 标准误 = 统计量因为重新抽样而产生的波动。
- 统计推断 = 用有限样本,对未知总体做有不确定性的判断。
而最需要刻进脑子里的几个区别是:
如果这些真正理解了,概率统计最难的一层门槛其实就已经跨过去了。