Back to Notes

一篇文章搞定概率论所有概念

Table of Contents
Table of Contents

一、概率论和统计学,到底有什么区别?

假设有一枚硬币。

概率论通常是:

我知道这是一枚公平硬币,正面概率 p=0.5p=0.5。 那么扔 100 次,大约会出现多少次正面?

也就是:

已知模型预测数据\text{已知模型} \rightarrow \text{预测数据}

统计学反过来:

我不知道这枚硬币是不是公平的。 我扔了 100 次,其中 63 次正面。 它真正的正面概率 (p) 大概是多少?

也就是:

观察数据推测模型\text{观察数据} \rightarrow \text{推测模型}

所以:

概率论是从原因推结果。

统计学是从结果猜原因。

这几乎就是整个学科的核心。


二、先理解“总体”和“样本”

假设我们想研究“新加坡所有大学生的身高”。

所有大学生构成:

总体 Population\boxed{\text{总体 Population}}

但你不可能把所有人都量一遍,所以随机找 1000 人。

这 1000 人叫:

样本 Sample\boxed{\text{样本 Sample}}

总体真正的平均身高可能是:

μ=170.4\mu = 170.4

这里的 μ\mu总体参数 parameter

但我们不知道它。

于是根据 1000 人算:

xˉ=170.7\bar{x}=170.7

这里的 xˉ\bar{x}样本统计量 statistic

于是统计学最核心的问题来了:

我只看到了样本,能不能推测总体?

之后你学到的:

标准误、置信区间、假设检验、p 值、回归分析……

本质上都在解决这个问题。


三、均值是什么?

假设五个人考试成绩:

60, 70, 80, 90, 10060,\ 70,\ 80,\ 90,\ 100

总分:

400400

平均分:

xˉ=4005=80\bar{x}=\frac{400}{5}=80

公式就是:

xˉ=x1+x2++xnn\bar{x}=\frac{x_1+x_2+\cdots+x_n}{n}

但不要只把均值理解成“加起来除以个数”。

更好的理解是:

如果把所有人的东西重新平均分配,每个人最后得到多少?

例如五个人分别有:

0, 0, 0, 0, 1000,\ 0,\ 0,\ 0,\ 100

平均数还是:

2020

虽然没有任何一个人真的拥有 20。

所以均值描述的是:

数据的重心\boxed{\text{数据的重心}}

你甚至可以想象每个数字都是跷跷板上的重量,均值就是能够把整个跷跷板平衡起来的位置。


四、中位数是什么?

数据:

1, 2, 3, 4, 1001,\ 2,\ 3,\ 4,\ 100

均值:

2222

但这显然不能很好地表示“典型的人”。

中位数是:

33

因为一半数据在它左边,一半数据在它右边。

因此:

均值看的是全部数值的大小。

中位数看的是排序以后的位置。

极端值会严重影响均值,却不太影响中位数。

这就是为什么收入、房价这些数据经常喜欢报告中位数

例如:

3000, 3200, 3500, 4000, 1000003000,\ 3200,\ 3500,\ 4000,\ 100000

平均收入会被最后一个人猛烈拉高。

中位数则依然是:

35003500

五、众数是什么?

众数 mode 就是:

出现次数最多的值。

比如:

1,1,1,2,2,51,1,1,2,2,5

众数:

11

它对分类数据特别重要。

例如最受欢迎的手机颜色:

黑、黑、白、黑、蓝……

“平均颜色”没有意义。

但众数有意义。


六、为什么只有平均数还远远不够?

来看两组成绩。

A:

79,80,80,80,8179,80,80,80,81

B:

20,50,80,110,14020,50,80,110,140

两组平均值都是:

8080

但明显不是一种情况。

A 全部挤在 80 附近。

B 非常分散。

所以我们还需要第二个问题:

数据离平均值有多远?

这就是:

方差\boxed{\text{方差}}

标准差\boxed{\text{标准差}}

存在的原因。


七、方差到底是什么?

假设数据:

2, 4, 62,\ 4,\ 6

平均值:

μ=4\mu=4

每个数字离平均值的距离:

24=22-4=-244=04-4=064=26-4=2

如果直接平均:

2+0+23=0\frac{-2+0+2}{3}=0

永远会抵消。

因为均值本来就是数据的平衡点。

所以不能直接平均“偏差”。

数学家想到:

把距离平方。

于是:

(2)2=4(-2)^2=402=00^2=022=42^2=4

平均:

4+0+43===============83\frac{4+0+4}{3} =============== \frac83

这就是方差。

总体方差:

σ2========1Ni=1N(xiμ)2\sigma^2 ======== \frac1N\sum_{i=1}^N(x_i-\mu)^2

因此最直觉的理解是:

方差 = 数据距离均值的平均平方距离\boxed{\text{方差 = 数据距离均值的平均平方距离}}

方差越大:

数据越散。

方差越小:

数据越集中。


八、为什么还需要“标准差”?

方差有一个很讨厌的问题。

假如数据单位是:

厘米\text{厘米}

那么:

(xμ)2(x-\mu)^2

单位就变成:

厘米2\text{厘米}^2

比如平均身高:

170 cm

方差:

100 cm²

“平方厘米的身高波动”很难直观理解。

怎么办?

开平方。

σ=σ2\sigma=\sqrt{\sigma^2}

这就是:

标准差 Standard Deviation\boxed{\text{标准差 Standard Deviation}}

于是单位重新变回 cm。

所以:

方差适合数学计算;标准差适合人的直觉。

如果平均身高:

170 cm170\text{ cm}

标准差:

5 cm5\text{ cm}

你可以大致理解为:

人们的身高通常在距离 170 cm 几厘米的范围内波动。

因此你可以把标准差粗略想成:

“典型波动距离”\boxed{\text{“典型波动距离”}}

虽然严格来说它不是普通的平均距离。


九、为什么方差要平方,而不是取绝对值?

完全可以定义:

xμ|x-\mu|

事实上统计学里确实有这种东西:

平均绝对偏差

但平方有很多数学优势。

例如平方:

(xμ)2(x-\mu)^2

是光滑函数,方便微积分。

而且平方会严重惩罚极端偏差:

偏差 2:

22=42^2=4

偏差 10:

102=10010^2=100

所以方差对异常值非常敏感。

这既可能是优点,也是缺点。


十、极差、四分位数和 IQR

描述离散程度并不只有标准差。

最简单的是:

Range=maxmin\text{Range}=\max-\min

极差

但极差严重受异常值影响。

因此常用:

四分位数 quartile

把数据从小到大排列。

25% 的位置:

Q1Q_1

50% 的位置:

Q2=medianQ_2=\text{median}

75% 的位置:

Q3Q_3

然后:

IQR=Q3Q1IQR=Q_3-Q_1

IQR 描述的是:

中间 50% 数据覆盖多大的范围。

箱线图 Box Plot 基本就是围绕这些量建立的。


十一、概率究竟是什么?

最简单的理解:

0P(A)10\leq P(A)\leq1

(P(A)) 表示事件 (A) 发生的不确定程度。

例如骰子:

P(X=6)=16P(X=6)=\frac16

但概率真正重要的地方并不是“算骰子”。

而是:

给不确定性一种数学语言。

例如:

明天下雨。

一个客户购买。

药物治愈。

机器发生故障。

股票发生某种收益。

模型预测正确。

都可以看成随机事件。


十二、事件、样本空间

扔一个骰子。

所有可能结果:

Ω=1,2,3,4,5,6\Omega={1,2,3,4,5,6}

叫:

样本空间\boxed{\text{样本空间}}

事件 A:

出现偶数。

那么:

A=2,4,6A={2,4,6}

所以事件其实就是:

可能结果组成的集合\boxed{\text{可能结果组成的集合}}

这也是为什么概率论和集合论关系非常密切。


十三、并集、交集、补集

如果:

A = 今天下雨

B = 今天刮风

那么:

ABA\cap B

表示:

又下雨又刮风。

而:

ABA\cup B

表示:

下雨或者刮风,至少一个发生。

而:

AcA^c

表示:

不下雨。

于是:

P(Ac)=1P(A)P(A^c)=1-P(A)

十四、条件概率:整个概率论最重要的思想之一

假设:

1000 人中,

100 人患病。

其中 90 人检测阳性。

那么:

P(阳性患病)=========================90P(\text{阳性}\mid\text{患病}) ========================= 90%

这里:

P(AB)P(A|B)

读作:

在已经知道 B 发生的条件下,A 的概率是多少?

公式:

P(AB)=P(AB)P(B)P(A|B)=\frac{P(A\cap B)}{P(B)}

它的思想非常重要:

一旦获得新的信息,你应该重新缩小观察范围。

例如:

“一个随机的人是程序员的概率”

和:

“一个已经知道计算机专业毕业的人是程序员的概率”

显然不同。

因为第二个条件改变了我们的信息。


十五、独立是什么意思?

如果知道 B 是否发生,完全不会改变 A 的概率:

P(AB)=P(A)P(A|B)=P(A)

我们说:

A,BA,B

相互独立。

例如理想情况下连续扔两次硬币:

第一次正面不会改变第二次正面的概率。

于是:

P(AB)=P(A)P(B)P(A\cap B)=P(A)P(B)

但是注意:

互斥 ≠ 独立。

例如一次扔骰子:

A = 出现 1

B = 出现 2

它们不可能同时发生,所以互斥。

但显然不独立。

因为如果已经知道出现 1:

P(BA)=0P(B|A)=0

十六、贝叶斯公式到底在干嘛?

这是整个数据科学、机器学习里特别重要的思想。

假设:

A = 有病

B = 检测阳性

医生通常知道:

P(BA)P(B|A)

也就是:

有病的人检测阳性的概率。

但患者真正关心:

P(AB)P(A|B)

也就是:

我检测阳性以后,我真正患病的概率是多少?

这两个不是一回事。

贝叶斯公式:

P(AB)======P(BA)P(A)P(B)P(A|B) ====== \frac{P(B|A)P(A)}{P(B)}

最值得记住的不是公式,而是:

原来的相信程度 + 新证据 → 更新后的相信程度\boxed{\text{原来的相信程度 + 新证据 → 更新后的相信程度}}

也就是:

Prior 先验

看到数据

Posterior 后验

贝叶斯统计基本就是不断进行这种更新。


十七、随机变量是什么?

这是概率论中一个容易被名字搞晕的概念。

随机变量其实不是“随机变化的变量”这么简单。

它本质上是:

把随机结果映射成数字。

比如扔两次硬币。

可能结果:

HH HT TH TT

定义:

X=正面数量X=\text{正面数量}

于是:

HH → 2

HT → 1

TH → 1

TT → 0

(X) 就是一个随机变量。


十八、离散随机变量和连续随机变量

如果可能值一个一个可以数:

0,1,2,3,0,1,2,3,\dots

叫:

离散随机变量\boxed{\text{离散随机变量}}

例如:

一天收到多少封邮件。

10 次投篮命中几次。

一个家庭有几个孩子。

如果可以连续取值:

170.1234...170.1234...

叫:

连续随机变量\boxed{\text{连续随机变量}}

例如:

身高、体重、时间、温度。


十九、概率分布是什么?

随机变量有很多可能结果。

概率分布告诉你:

每种结果有多可能出现。

比如公平骰子:

P(X=1)=16P(X=1)=\frac16

一直到:

P(X=6)=16P(X=6)=\frac16

这就是骰子的概率分布。

所以:

分布 = 随机变量可能出现在哪里,以及出现得有多频繁\boxed{\text{分布 = 随机变量可能出现在哪里,以及出现得有多频繁}}

这是整个统计学最核心的概念之一。


二十、概率质量函数 PMF

用于离散随机变量。

例如二项分布:

P(X=k)P(X=k)

直接告诉你:

X=kX=k 的概率。

所以离散情况下一个点真的可以拥有概率。


二十一、概率密度函数 PDF

连续变量就有点特别。

比如人的身高服从某个连续分布。

理论上:

P(X=170.0000000000)=0P(X=170.0000000000)=0

因为可能的小数无限多。

因此连续随机变量看的是:

P(169<X<171)P(169<X<171)

也就是:

一个区间下面的面积。

所以 PDF 的高度本身不是概率。

概率 = 密度曲线下面积\boxed{\text{概率 = 密度曲线下面积}}

这是非常容易搞错的地方。


二十二、CDF 是什么?

CDF:

F(x)=P(Xx)F(x)=P(X\le x)

翻译成人话:

随机变量小于等于 (x) 的概率是多少?

例如:

F(170)=P(身高170)F(170)=P(\text{身高}\le170)

如果:

F(170)=0.48F(170)=0.48

意思就是:

48% 的人身高不超过 170。

CDF 会从:

00

一路增长到:

11

二十三、期望值是什么?

期望值 expected value 是概率论版本的平均数。

例如赌博:

50% 赢 100 元。

50% 输 20 元。

长期平均:

E(X) ==== # 0.5(100)+0.5(-20) 40

因此:

期望值 = 按概率加权后的长期平均结果\boxed{\text{期望值 = 按概率加权后的长期平均结果}}

离散情况下:

E(X)=xxP(X=x)E(X)=\sum_xxP(X=x)

注意:

期望值不一定是一个实际可能出现的值。

比如骰子:

E(X)=3.5E(X)=3.5

骰子永远不会出现 3.5。

但如果扔很多很多次:

平均点数会越来越接近 3.5。


二十四、随机变量的方差

随机变量不仅有期望:

E(X)E(X)

还可以有方差:

Var(X)Var(X)

它描述:

随机结果通常离期望有多分散。

定义:

Var(X)=E[(XE(X))2]Var(X)=E[(X-E(X))^2]

还有一个非常常用的等价公式:

Var(X)======E(X2)[E(X)]2Var(X) ====== E(X^2)-[E(X)]^2

标准差:

SD(X)=Var(X)SD(X)=\sqrt{Var(X)}

所以“数据里的方差”和“概率分布里的方差”其实是同一个思想。


二十五、正态分布到底是什么?

这可能是整个统计学最著名的分布:

XN(μ,σ2)X\sim N(\mu,\sigma^2)

形状就是钟形。

中间最多,两边越来越少。

它由两个数字控制:

μ\mu

决定中心在哪里。

而:

σ\sigma

决定曲线有多宽。

所以你现在应该能发现:

均值决定中心。

标准差决定散布。

如果标准差很小:

数据紧紧挤在均值旁边。

如果标准差很大:

数据铺得很开。


二十六、68–95–99.7 法则

对于正态分布:

大约 68% 数据位于:

μ±1σ\mu\pm1\sigma

大约 95% 位于:

μ±2σ\mu\pm2\sigma

大约 99.7% 位于:

μ±3σ\mu\pm3\sigma

比如:

μ=170,σ=5\mu=170,\quad \sigma=5

那么大约 68%:

165175165\sim175

大约 95%:

160180160\sim180

所以标准差一下就获得了非常直观的意义。


二十七、为什么正态分布到处出现?

并不是因为“所有东西天生都是正态的”。

而是很多现实变量受到大量小因素共同影响

例如身高受到:

基因、营养、睡眠、疾病、环境、激素……

很多因素加起来以后,经常形成近似钟形。

更深层的原因则来自一个统计学超级核心定理:

中心极限定理\boxed{\text{中心极限定理}}

我们很快讲。


二十八、标准正态分布和 z-score

不同考试没办法直接比较。

考试 A:

μ=80,σ=10\mu=80,\quad\sigma=10

你考:

90。

考试 B:

μ=60,σ=5\mu=60,\quad\sigma=5

你考:

70。

哪次表现更突出?

使用:

z=xμσz=\frac{x-\mu}{\sigma}

A:

z=908010=1z=\frac{90-80}{10}=1

B:

z=70605=2z=\frac{70-60}{5}=2

所以 B 更突出。

z-score 的真正含义就是:

距离平均值多少个标准差\boxed{\text{距离平均值多少个标准差}}

z=0z=0

正好在平均值。

z=1z=1

比平均值高一个标准差。

z=2z=-2

比平均值低两个标准差。

它相当于给不同尺度的数据建立了一种共同语言。


二十九、常见概率分布其实是在描述不同的随机机制

你不需要一开始背几十种分布。先理解最重要的几类。

分布 它在描述什么
Bernoulli 伯努利 一次成功/失败
Binomial 二项 做 (n) 次,成功多少次
Poisson 泊松 一段时间/空间发生多少次
Uniform 均匀 区间内各位置一样可能
Normal 正态 大量因素共同形成的连续波动
Exponential 指数 等待下一次事件要多久

比如投一次篮:

XBernoulli(p)X\sim Bernoulli(p)

连续投 100 次,问命中多少:

XBinomial(100,p)X\sim Binomial(100,p)

一个客服中心每分钟收到多少电话:

可能用 Poisson。

下一通电话多久出现:

可能用 Exponential。


三十、大数定律是什么?

假设公平硬币:

P(正面)=0.5P(\text{正面})=0.5

扔 10 次,可能:

70% 正面。

一点也不奇怪。

扔 100 次:

可能 56%。

扔 10,000 次:

可能 50.4%。

扔得越来越多:

样本平均理论期望\text{样本平均} \rightarrow \text{理论期望}

这就是:

大数定律\boxed{\text{大数定律}}

它告诉我们:

大量重复观察可以让随机波动逐渐被平均掉。

所以赌场为什么赚钱?

不是赌场每一局一定赢。

而是玩的局数足够多以后:

实际平均收益理论期望收益\text{实际平均收益} \approx \text{理论期望收益}

三十一、中心极限定理是统计学真正的“大魔法”

假设总体根本不是正态分布。

甚至长得特别奇怪。

从中随机抽:

n=100n=100

算平均值:

Xˉ\bar X

重新抽 100 个。

又算:

Xˉ\bar X

重复很多很多次。

你得到很多:

Xˉ\bar X

这些“样本平均数”形成一个新的分布。

神奇的事情发生了:

在很广泛的条件下,当样本量足够大时,样本均值的分布会趋近正态分布。

也就是:

XˉN(μ,σ2n)\bar X \approx N\left( \mu, \frac{\sigma^2}{n} \right)

这解释了为什么正态分布会统治统计学。

不是因为:

所有原始数据都是正态的。

而是因为:

很多统计量的抽样分布近似正态。

这是完全不同的概念。


三十二、抽样分布是什么?

这个概念非常重要,而且很多初学者第一次都会混乱。

假设总体平均值:

μ=170\mu=170

每次随机抽 100 人。

第一次:

xˉ=169.7\bar x=169.7

第二次:

170.4170.4

第三次:

170.1170.1

……

样本不同,平均数也会变化。

于是:

Xˉ\bar X

本身也是随机变量。

所有可能的样本平均数组成的分布,就是:

抽样分布\boxed{\text{抽样分布}}

这句话非常关键:

统计量自己也会随机波动。

统计推断几乎全部建立在这个事实上。


三十三、标准差和标准误千万不要混

这是统计学最经典的混淆之一。

标准差 SD:

描述:

个体之间差异有多大。

例如:

人的身高标准差 8 cm。

标准误 SE:

描述:

如果重新抽样,你算出来的平均值会波动多大。

对于样本均值:

SE(Xˉ)=σnSE(\bar X)=\frac{\sigma}{\sqrt n}

所以:

nSEn\uparrow \quad\Rightarrow\quad SE\downarrow

也就是说:

样本越大,我们对总体均值估计得越稳定。

一句话区分:

SD:人和人有多不同\boxed{\text{SD:人和人有多不同}}SE:这次估出来的均值有多不稳定\boxed{\text{SE:这次估出来的均值有多不稳定}}

三十四、为什么样本量增加这么重要?

因为:

SE=σnSE=\frac{\sigma}{\sqrt n}

例如:

n=100n=100

再提高到:

n=400n=400

样本量增加了 4 倍。

但标准误只是:

12\frac12

所以提高统计精度的成本其实挺高。

想让误差缩小到原来的 1/10:

样本量大约要变成:

100100

倍。


三十五、点估计是什么?

我们不知道总体均值:

μ\mu

抽样以后得到:

xˉ=170.3\bar x=170.3

于是直接猜:

μ170.3\mu\approx170.3

这叫:

点估计\boxed{\text{点估计}}

因为给了一个单独的数字。

问题是:

这个数字肯定存在随机误差。

所以最好不要只说:

170.3。

而是给一个范围。

这就出现了置信区间。


三十六、置信区间是什么?

例如估计:

170.3±0.8170.3\pm0.8

得到:

[169.5,171.1][169.5,171.1]

这就是一个置信区间。

直觉上:

与其假装自己知道准确答案,不如诚实地表达估计的不确定程度。

样本越大:

SESE\downarrow

所以置信区间通常越窄。

数据本身波动越大:

SDSD\uparrow

所以区间越宽。

因此:

置信区间 = 估计值 + 不确定程度\boxed{\text{置信区间 = 估计值 + 不确定程度}}

三十七、95% 置信区间是什么意思?

这是一个非常容易讲错的概念。

经典频率学派定义中,不严格应该说:

“总体参数有 95% 概率位于这个已经算出来的区间里。”

因为总体参数被认为是固定的。

真正的意思是:

如果重复整个抽样过程很多很多次,并且每次都按照相同方法构造置信区间,那么长期来看,大约 95% 的区间会覆盖真正的参数。

不过在日常理解阶段,可以先把它近似理解为:

这是一个具有较高可靠程度的合理参数范围。

等学得更深入以后再严格区分。


三十八、假设检验到底在解决什么?

假设有人说:

“这种药没有效果。”

数学上建立一个:

H0H_0

叫:

零假设 null hypothesis

比如:

H0:μ药物===================μ安慰剂H_0:\mu_{\text{药物}} =================== \mu_{\text{安慰剂}}

然后收集数据。

如果数据和“没有效果”这个假设非常不协调,我们开始怀疑:

H0H_0

于是可能拒绝它。

整个假设检验的逻辑其实很像:

先暂时假设被告无罪,再问:如果真的无罪,眼前这么极端的证据有多容易出现?


三十九、p-value 到底是什么?

这是统计学被误解最多的东西之一。

p-value 的意思是:

假设 (H_0) 真的成立,那么出现当前这么极端或更加极端数据的概率是多少?

即:

P(这么极端的数据H0)P(\text{这么极端的数据}\mid H_0)

例如:

p=0.003p=0.003

意思:

如果零假设真的成立,那么看到如此极端结果的概率大约只有 0.3%。

因此我们开始怀疑零假设。

但是 p-value 不是

P(H0是真的data)P(H_0\text{是真的}\mid data)

所以:

p=0.05p=0.05

绝对不意味着:

“零假设只有 5% 概率是真的。”

这是最常见的错误解释之一。


四十、显著性水平 α\alpha

通常人为设定:

α=0.05\alpha=0.05

如果:

p<0.05p<0.05

经常称:

statistically significant,统计显著。

但 0.05 并不是宇宙真理。

它只是一个传统阈值。

而且:

统计显著现实中重要\boxed{\text{统计显著}\neq\text{现实中重要}}

例如一个药物平均延长寿命:

0.2 天。

如果样本是几百万人,也可能得到:

p<0.000001p<0.000001

但实际意义可能很小。

所以一定要同时考虑:

效应大小 effect size。


四十一、一类错误和二类错误

假设检验永远可能犯错。

真实情况有两种:

药没效果。

药有效果。

你的结论也有两种:

拒绝 (H_0)。

不拒绝 (H_0)。

于是产生两个重要错误。

情况 含义
Type I error 实际没效果,你却说有效
Type II error 实际有效,你却没发现

第一类错误概率通常由:

α\alpha

控制。

而:

1β1-\beta

叫统计功效:

Power\boxed{\text{Power}}

表示:

真有一个效果时,你能把它检测出来的概率。


四十二、相关系数是什么?

假设学习时间增加时,成绩通常也增加。

我们想描述两个变量一起变化的程度。

最经典的是 Pearson correlation:

rr

范围:

1r1-1\le r\le1

r1r\approx1

强正线性关系。

r1r\approx-1

强负线性关系。

r0r\approx0

没有明显线性关系。

注意最后两个字:

线性\boxed{\text{线性}}

比如:

y=x2y=x^2

可能关系非常强,但 Pearson (r) 可能接近 0。


四十三、协方差是什么?

相关系数的前身其实是:

Cov(X,Y)Cov(X,Y)

如果:

X 高于自己的平均值时,Y 通常也高于自己的平均值:

协方差为正。

如果 X 高时 Y 通常低:

协方差为负。

问题是协方差带单位,不方便比较。

所以标准化以后:

ρ====Cov(X,Y)σXσY\rho ==== \frac{Cov(X,Y)} {\sigma_X\sigma_Y}

得到相关系数。

因此可以把相关系数理解成:

标准化后的协方差\boxed{\text{标准化后的协方差}}

四十四、“相关不代表因果”到底为什么?

假设发现:

冰淇淋销量 ↑

溺水人数 ↑

难道冰淇淋导致溺水?

不是。

可能存在第三个变量:

天气温度\text{天气温度}

天气越热:

冰淇淋销量 ↑

游泳的人 ↑

溺水人数 ↑

这种第三变量叫:

混杂变量 confounder\boxed{\text{混杂变量 confounder}}

因此:

XYX\leftrightarrow Y

并不能自动推出:

XYX\rightarrow Y

因果推断比相关分析困难得多。


四十五、线性回归是什么?

假设:

X=学习时间X=\text{学习时间}Y=考试成绩Y=\text{考试成绩}

我们希望找到一条线:

y^=b0+b1x\hat y=b_0+b_1x

这里:

(b_0):截距。

(b_1):斜率。

例如:

y^=50+5x\hat y=50+5x

意思:

每多学习 1 小时,模型预测成绩增加约 5 分。

所以回归的本质是:

利用 X 的信息预测/解释 Y\boxed{\text{利用 X 的信息预测/解释 Y}}

四十六、残差是什么?

真实成绩:

y=83y=83

模型预测:

y^=80\hat y=80

差:

e=yy^=3e=y-\hat y=3

这叫:

残差 residual\boxed{\text{残差 residual}}

回归模型实际上就是努力让这些残差尽量小。

普通最小二乘回归 OLS 通常最小化:

i(yiy^i)2\sum_i(y_i-\hat y_i)^2

你会发现:

又平方了。

这和方差中的平方误差思想高度一致。


四十七、R2R^2 是什么?

假如你完全不知道学习时间。

最好可能只能猜平均成绩。

知道学习时间以后,预测变准确了一些。

R2R^2 衡量的是:

模型解释掉了多少原来的波动。

比如:

R2=0.7R^2=0.7

粗略理解:

Y 的样本波动中约 70% 可以由这个模型解释。

但高 R2R^2 不等于:

模型正确。

存在因果。

预测未来一定好。


四十八、偏差 Bias 和方差 Variance

机器学习和统计学里还有一组非常重要的概念。

假设用弓箭射靶。

如果箭都集中在错误的位置:

高 Bias\boxed{\text{高 Bias}}

说明系统性偏了。

如果箭到处分散:

高 Variance\boxed{\text{高 Variance}}

说明不稳定。

理想情况:

既准确又稳定。

这就是著名的:

Bias–Variance Tradeoff\boxed{\text{Bias–Variance Tradeoff}}

模型太简单:

容易欠拟合 → Bias 高。

模型太复杂:

容易过拟合 → Variance 高。


四十九、偏度 Skewness

并不是所有分布都是对称的。

比如个人收入通常:

大量人集中在中低区域。

少数超级富豪形成长长的右尾。

这是:

右偏 / 正偏\boxed{\text{右偏 / 正偏}}

右偏分布通常:

mean>medianmean>median

因为右边极端大值把平均数拉过去。

左偏则反过来。

所以:

看数据时,不仅要问“中心在哪里”,还要问“形状是什么”。


五十、异常值 Outlier

异常值就是明显远离其他数据的点。

例如:

10,11,10,12,11,30010,11,10,12,11,300

300 就非常可疑。

但异常值并不一定是“错误数据”。

它可能意味着:

录入错误。

测量错误。

极端但真实的情况。

新的现象。

欺诈。

所以正确态度不是:

看到异常值就删。

而是:

先调查它为什么异常。


五十一、参数统计和非参数统计

很多经典统计方法会假设数据符合某些形式。

例如正态分布。

这类方法经常叫:

参数方法\boxed{\text{参数方法}}

如果不想做太强的分布假设,可以用:

非参数方法\boxed{\text{非参数方法}}

例如一些基于排序的方法。

“非参数”并不是完全没有参数,而是对总体分布形式的限制往往更少。


五十二、最大似然估计 MLE

这是现代统计和机器学习的核心思想之一。

假设硬币正面概率是:

pp

不知道 (p)。

实际观察:

HHHTH

那么问:

哪个 (p) 最容易产生我看到的这组数据?

把:

P(观察到这些数据p)P(\text{观察到这些数据}\mid p)

看成 (p) 的函数。

它叫:

L(p)L(p)

即 likelihood,似然。

然后选使它最大的:

p^\hat p

这就是:

Maximum Likelihood Estimation\boxed{\text{Maximum Likelihood Estimation}}

一句话:

选择一个最能解释已观察数据的模型参数。

很多机器学习训练过程,本质上就是 MLE 或它的变体。


五十三、Probability 和 Likelihood 有什么区别?

这个区别非常漂亮。

概率:

P(dataθ)P(data|\theta)

参数 θ\theta 已知。

问:

什么数据可能发生?

似然:

数据已经观察到了。

把同样的:

P(dataθ)P(data|\theta)

看成 θ\theta 的函数。

问:

哪个参数最能解释这些数据?

所以:

Probability:固定模型,看数据。

Likelihood:固定数据,看模型。


五十四、频率学派和贝叶斯学派

这是统计学两种重要哲学。

频率学派 Frequentist 通常把参数:

θ\theta

看成固定但未知。

随机的是样本。

贝叶斯学派 Bayesian允许:

用概率分布表达我们对参数的不确定性。

例如:

P(θdata)P(\theta|data)

数据进来以后:

PriorLikelihoodPosterior\text{Prior} \rightarrow \text{Likelihood} \rightarrow \text{Posterior}

所以贝叶斯分析会非常自然地说:

根据当前模型和数据,参数位于某区间的后验概率是 95%。

两种体系都有大量实际应用。


五十五、ANOVA 是什么?

假设不是比较两个班,而是:

A 班、B 班、C 班、D 班。

想知道平均成绩有没有差异。

你当然可以两两做很多 t-test。

但测试越多,误报概率就越来越高。

于是使用:

ANOVA 方差分析\boxed{\text{ANOVA 方差分析}}

核心思想其实很漂亮:

比较:

组与组之间差异\text{组与组之间差异}

和:

组内自然波动\text{组内自然波动}

如果:

组间差异远远大于组内差异,

就有证据认为不同组的平均值并不完全一样。


五十六、卡方检验是什么?

如果变量不是连续成绩,而是分类数据。

例如:

男性/女性

喜欢 A/B/C

我们可能想知道:

两个分类变量是否有关联?

这时候经常使用:

χ2\chi^2

卡方检验。

它的核心思想依然是:

实际观察到的情况 vs 没有关联时应该出现的情况\boxed{\text{实际观察到的情况 vs 没有关联时应该出现的情况}}

如果两者相差非常大:

就开始怀疑“没有关系”这个假设。


五十七、统计学几乎可以压缩成三个问题

面对一组数据时,你其实一直在问三件事情。

第一:中心在哪里?

均值

中位数

众数

第二:有多分散?

方差

标准差

IQR

极差

第三:这种现象到底只是随机波动,还是背后真的存在规律?

标准误

置信区间

假设检验

p-value

回归

ANOVA

……

所以很多看似复杂的统计学,其实只是不断深化这三个问题。


五十八、把所有关键概念串成一张图

你可以把整个概率统计想成下面这条链:

现实世界\boxed{\text{现实世界}}

存在随机性

概率\boxed{\text{概率}}

定义随机变量

随机变量 X\boxed{\text{随机变量 }X}

随机变量有规律

概率分布\boxed{\text{概率分布}}

分布有中心

E(X), μ, mean\boxed{E(X),\ \mu,\ \text{mean}}

分布有宽度

Var(X), σ\boxed{Var(X),\ \sigma}

现实中只能观察有限数据

Sample\boxed{\text{Sample}}

根据样本计算

xˉ, s\boxed{\bar x,\ s}

不同样本会给出不同结果

Sampling Distribution\boxed{\text{Sampling Distribution}}

大样本下很多统计量趋近正态

Central Limit Theorem\boxed{\text{Central Limit Theorem}}

衡量统计量的不确定性

Standard Error\boxed{\text{Standard Error}}

估计总体

Confidence Interval\boxed{\text{Confidence Interval}}

判断证据

Hypothesis Test / p-value\boxed{\text{Hypothesis Test / p-value}}

研究变量关系

Correlation / Regression\boxed{\text{Correlation / Regression}}

这基本就是一门本科《概率论与数理统计》的骨架。


最后,重点记住这 12 个直觉

  1. 均值 = 数据的重心。
  2. 中位数 = 排序以后最中间的位置。
  3. 方差 = 平均平方偏离程度。
  4. 标准差 = 数据典型的波动尺度。
  5. 概率分布 = 随机结果会出现在哪里、各有多可能。
  6. 期望 = 无限长期重复后的平均结果。
  7. 正态分布 = 由均值决定中心、标准差决定宽度的钟形分布。
  8. z-score = 一个值离均值多少个标准差。
  9. 大数定律 = 样本越来越多,平均结果越来越稳定。
  10. 中心极限定理 = 大样本下,很多“平均型统计量”的抽样分布趋近正态。
  11. 标准误 = 统计量因为重新抽样而产生的波动。
  12. 统计推断 = 用有限样本,对未知总体做有不确定性的判断。

而最需要刻进脑子里的几个区别是:

总体样本\boxed{\text{总体}\neq\text{样本}}参数统计量\boxed{\text{参数}\neq\text{统计量}}方差标准差\boxed{\text{方差}\neq\text{标准差}}标准差标准误\boxed{\text{标准差}\neq\text{标准误}}相关因果\boxed{\text{相关}\neq\text{因果}}统计显著实际重要\boxed{\text{统计显著}\neq\text{实际重要}}P(AB)P(BA)\boxed{P(A|B)\neq P(B|A)}

如果这些真正理解了,概率统计最难的一层门槛其实就已经跨过去了。



0 / 2000
Loading comments...