概率统计基础实战:贝叶斯、随机变量、分布与推断

概率统计基础实战:概率的公理与条件概率、贝叶斯定理与先验后验、随机变量与期望方差、常见分布(二项/泊松/正态)、大数定律与中心极限定理、参数估计(MLE/区间估计)、假设检验(p 值/两类错误)、概率与统计在工程中的应用、常见陷阱。

引言

概率与统计是「用不确定性思考」的数学:概率从模型推结果(骰子有几面→点数分布),统计从结果推模型(掷了 1000 次→猜骰子是否公平)。工程里它无处不在——AB 测试、异常检测、推荐不确定性、模型评估的置信区间。本文把核心概念压缩成一张可用的地图:条件概率与贝叶斯、随机变量与分布、两大定律、估计与假设检验,末尾给工程速查。

前置:/others-big-o-complexity-guide/(数学基础)、/others-hashing-guide/(随机与分布)、/others-graph-algorithms/(模型思维)。


目录


1. 概率从哪来:公理与频率

1.1 两种解读

频率派:概率 = 大量重复实验的频率极限(掷骰子 1/6)
贝叶斯派:概率 = 对不确定性的"信念程度"(明天 60% 概率下雨)
两派工具不同但可共存:频率派做估计,贝叶斯派做更新

1.2 三大公理

1) 0 ≤ P(A) ≤ 1
2) P(必然事件) = 1
3) 互斥事件概率可加:P(A∪B) = P(A) + P(B)(A、B 不相交时)

1.3 补集与并集

P(¬A) = 1 - P(A)
P(A∪B) = P(A) + P(B) - P(A∩B)   # 减掉重复算的交集

记忆:概率两大流派——频率派看频率极限、贝叶斯派看信念程度;三条公理管边界;补集 1-P(A)、并集要减交集。


2. 条件概率与独立性

2.1 条件概率:已知信息更新概率

P(A|B) = P(A∩B) / P(B)   # 已知 B 发生下 A 的概率
直觉:把样本空间缩小到 B,看 A 占多大

2.2 乘法定理与全概率

P(A∩B) = P(A|B)·P(B)                       # 乘法
P(B) = Σ P(B|Ai)·P(Ai)                     # 全概率:把 B 按互斥的 Ai 拆开

2.3 独立性

独立:P(A∩B) = P(A)·P(B),等价于 P(A|B) = P(A)
独立 ≠ 互斥:独立是"一个发生不影响另一个概率",互斥是"不能同时发生"

记忆:条件概率 P(A|B)=P(A∩B)/P(B) 是「已知信息更新概率」;乘法、全概率是常用恒等式;独立是「一个不影响另一个概率」,别与互斥(不能同时发生)混淆。


3. 贝叶斯定理:先验与后验

3.1 公式

P(A|B) = P(B|A)·P(A) / P(B)

P(A):先验(B 发生前的信念)
P(B|A):似然(A 下 B 的可能性)
P(A|B):后验(看到 B 后的信念)
P(B):证据(归一化常数)

3.2 一个经典例子

某病患病率 P(病)=1%,检测准确率 P(阳|病)=99%,误报 P(阳|健康)=5%
你测出阳性,真患病概率?
P(病|阳) = 0.99·0.01 / (0.99·0.01 + 0.05·0.99) ≈ 16.7%
直觉:阳性没你想的那么吓人——健康人群基数大,误报淹没了真阳

3.3 贝叶斯的工程价值

# 垃圾邮件过滤:P(垃圾|词) 由词频更新
# 异常检测:先验 + 观测 → 后验
# A/B 测试:贝叶斯方法给出「B 更好的概率」
# 机器学习的朴素贝叶斯:假设特征独立简化计算

记忆:贝叶斯定理 P(A|B)=P(B|A)P(A)/P(B) 让信念随证据更新——先验×似然/证据得后验;患病率低时阳性未必患病(误报淹没真阳);垃圾邮件/异常检测/朴素贝叶斯都靠它。


4. 随机变量:期望与方差

4.1 期望:平均意义

E[X] = Σ x·P(X=x)(离散)/ ∫ x·f(x)dx(连续)
线性:E[aX+b] = aE[X]+b
注意:E[f(X)] ≠ f(E[X])(除非 f 线性)

4.2 方差:离散程度

Var[X] = E[(X-E[X])²] = E[X²] - (E[X])²
标准差 σ = √Var(与数据同量纲,更好解释)

4.3 协方差与相关性

Cov(X,Y) 度量线性关系
相关系数 ρ = Cov/(σx·σy) ∈ [-1, 1]
ρ=0 只说明"无线性关系",不代表独立(可能有非线性关系)

记忆:期望是均值意义(线性但非函数可交换)、方差是离散程度(σ 同量纲好解释)、相关系数度量线性关系——ρ=0 不代表独立。


5. 三大常见分布:二项泊松正态

5.1 二项分布:n 次独立成败实验的成功次数

X ~ B(n, p):成功概率 p 独立做 n 次
P(X=k) = C(n,k)·p^k·(1-p)^(n-k)
期望 np、方差 np(1-p)
应用:漏斗转化率、抽检合格数

5.2 泊松分布:稀有事件的计数

X ~ Poisson(λ):单位时间/空间内事件次数
P(X=k) = λ^k e^{-λ}/k!
期望=方差=λ
应用:网站请求数、故障次数、商店客流(λ 是平均率)

5.3 正态分布:自然界的默认

X ~ N(μ, σ²):钟形曲线,中心对称
68-95-99.7 法则:μ±σ 约 68%、±2σ 约 95%、±3σ 约 99.7%
应用:测量误差、身高体重、抽样分布(见 CLT)

记忆:三大分布——二项(n 次独立成败的成功数)、泊松(单位时间的稀有事件计数,期望=方差)、正态(钟形,68-95-99.7 法则)——按「计数/频率/测量」场景对号入座。


6. 大数定律与中心极限定理

6.1 大数定律:样本均值收敛到期望

实验次数越多,样本均值越接近真实期望
(骰子掷 1 万次,均值接近 3.5)
意义:为什么"多采样"能逼近真实值

6.2 中心极限定理(CLT):均值的分布趋于正态

不管原始分布是什么,只要独立同分布且方差有限:
样本均值的分布 → 正态分布(n 足够大)
这解释了正态无处不在,也是置信区间/假设检验的理论地基

6.3 工程启示

# 大量独立随机因素的叠加 ≈ 正态
# 抽样均值近似正态 → 可用 z 检验/正态近似
# 别把"单个样本"当正态——是"均值"正态

记忆:大数定律保证样本均值收敛到期望(多采样逼近真值),中心极限定理保证「独立同分布变量的均值」分布趋于正态(正态无处不在的理论根源)——是估计与检验的地基。


7. 参数估计:MLE 与置信区间

7.1 点估计:MLE

极大似然估计(MLE):找让"当前数据最可能发生"的参数
如掷硬币 700 次有 640 次正面 → 最可能的 p = 0.914
工程:很多模型训练就是"最大化似然/对数似然"

7.2 区间估计:置信区间

置信区间:对参数给出一个范围 + 置信水平
95% 置信区间:重复抽样 100 次,约 95 次的区间会包含真值
注意:是"方法覆盖真值 95%"而非"参数在区间内概率 95%"

7.3 从样本估总体

# 点估计给"最可能值",区间估计给"范围+把握"
# 区间宽度 ∝ σ/√n:样本越多区间越窄
# 用标准误(SE = σ/√n)表达估计的不确定度

记忆:点估计用 MLE 找「让数据最可能」的参数;区间估计给「范围+把握」(95% 置信区间=方法覆盖真值 95%,不是参数在里面的概率 95%);区间宽度随样本量以 √n 缩小。


8. 假设检验:p 值与两类错误

8.1 流程

H0(零假设):默认"没效果"(如新方案无提升)
H1(备择假设):有提升
样本统计 → 算出"如果 H0 成立,观察到这么极端结果的概率" = p 值
p 值 < 阈值(常 0.05)→ 拒绝 H0,认为有提升

8.2 p 值的正确定义

p 值:假设 H0 成立时,看到"现在或更极端"数据的概率
p 小 → 数据与 H0 不相容 → 拒绝 H0
p 大 → 数据与 H0 相容 → 不能拒绝(≠ 证明 H0 为真)

8.3 两类错误

第一类错误(假阳性):没效果却说有效 → 由 α(阈值)控制
第二类错误(假阴性):有效却说没效 → 由样本量与效应量控制
两类此消彼长:α 调小则假阳性少但假阴性多

记忆:假设检验 = 设 H0 没效果 → 算 p 值(H0 下看到这么极端数据的概率)→ 小于阈值拒绝 H0;p 小拒 H0、p 大「不能拒绝」而非证明 H0;两类错误——假阳性由 α 控制、假阴性由样本量控制,此消彼长。


9. 概率统计在工程中的应用

9.1 工程场景速查

场景用的统计工具
AB 测试假设检验/置信区间判断差异
异常检测正态的 3σ、分布偏离
推荐不确定性贝叶斯后验、置信区间
性能调优对比实验 + 置信区间
故障率/请求量泊松建模
模型评估置信区间表达指标不确定度

9.2 工程陷阱

# 把置信区间当"概率":是"方法覆盖概率"
# 只看 p 值不看效应量:统计显著≠实际显著
# 多重比较不校正:看 20 个指标必有几个"偶然显著"
# 采样偏差:抽样不代表总体,一切推断失真

记忆:工程应用按场景对号入座——AB 测试用假设检验、异常检测用 3σ、请求计数用泊松、指标用置信区间表达不确定度;陷阱是「置信区间当概率、只看 p 值不看效应量、多重比较不校正、采样偏差」。


10. 速查表与一句话记忆

概念一句话
条件概率P(A
贝叶斯后验∝似然×先验
期望/方差均值/离散程度
二项n 次成败的成功数
泊松单位时间计数,期望=方差
正态钟形,68-95-99.7
大数定律样本均值收敛期望
中心极限均值分布趋于正态
MLE让数据最可能的参数
置信区间范围+把握,方法覆盖率
p 值H0 下看到极端数据的概率

一句话记忆:概率从模型推结果、统计从结果推模型——条件概率 P(A|B)=P(A∩B)/P(B)、贝叶斯让信念随证据更新(后验∝似然×先验,低患病率下阳性未必患病);随机变量用期望(均值)与方差(离散)刻画,三大分布按场景选——二项(成败计数)、泊松(单位时间稀有事件,期望=方差)、正态(钟形 68-95-99.7);大数定律保证样本均值收敛、中心极限保证均值分布趋于正态(估计与检验的地基);推断两步——MLE 点估计 + 置信区间表达不确定度(95%=方法覆盖 95% 不是参数概率);假设检验用 p 值判断(小则拒 H0),警惕两类错误与「只看 p 值不看效应量、多重比较不校正」;工程里 AB 测试、异常检测、模型评估的不确定性全靠这套语言——「先问频率还是信念、再选分布与检验」是统计选型的起点。


延伸阅读

继续阅读

探索更多技术文章

浏览归档,发现更多关于系统设计、工具链和工程实践的内容。

全部文章 返回首页

「others」更多文章

  1. Markdown 与文档工程:写作规范、静态生成与 LaTeX 排版
  2. 终端与 Shell 生态进阶:zsh、tmux 与高效命令行工作流
  3. 图算法实战:遍历、最短路、最小生成树与拓扑排序