概率分布 (Probability Distribution)
1. 定义
概率分布是描述随机变量所有可能取值及其对应概率的数学结构。 分两大类:离散型用概率质量函数 (PMF),连续型用概率密度函数 (PDF)。
形象记法:分布是”随机结果的总账本”——把所有可能值和它们出现的可能性列成一张表/曲线。离散是”按件数账”,连续是”按密度账”。
2. 核心概念
| 概念 | 含义 | 备注 |
|---|---|---|
| 随机变量 X | 取值有不确定性的变量 | 离散 / 连续 |
| PMF (Probability Mass Function) | 离散型:P(X=x) 直接给概率 | 所有值概率之和 = 1 |
| PDF (Probability Density Function) | 连续型:f(x) 给密度,不是概率 | 曲线下面积 = 1 |
| CDF (Cumulative Distribution Function) | 累积分布函数 F(x) = P(X ≤ x) | 离散/连续通用,单调不减 |
| 期望 E[X] | 取值的概率加权平均 | ”长期均值” |
| 方差 Var(X) | 取值偏离期望的平方期望 | 衡量”波动大小” |
| 参数 | 决定分布形状的常数 | 如正态的 μ、σ |
关键区分:连续分布里
P(X=某一点) = 0,只能谈区间概率P(a < X < b) = ∫f(x)dx;PDF 的值可以 > 1,只要总面积 = 1 即可。
3. 常见分布速查表
| 分布 | 类型 | 参数 | 典型场景 | 期望 / 方差 |
|---|---|---|---|---|
| 伯努利 Bernoulli | 离散 | p | 一次试验成功/失败 | p / p(1-p) |
| 二项 Binomial | 离散 | n, p | n 次独立试验成功的次数 | np / np(1-p) |
| 泊松 Poisson | 离散 | λ | 单位时间 rare 事件次数 | λ / λ |
| 均匀 Uniform | 连续 | a, b | 区间内无偏取值 | (a+b)/2 / (b-a)²/12 |
| 正态 Normal | 连续 | μ, σ | 自然界大量现象、误差 | μ / σ² |
| 指数 Exponential | 连续 | λ | 两次事件间隔时间 | 1/λ / 1/λ² |
4. 两个最常用分布的密度函数
正态分布(钟形曲线,对称)
f(x)
▲
│ ╭──╮
│ ╱ ╲
│ ╱ ╲
│ ╱ ╲
│──╯ ╰───→ x
└─────── μ ────────
μ-σ μ+σ
PDF: f(x) = (1 / (σ√(2π))) · exp(-(x-μ)² / (2σ²))
指数分布(无记忆性,正偏)
f(x)
▲╲
│ ╲
│ ╲
│ ╲___
│ └─────→ x
└── 0
PDF: f(x) = λ · exp(-λx), x ≥ 0
5. 高斯分布(正态分布)为什么重要
高斯分布之所以在统计学和机器学习里”默认出场率”最高,不是因为它好看,而是因为它有数学必然性。
核心原理:中心极限定理 (CLT)
大量独立同分布的随机变量之和,无论它们原本是什么分布,其分布都趋近于正态。
这意味着只要一个量是”许多小因素叠加”而成,它就接近正态——这就是自然界和工程里到处是正态的根本原因:
- 人的身高(基因 + 营养 + 环境 多因素叠加)
- 测量误差(多个独立误差源累加)
- 制造业零件尺寸偏差
- 信号噪声
实用意义速查
| 用途 | 为什么是正态 |
|---|---|
| 假设检验(z / t 检验) | 检验统计量在 H0 下渐近正态 |
| 线性回归 | 误差项假设正态时,最小二乘 = 最大似然估计 |
| 机器学习权重初始化 | 对称、易收敛,是深度学习的默认选择 |
| 信号噪声建模 | 多源噪声叠加 → 正态 |
| 异常检测 | 3σ 之外判为异常(仅 0.27% 概率) |
68-95-99.7 法则(σ 倍数与概率的对应,是正态分布最实用的速记)
f(x)
▲
│ ╭──╮
│ ╱ ╲
│ ╱ ╲
│ ╭──╯ ╰──╮
└──┴──────┬───────┴──→ x
μ
区间 理论概率 含义
───────────── ────────── ──────────────
μ ± 1σ 68.27% 约 2/3 的数据
μ ± 2σ 95.45% 95% 置信区间
μ ± 3σ 99.73% "3σ 异常检测"依据
工业上”6 Sigma 质量管理”就是要求缺陷率低于 3.4 ppm(4.5σ 长期偏移 + 1.5σ 漂移),名字正来源于此。
数学上的便利
- 完全由 μ、σ 两个参数决定
- 线性变换后仍是正态:
aX + b ~ N(aμ+b, a²σ²) - 独立正态之和仍是正态:
X + Y ~ N(μx+μy, σx²+σy²) - 标准化
Z = (X-μ)/σ ~ N(0,1)后可查通用表
一句话总结:高斯分布是”叠加效应”的数学签名。只要现象由多因素累加而成,它就是最自然的模型选择——这就是它的意义所在。
6. 用 NumPy / SciPy 采样与计算
import numpy as np
from scipy import stats
# ── 采样 ──
np.random.rand(1000) # [0,1) 均匀分布
np.random.randn(1000) # 标准正态 N(0,1)
np.random.normal(5, 2, 1000) # N(μ=5, σ=2)
np.random.binomial(n=10, p=0.3, size=1000) # 二项分布
np.random.poisson(lam=3, size=1000) # 泊松分布
np.random.exponential(scale=2, size=1000) # 指数分布,scale=1/λ
# ── 用 scipy 算概率 / 分位数 ──
stats.norm.cdf(1.96) # P(Z ≤ 1.96) ≈ 0.975
stats.norm.ppf(0.975) # 97.5% 分位数 ≈ 1.96
stats.norm.pdf(0) # 标准正态在 0 点的密度 ≈ 0.399
# ── 估计参数 ──
data = np.random.normal(10, 3, 5000)
mu_hat = data.mean() # 样本均值估计 μ
sigma_hat = data.std() # 样本标准差估计 σ7. 对比辨析表
| 对比维度 | PMF (离散) | PDF (连续) |
|---|---|---|
| 描述对象 | 离散随机变量 | 连续随机变量 |
| 函数值含义 | 概率 P(X=x) | 密度,不是概率 |
| 单点概率 | 可 > 0 | 恒 = 0 |
| 函数值可否 > 1 | 不可(每个值都是概率) | 可(只要面积=1) |
| 求区间概率方式 | Σ 求和 | ∫ 积分 |
| 总和/总面积 | Σ P(X=x) = 1 | ∫ f(x) dx = 1 |
8. 典型判断流程
要描述一个随机现象
│
能数清楚取值吗?
┌────┴────┐
是 否
离散型 连续型
│ │
事件发生概率 区间内取值
固定吗? 无偏吗?
│ │
┌──┴──┐ 均匀 / 正态 / 指数
伯努利/二项
└─ n 很大、p 很小 → 泊松近似
9. 常见误区
- ❌ “PDF 的 f(x) 就是概率” → 错,f(x) 是密度;概率是面积
∫f(x)dx,单点概率恒为 0 - ❌ “正态分布只能描述自然现象” → 错,由中心极限定理推出:大量独立同分布变量之和都近似正态,所以应用极广
- ❌ “泊松和指数是一回事” → 错,泊松描述”一段时间内事件次数”(离散),指数描述”两次事件间隔”(连续),但两者共享参数 λ
- ❌ “方差越大分布越偏” → 错,方差只描述离散程度,不描述偏态;偏态看 Skewness
- ❌ “二项分布 n 越大越接近泊松” → 错,要 n 大 且 p 小、np ≈ λ 才接近泊松;n 大 p 不小时接近正态
10. 延伸阅读 / 关联概念
- 中心极限定理 (CLT) — 为什么正态分布在自然界中如此普遍(详见第 5 节)
- Box-Muller 变换 — 从均匀分布手写实现正态采样的经典算法,见同目录
gaussian_implementation.py - 大数定律 (LLN) — 样本均值收敛到期望,是统计推断的基础
- 最大似然估计 (MLE) — 从样本反推分布参数的常用方法
- 贝叶斯推断 — 把参数本身也看成随机变量,有先验/后验分布
scipy.stats文档 — Python 里所有分布、检验、抽样方法的统一入口