概率分布 (Probability Distribution)

1. 定义

概率分布是描述随机变量所有可能取值及其对应概率的数学结构。 分两大类:离散型用概率质量函数 (PMF),连续型用概率密度函数 (PDF)。

形象记法:分布是”随机结果的总账本”——把所有可能值和它们出现的可能性列成一张表/曲线。离散是”按件数账”,连续是”按密度账”。

2. 核心概念

概念含义备注
随机变量 X取值有不确定性的变量离散 / 连续
PMF (Probability Mass Function)离散型:P(X=x) 直接给概率所有值概率之和 = 1
PDF (Probability Density Function)连续型:f(x) 给密度,不是概率曲线下面积 = 1
CDF (Cumulative Distribution Function)累积分布函数 F(x) = P(X ≤ x)离散/连续通用,单调不减
期望 E[X]取值的概率加权平均”长期均值”
方差 Var(X)取值偏离期望的平方期望衡量”波动大小”
参数决定分布形状的常数如正态的 μ、σ

关键区分:连续分布里 P(X=某一点) = 0,只能谈区间概率 P(a < X < b) = ∫f(x)dx;PDF 的值可以 > 1,只要总面积 = 1 即可。

3. 常见分布速查表

分布类型参数典型场景期望 / 方差
伯努利 Bernoulli离散p一次试验成功/失败p / p(1-p)
二项 Binomial离散n, pn 次独立试验成功的次数np / np(1-p)
泊松 Poisson离散λ单位时间 rare 事件次数λ / λ
均匀 Uniform连续a, b区间内无偏取值(a+b)/2 / (b-a)²/12
正态 Normal连续μ, σ自然界大量现象、误差μ / σ²
指数 Exponential连续λ两次事件间隔时间1/λ / 1/λ²

4. 两个最常用分布的密度函数

正态分布(钟形曲线,对称)

        f(x)
        ▲
        │      ╭──╮
        │     ╱    ╲
        │    ╱      ╲
        │   ╱        ╲
        │──╯           ╰───→ x
        └─────── μ ────────
              μ-σ    μ+σ
PDF:  f(x) = (1 / (σ√(2π))) · exp(-(x-μ)² / (2σ²))

指数分布(无记忆性,正偏)

        f(x)
        ▲╲
        │ ╲
        │  ╲
        │   ╲___
        │       └─────→ x
        └── 0
PDF:  f(x) = λ · exp(-λx),  x ≥ 0

5. 高斯分布(正态分布)为什么重要

高斯分布之所以在统计学和机器学习里”默认出场率”最高,不是因为它好看,而是因为它有数学必然性

核心原理:中心极限定理 (CLT)

大量独立同分布的随机变量之和,无论它们原本是什么分布,其分布都趋近于正态。

这意味着只要一个量是”许多小因素叠加”而成,它就接近正态——这就是自然界和工程里到处是正态的根本原因:

  • 人的身高(基因 + 营养 + 环境 多因素叠加)
  • 测量误差(多个独立误差源累加)
  • 制造业零件尺寸偏差
  • 信号噪声

实用意义速查

用途为什么是正态
假设检验(z / t 检验)检验统计量在 H0 下渐近正态
线性回归误差项假设正态时,最小二乘 = 最大似然估计
机器学习权重初始化对称、易收敛,是深度学习的默认选择
信号噪声建模多源噪声叠加 → 正态
异常检测3σ 之外判为异常(仅 0.27% 概率)

68-95-99.7 法则(σ 倍数与概率的对应,是正态分布最实用的速记)

         f(x)
          ▲
          │        ╭──╮
          │       ╱    ╲
          │      ╱      ╲
          │  ╭──╯        ╰──╮
          └──┴──────┬───────┴──→ x
                   μ
   区间            理论概率      含义
   ─────────────  ──────────   ──────────────
   μ ± 1σ          68.27%      约 2/3 的数据
   μ ± 2σ          95.45%      95% 置信区间
   μ ± 3σ          99.73%      "3σ 异常检测"依据

工业上”6 Sigma 质量管理”就是要求缺陷率低于 3.4 ppm(4.5σ 长期偏移 + 1.5σ 漂移),名字正来源于此。

数学上的便利

  • 完全由 μ、σ 两个参数决定
  • 线性变换后仍是正态:aX + b ~ N(aμ+b, a²σ²)
  • 独立正态之和仍是正态:X + Y ~ N(μx+μy, σx²+σy²)
  • 标准化 Z = (X-μ)/σ ~ N(0,1) 后可查通用表

一句话总结:高斯分布是”叠加效应”的数学签名。只要现象由多因素累加而成,它就是最自然的模型选择——这就是它的意义所在。

6. 用 NumPy / SciPy 采样与计算

import numpy as np
from scipy import stats
 
# ── 采样 ──
np.random.rand(1000)              # [0,1) 均匀分布
np.random.randn(1000)             # 标准正态 N(0,1)
np.random.normal(5, 2, 1000)      # N(μ=5, σ=2)
np.random.binomial(n=10, p=0.3, size=1000)   # 二项分布
np.random.poisson(lam=3, size=1000)          # 泊松分布
np.random.exponential(scale=2, size=1000)    # 指数分布,scale=1/λ
 
# ── 用 scipy 算概率 / 分位数 ──
stats.norm.cdf(1.96)              # P(Z ≤ 1.96) ≈ 0.975
stats.norm.ppf(0.975)             # 97.5% 分位数 ≈ 1.96
stats.norm.pdf(0)                 # 标准正态在 0 点的密度 ≈ 0.399
 
# ── 估计参数 ──
data = np.random.normal(10, 3, 5000)
mu_hat = data.mean()              # 样本均值估计 μ
sigma_hat = data.std()            # 样本标准差估计 σ

7. 对比辨析表

对比维度PMF (离散)PDF (连续)
描述对象离散随机变量连续随机变量
函数值含义概率 P(X=x)密度,不是概率
单点概率可 > 0恒 = 0
函数值可否 > 1不可(每个值都是概率)可(只要面积=1)
求区间概率方式Σ 求和∫ 积分
总和/总面积Σ P(X=x) = 1∫ f(x) dx = 1

8. 典型判断流程

要描述一个随机现象
        │
   能数清楚取值吗?
   ┌────┴────┐
  是          否
离散型        连续型
   │           │
事件发生概率    区间内取值
固定吗?       无偏吗?
   │           │
┌──┴──┐     均匀 / 正态 / 指数
伯努利/二项
  └─ n 很大、p 很小 → 泊松近似

9. 常见误区

  • ❌ “PDF 的 f(x) 就是概率” → 错,f(x) 是密度;概率是面积 ∫f(x)dx,单点概率恒为 0
  • ❌ “正态分布只能描述自然现象” → 错,由中心极限定理推出:大量独立同分布变量之和都近似正态,所以应用极广
  • ❌ “泊松和指数是一回事” → 错,泊松描述”一段时间内事件次数”(离散),指数描述”两次事件间隔”(连续),但两者共享参数 λ
  • ❌ “方差越大分布越偏” → 错,方差只描述离散程度,不描述偏态;偏态看 Skewness
  • ❌ “二项分布 n 越大越接近泊松” → 错,要 n 大 p 小、np ≈ λ 才接近泊松;n 大 p 不小时接近正态

10. 延伸阅读 / 关联概念

  • 中心极限定理 (CLT) — 为什么正态分布在自然界中如此普遍(详见第 5 节)
  • Box-Muller 变换 — 从均匀分布手写实现正态采样的经典算法,见同目录 gaussian_implementation.py
  • 大数定律 (LLN) — 样本均值收敛到期望,是统计推断的基础
  • 最大似然估计 (MLE) — 从样本反推分布参数的常用方法
  • 贝叶斯推断 — 把参数本身也看成随机变量,有先验/后验分布
  • scipy.stats 文档 — Python 里所有分布、检验、抽样方法的统一入口