强化学习(Reinforcement Learning, RL)
强化学习是通过”试错 + 奖励”来学习决策的机器学习范式。智能体 (agent) 在环境里不断行动,环境给出奖励或惩罚,智能体据此调整策略,目标是让长期累积的奖励最大。它不像监督学习那样有”标准答案”,而是靠反馈自己摸索出好策略。
本质:没人告诉智能体”每一步的正确动作是什么”,只告诉它”这一串行为最后得了多少分”。它要自己从延迟的、稀疏的奖励里,反推出”什么行为是好的”。
一句话类比:训小狗。 你不会给它讲”坐下”的定义,而是它偶然坐下时给块零食(奖励)。多来几次,它就学会”坐下 → 有吃的”。强化学习就是让 AI 用这种”试错—奖励”的方式,自己学会一套行为策略。
1. 三种学习范式对比(先定好位)
| 监督学习 | 无监督学习 | 强化学习 | |
|---|---|---|---|
| 数据 | 带标签(输入→正确答案) | 无标签 | 无标签,只有奖励信号 |
| 学什么 | 输入到输出的映射 | 数据的结构/分布 | 在环境里怎么行动 |
| 反馈 | 每个样本都有正确答案 | 无 | 奖励,常延迟且稀疏 |
| 例子 | 分类、回归(见 cross-entropy-loss.md) | 聚类、降维 | 下棋、机器人、游戏 AI |
关键区别:监督学习是”有老师逐题批改”;强化学习是”没老师,只有最后的比分”——所以它更难,难在信用分配 (credit assignment):一局赢了,到底是哪几步走对了?
2. 核心概念(术语一次讲清)
┌─────────── 动作 a ───────────┐
│ ▼
┌─────────┐ ┌──────────┐
│ 智能体 │ │ 环境 │
│ (Agent) │ │(Environment)│
└─────────┘ └──────────┘
▲ │
└──── 状态 s + 奖励 r ──────────┘
(环境反馈给智能体)
| 概念 | 含义 |
|---|---|
| 智能体 (Agent) | 做决策的主体 |
| 环境 (Environment) | 智能体所处、与之交互的世界 |
| 状态 (State, s) | 当前处境的描述 |
| 动作 (Action, a) | 智能体能采取的行为 |
| 奖励 (Reward, r) | 环境对某个动作的即时反馈(数值) |
| 策略 (Policy, π) | 从状态到动作的映射——“在什么情况下该做什么”,这就是要学的东西 |
| 回报 (Return, G) | 从当前起未来奖励的累积总和(含折扣) |
| 价值 (Value, V/Q) | 对”某状态/某动作长期能拿多少回报”的估计 |
| 回合 (Episode) | 从开始到结束的一整段交互(如一局游戏) |
3. 目标:最大化”长期”回报(不是眼前奖励)
强化学习追求的不是单步奖励,而是累积回报,且未来的奖励要打折扣:
- 折扣因子 γ (gamma, 0~1):衡量”多看重未来”。γ 接近 0 = 只顾眼前;接近 1 = 看重长远。
- 这解释了为什么 RL 能学会牺牲眼前、谋求长远的策略(如下棋弃子取势)。
核心难点回到”信用分配”:奖励常常延迟(走了 50 步才赢),智能体得学会把最终的胜负归因到中间那些关键动作上。价值函数 (V/Q) 就是干这个的——估计每一步”长期看值不值”。
4. 探索 vs 利用(RL 的核心两难)
| 利用 (Exploitation) | 探索 (Exploration) | |
|---|---|---|
| 做什么 | 选当前已知最优的动作 | 尝试没试过的动作 |
| 风险 | 可能错过更好的选择 | 可能浪费在坏选择上 |
经典比喻:去餐厅,是点你最爱的那道菜(利用),还是试试没吃过的新菜(探索)? 全利用会困在局部最优,全探索学不到东西。常用折中如 ε-greedy:大部分时候选最优,偶尔(概率 ε)随机试探。这和
gradient-descent.md里”跳出局部最优”是相通的直觉。
5. 主要方法分类
| 类别 | 学什么 | 代表算法 |
|---|---|---|
| 基于价值 (Value-based) | 学”每个动作值多少”(Q 值),选值最高的 | Q-Learning、DQN |
| 基于策略 (Policy-based) | 直接学策略 π(状态→动作概率) | Policy Gradient、PPO |
| 演员-评论家 (Actor-Critic) | 两者结合:演员选动作、评论家评价 | A2C、A3C、PPO |
| 基于模型 (Model-based) | 先学世界模型再用它规划 | Dreamer、MuZero |
最后一类直接连到
../ai-agent-guide/world_model.md:model-based RL 就是”先学会环境怎么运转,再在脑内推演规划”。model-free(前几类)则跳过建模、直接从试错里学策略。二者取舍见世界模型笔记第 3 节。
6. 和你其他笔记的连接
- 梯度下降:策略/价值网络(深度强化学习里就是神经网络)同样靠梯度下降训练,只是”损失”换成了”最大化期望回报”;见
gradient-descent.md。 - 世界模型:model-based RL 的核心组件;见
../ai-agent-guide/world_model.md。 - 大模型对齐 (RLHF):ChatGPT 等用基于人类反馈的强化学习 (RLHF) 微调——把”人类偏好”当奖励信号,用 RL(常是 PPO)调模型。这是 RL 在 LLM 时代最重要的应用;关联
../ai-agent-guide/foundation_model.md。 - Agent 运行循环:RL 的”智能体—环境”交互闭环,和
../ai-agent-guide/agent.md的感知—行动循环结构同源。
7. 典型应用
- 游戏 AI:AlphaGo/AlphaZero(围棋)、MuZero、打星际/Dota 的 AI
- 机器人控制:学走路、抓取、平衡
- 推荐/广告:把”用户长期留存”当奖励优化
- 大模型对齐:RLHF / RLAIF,让模型输出更符合人类偏好
- 资源调度:数据中心散热、交通信号等序列决策问题
8. 常见坑 / 误区
- ❌ “RL 就是没有数据的监督学习” → 本质不同:RL 学的是序列决策,反馈是延迟稀疏的奖励,不是逐样本的正确答案
- ❌ “奖励函数随便设” → 奖励设计是 RL 最难最关键的一环;设歪了智能体会”钻空子”拿高分却不干正事(reward hacking)
- ❌ “只看即时奖励” → 要最大化长期累积回报,折扣因子 γ 决定短视还是远见
- ❌ “全部用当前最优动作最高效” → 会困在局部最优,必须留探索(见第 4 节)
- ❌ “RL 很稳” → 相比监督学习,RL 训练不稳定、对超参敏感、样本效率低,这也是 model-based / 世界模型想改善的
- ❌ “RLHF 里的 RL 和游戏 RL 没关系” → 是同一套框架,只是奖励从”游戏得分”换成了”人类偏好模型的打分”
9. 延伸阅读 / 关联概念
- 梯度下降 — 深度 RL 里网络的训练靠它;见
gradient-descent.md - 世界模型 — model-based RL 的核心;见
../ai-agent-guide/world_model.md - 基座模型 / RLHF — RL 对齐大模型;见
../ai-agent-guide/foundation_model.md - Agent 运行机制 — 智能体—环境交互循环同源;见
../ai-agent-guide/agent.md - 马尔可夫决策过程 (MDP) — RL 的数学框架(状态、动作、转移、奖励)
- Q-Learning / DQN / PPO — 最常见的具体算法,入门可从 Q-Learning 手推理解
- 贝尔曼方程 (Bellman Equation) — 价值函数递归分解的核心方程