强化学习(Reinforcement Learning, RL)

强化学习是通过”试错 + 奖励”来学习决策的机器学习范式。智能体 (agent) 在环境里不断行动,环境给出奖励或惩罚,智能体据此调整策略,目标是让长期累积的奖励最大。它不像监督学习那样有”标准答案”,而是靠反馈自己摸索出好策略。

本质:没人告诉智能体”每一步的正确动作是什么”,只告诉它”这一串行为最后得了多少分”。它要自己从延迟的、稀疏的奖励里,反推出”什么行为是好的”。

一句话类比:训小狗。 你不会给它讲”坐下”的定义,而是它偶然坐下时给块零食(奖励)。多来几次,它就学会”坐下 → 有吃的”。强化学习就是让 AI 用这种”试错—奖励”的方式,自己学会一套行为策略。

1. 三种学习范式对比(先定好位)

监督学习无监督学习强化学习
数据带标签(输入→正确答案)无标签无标签,只有奖励信号
学什么输入到输出的映射数据的结构/分布在环境里怎么行动
反馈每个样本都有正确答案奖励,常延迟且稀疏
例子分类、回归(见 cross-entropy-loss.md聚类、降维下棋、机器人、游戏 AI

关键区别:监督学习是”有老师逐题批改”;强化学习是”没老师,只有最后的比分”——所以它更难,难在信用分配 (credit assignment):一局赢了,到底是哪几步走对了?

2. 核心概念(术语一次讲清)

        ┌─────────── 动作 a ───────────┐
        │                              ▼
   ┌─────────┐                   ┌──────────┐
   │ 智能体   │                   │  环境     │
   │ (Agent) │                   │(Environment)│
   └─────────┘                   └──────────┘
        ▲                              │
        └──── 状态 s + 奖励 r ──────────┘
              (环境反馈给智能体)
概念含义
智能体 (Agent)做决策的主体
环境 (Environment)智能体所处、与之交互的世界
状态 (State, s)当前处境的描述
动作 (Action, a)智能体能采取的行为
奖励 (Reward, r)环境对某个动作的即时反馈(数值)
策略 (Policy, π)从状态到动作的映射——“在什么情况下该做什么”,这就是要学的东西
回报 (Return, G)从当前起未来奖励的累积总和(含折扣)
价值 (Value, V/Q)对”某状态/某动作长期能拿多少回报”的估计
回合 (Episode)从开始到结束的一整段交互(如一局游戏)

3. 目标:最大化”长期”回报(不是眼前奖励)

强化学习追求的不是单步奖励,而是累积回报,且未来的奖励要打折扣:

  • 折扣因子 γ (gamma, 0~1):衡量”多看重未来”。γ 接近 0 = 只顾眼前;接近 1 = 看重长远。
  • 这解释了为什么 RL 能学会牺牲眼前、谋求长远的策略(如下棋弃子取势)。

核心难点回到”信用分配”:奖励常常延迟(走了 50 步才赢),智能体得学会把最终的胜负归因到中间那些关键动作上。价值函数 (V/Q) 就是干这个的——估计每一步”长期看值不值”。

4. 探索 vs 利用(RL 的核心两难)

利用 (Exploitation)探索 (Exploration)
做什么选当前已知最优的动作尝试没试过的动作
风险可能错过更好的选择可能浪费在坏选择上

经典比喻:去餐厅,是点你最爱的那道菜(利用),还是试试没吃过的新菜(探索)? 全利用会困在局部最优,全探索学不到东西。常用折中如 ε-greedy:大部分时候选最优,偶尔(概率 ε)随机试探。这和 gradient-descent.md 里”跳出局部最优”是相通的直觉。

5. 主要方法分类

类别学什么代表算法
基于价值 (Value-based)学”每个动作值多少”(Q 值),选值最高的Q-Learning、DQN
基于策略 (Policy-based)直接学策略 π(状态→动作概率)Policy Gradient、PPO
演员-评论家 (Actor-Critic)两者结合:演员选动作、评论家评价A2C、A3C、PPO
基于模型 (Model-based)先学世界模型再用它规划Dreamer、MuZero

最后一类直接连到 ../ai-agent-guide/world_model.mdmodel-based RL 就是”先学会环境怎么运转,再在脑内推演规划”。model-free(前几类)则跳过建模、直接从试错里学策略。二者取舍见世界模型笔记第 3 节。

6. 和你其他笔记的连接

  • 梯度下降:策略/价值网络(深度强化学习里就是神经网络)同样靠梯度下降训练,只是”损失”换成了”最大化期望回报”;见 gradient-descent.md
  • 世界模型:model-based RL 的核心组件;见 ../ai-agent-guide/world_model.md
  • 大模型对齐 (RLHF):ChatGPT 等用基于人类反馈的强化学习 (RLHF) 微调——把”人类偏好”当奖励信号,用 RL(常是 PPO)调模型。这是 RL 在 LLM 时代最重要的应用;关联 ../ai-agent-guide/foundation_model.md
  • Agent 运行循环:RL 的”智能体—环境”交互闭环,和 ../ai-agent-guide/agent.md 的感知—行动循环结构同源。

7. 典型应用

  • 游戏 AI:AlphaGo/AlphaZero(围棋)、MuZero、打星际/Dota 的 AI
  • 机器人控制:学走路、抓取、平衡
  • 推荐/广告:把”用户长期留存”当奖励优化
  • 大模型对齐:RLHF / RLAIF,让模型输出更符合人类偏好
  • 资源调度:数据中心散热、交通信号等序列决策问题

8. 常见坑 / 误区

  • ❌ “RL 就是没有数据的监督学习” → 本质不同:RL 学的是序列决策,反馈是延迟稀疏的奖励,不是逐样本的正确答案
  • ❌ “奖励函数随便设” → 奖励设计是 RL 最难最关键的一环;设歪了智能体会”钻空子”拿高分却不干正事(reward hacking)
  • ❌ “只看即时奖励” → 要最大化长期累积回报,折扣因子 γ 决定短视还是远见
  • ❌ “全部用当前最优动作最高效” → 会困在局部最优,必须留探索(见第 4 节)
  • ❌ “RL 很稳” → 相比监督学习,RL 训练不稳定、对超参敏感、样本效率低,这也是 model-based / 世界模型想改善的
  • ❌ “RLHF 里的 RL 和游戏 RL 没关系” → 是同一套框架,只是奖励从”游戏得分”换成了”人类偏好模型的打分”

9. 延伸阅读 / 关联概念

  • 梯度下降 — 深度 RL 里网络的训练靠它;见 gradient-descent.md
  • 世界模型 — model-based RL 的核心;见 ../ai-agent-guide/world_model.md
  • 基座模型 / RLHF — RL 对齐大模型;见 ../ai-agent-guide/foundation_model.md
  • Agent 运行机制 — 智能体—环境交互循环同源;见 ../ai-agent-guide/agent.md
  • 马尔可夫决策过程 (MDP) — RL 的数学框架(状态、动作、转移、奖励)
  • Q-Learning / DQN / PPO — 最常见的具体算法,入门可从 Q-Learning 手推理解
  • 贝尔曼方程 (Bellman Equation) — 价值函数递归分解的核心方程