-
内容大纲
本书循序渐进、深入系统地讲解了强化学习的核心原理、主流算法与工程实践,内容丰富、层次清晰、通俗易懂。全书共12章,涵盖从基础知识、经典算法,到深度强化学习、策略优化方法,再到离线强化学习、模型强化学习、多任务与多智能体系统等前沿内容。书中不仅详细介绍了Q-learning、DQN、PPO、TRPO、GRPO等算法的原理与推导,还配套了多个完整实战案例,如Atari游戏、CartPole平衡控制、迷宫导航系统、机械臂抓取、多智能体博弈等,帮助读者快速掌握从算法理解到项目落地的全流程技能。本书语言简洁直观,图文结合,配有大量实战项目和训练结果分析,同时覆盖了市面上同类图书较少涉及的内容,如强化学习在大模型中的新应用(GRPO)、元强化学习的系统构建,以及工业级多智能体训练框架,极具实用性与前瞻性,是学习强化学习开发技术与实战应用的理想工具。
本书适合具有Python基础、了解机器学习或深度学习初步知识的读者阅读,尤其适合人工智能开发者、AI工程师、机器人研究人员、自动化系统设计者,也可作为高校人工智能相关专业的教材或教学参考书,以及企业培训课程的技术参考资料。 -
作者介绍
-
目录
第1章 强化学习基础与核心概念
1.1 强化学习基础知识
1.1.1 强化学习的诞生背景
1.1.2 强化学习的核心思想与要素
1.1.3 强化学习与其他机器学习方法的区别
1.1.4 强化学习的挑战
1.2 强化学习的应用领域概览
1.2.1 机器人控制与路径规划
1.2.2 游戏与虚拟环境
1.2.3 金融与投资决策
1.2.4 自动驾驶与智能交通
1.2.5 自然语言处理中的应用
1.3 强化学习的理论基础:马尔可夫决策过程
1.3.1 MDP的概念和定义
1.3.2 策略、值函数(V, Q)和贝尔曼方程
1.4 OpenAI Gym环境初探
1.4.1 OpenAI Gym简介
1.4.2 MountainCar环境
1.4.3 CartPole环境
第2章 强化学习的经典求解方法
2.1 动态规划:策略迭代与值迭代
2.1.1 策略迭代
2.1.2 值迭代
2.2 蒙特卡洛方法:从经验中学习
2.2.1 蒙特卡洛预测
2.2.2 蒙特卡洛控制
2.2.3 探索策略
2.3 时序差分学习
2.3.1 TD(0)预测和SARSA
2.3.2 Q-learning:离策略学习的代表
2.3.3 综合实战:使用Q-learning解决网格世界问题
第3章 深度Q网络:从游戏突破到通用值函数逼近
3.1 Q-learning的局限与深度化的必要性
3.1.1 数据相关性问题:Q-learning面临的挑战
3.1.2 目标值的不稳定性:传统方法的缺陷
3.1.3 高维状态空间的困难:对深度化的需求
3.2 DQN的核心思想与突破
3.2.1 经验回放:打破数据相关性
3.2.2 目标网络:稳定学习目标
3.3 DQN算法流程与实现细节
3.3.1 DQN的神经网络结构
3.3.2 训练循环:从环境交互到参数更新
3.3.3 目标网络的更新过程:权重同步时机与方法
3.3.4 超参数的选择与调整:学习率、折扣因子等的影响
3.4 综合实战:用DQN玩转Atari游戏
3.4.1 Atari游戏环境介绍
3.4.2 具体实现
第4章 DQN算法的演进
4.1 Double DQN
4.1.1 DQN算法的问题剖析
4.1.2 Double DQN的核心思想
4.1.3 Double DQN的算法流程与实现要点
4.1.4 综合实战:使用Double DQN实现超级马里奥游戏
4.2 Dueling DQN
4.2.1 Dueling DQN的动机
4.2.2 Dueling DQN网络架构设计
4.2.3 综合实战:使用Dueling DQN实现二维网格世界导航任务
4.3 优先级经验回放
4.3.1 优先级经验回放的动机
4.3.2 优先级定义与采样策略
4.3.3 重要性采样校正
4.3.4 综合实战:比较DQN中普通经验回放和PER在CartPole问题中的表现
第5章 策略梯度方法:直接优化策略
5.1 策略梯度定理:理论基础
5.1.1 策略梯度的定义与意义
5.1.2 与值函数方法的对比分析
5.1.3 策略梯度定理的适用场景与局限性
5.2 REINFORCE:蒙特卡洛策略梯度算法
5.2.1 算法原理与实现
5.2.2 基线的引入与作用
5.3 综合实战:CartPole平衡控制与LunarLander软着陆
5.3.1 背景介绍
5.3.2 实验环境与任务建模
5.3.3 具体实现
5.3.4 运行结果与分析
第6章 Actor-Critic算法:融合价值与策略
6.1 Actor-Critic原理
6.1.1 策略梯度与值函数结合的动机
6.1.2 Actor与Critic的角色分工
6.1.3 策略评估与策略改进的闭环
6.1.4 经典AC算法流程
6.1.5 综合实战:使用经典AC算法解决CartPole-v1平衡问题
6.2 A2C算法
6.2.1 优势函数的数学原理
6.2.2 蒙特卡洛与TD误差的优势函数估计
6.2.3 GAE技术
6.2.4 综合实战:A2C算法实现与优势估计方法比较
6.3 A3C算法
6.3.1 并行化架构设计
6.3.2 异步梯度更新与锁机制
6.3.3 探索策略:熵正则化在A3C中的应用
6.3.4 综合实战:A2C和A3C的性能对比
6.4 SAC算法
6.4.1 熵正则化与探索激励
6.4.2 SAC算法核心设计
6.4.3 综合实战:基于SAC算法的机械臂抓取任务
第7章 TRPO算法核心知识与应用实践
7.1 TRPO基础知识
7.1.1 TRPO算法的诞生背景
7.1.2 TRPO算法的意义
7.2 TRPO算法的核心原理
7.2.1 信任域概念的引入
7.2.2 构建目标函数与约束条件
7.2.3 综合实战:使用TRPO解决CartPole平衡问题
7.3 综合实战:基于低秩矩阵的TRPO优化
7.3.1 优化策略:NN-TRPO和TRLRPO
7.3.2 项目介绍
7.3.3 经验数据管理和状态空间离散化
7.3.4 定义环境
7.3.5 创建强化学习模型
7.3.6 创建代理
7.3.7 评估TRPO在CustomAcrobotEnv环境中的性能
7.3.8 评估TRPO在Mountain-CarContinuous-v0环境中的性能
7.3.9 评估TRPO在Custom-PendulumEnv环境中的性能
7.3.10 性能可视化
第8章 OpenAI的PPO和DeepSeek的GRPO
8.1 PPO算法的核心知识和应用
8.1.1 PPO的推出背景
8.1.2 PPO算法的基本思想
8.1.3 综合实战:使用PPO算法解决CartPole平衡问题
8.2 GRPO算法的核心知识和应用
8.2.1 GRPO的诞生背景
8.2.2 GRPO算法的基本原理
8.2.3 GRPO算法的数学推导
8.2.4 GRPO在DeepSeek-R1模型中的作用和表现
8.2.5 库TRL
8.2.6 综合实战:使用GRPO算法训练数学问题解答模型
第9章 离线强化学习:从历史数据中学习策略
9.1 离线RL的核心挑战
9.1.1 分布偏移
9.1.2 外推误差
9.1.3 数据质量依赖性
9.2 约束策略优化
9.2.1 常用的约束策略优化方法介绍
9.2.2 综合实战:比较三种约束策略优化方法的性能
9.3 基于不确定性的方法
9.3.1 常用的基于不确定性的方法介绍
9.3.2 综合实战:比较三种基于不确定性的方法的性能
9.4 模仿正则化
9.4.1 常用的模仿正则化方法介绍
9.4.2 综合实战:评估AWAC、IQL和ORL方法的性能
第10章 前沿技术:基于模型的强化学习
10.1 基于模型和无模型的强化学习介绍
10.1.1 核心区别
10.1.2 基于模型的强化学习方法的优势
10.1.3 无模型的强化学习方法的优势
10.1.4 基于模型和无模型的强化学习方法的结合策略
10.1.5 综合实战:迷宫环境中的障碍物检测与奖励分配
10.2 学习环境动力学模型
10.2.1 模型表示形式:确定性模型与随机模型
10.2.2 模型学习的损失函数
10.2.3 常用模型学习技术
10.2.4 处理部分可观测性
10.2.5 综合实战:基于模型的CartPole动力学学习与规划
10.3 利用模型进行规划
10.3.1 规划的基本概念:开环规划与闭环规划
10.3.2 经典规划方法
10.3.3 采样式规划方法:蒙特卡洛树搜索
10.3.4 采样式规划方法:模型预测控制
10.3.5 轨迹采样与策略改进
10.3.6 综合实战:用采样规划方法解决一个网格世界问题
10.4 集成规划与学习:前沿技术介绍
10.4.1 学习规划器:端到端训练
10.4.2 MuZero:统一学习、规划与表示的典范
10.4.3 其他前沿方法简述
第11章 多任务与元强化学习
11.1 多任务学习:共享知识解决多个任务
11.2 元强化学习:快速适应新任务
11.3 综合实战:基于元强化学习的迷宫导航系统
第12章 多智能体强化学习实战:火星殖民地游戏
12.1 项目背景介绍
12.2 功能介绍
12.3 运行环境
12.4 智能体核心逻辑
同类热销排行榜
- C语言与程序设计教程(高等学校计算机类十二五规划教材)16
- 电机与拖动基础(教育部高等学校自动化专业教学指导分委员会规划工程应用型自动化专业系列教材)13.48
- 传感器与检测技术(第2版高职高专电子信息类系列教材)13.6
- ASP.NET项目开发实战(高职高专计算机项目任务驱动模式教材)15.2
- Access数据库实用教程(第2版十二五职业教育国家规划教材)14.72
- 信号与系统(第3版下普通高等教育九五国家级重点教材)15.08
- 电气控制与PLC(普通高等教育十二五电气信息类规划教材)17.2
- 数字电子技术基础(第2版)17.36
- VB程序设计及应用(第3版十二五职业教育国家规划教材)14.32
- Java Web从入门到精通(附光盘)/软件开发视频大讲堂27.92
推荐书目
-

孩子你慢慢来/人生三书 华人世界率性犀利的一枝笔,龙应台独家授权《孩子你慢慢来》20周年经典新版。她的《...
-

时间简史(插图版) 相对论、黑洞、弯曲空间……这些词给我们的感觉是艰深、晦涩、难以理解而且与我们的...
-

本质(精) 改革开放40年,恰如一部四部曲的年代大戏。技术突变、产品迭代、产业升级、资本对接...
[
