欢迎光临澳大利亚新华书店网 [登录 | 免费注册]

    • 深入浅出强化学习算法与实战
      • 作者:编者:朱万林|责编:耍利娜
      • 出版社:化学工业
      • ISBN:9787122509543
      • 出版日期:2026/09/01
      • 页数:319
    • 售价:39.6
  • 内容大纲

        本书循序渐进、深入系统地讲解了强化学习的核心原理、主流算法与工程实践,内容丰富、层次清晰、通俗易懂。全书共12章,涵盖从基础知识、经典算法,到深度强化学习、策略优化方法,再到离线强化学习、模型强化学习、多任务与多智能体系统等前沿内容。书中不仅详细介绍了Q-learning、DQN、PPO、TRPO、GRPO等算法的原理与推导,还配套了多个完整实战案例,如Atari游戏、CartPole平衡控制、迷宫导航系统、机械臂抓取、多智能体博弈等,帮助读者快速掌握从算法理解到项目落地的全流程技能。本书语言简洁直观,图文结合,配有大量实战项目和训练结果分析,同时覆盖了市面上同类图书较少涉及的内容,如强化学习在大模型中的新应用(GRPO)、元强化学习的系统构建,以及工业级多智能体训练框架,极具实用性与前瞻性,是学习强化学习开发技术与实战应用的理想工具。
        本书适合具有Python基础、了解机器学习或深度学习初步知识的读者阅读,尤其适合人工智能开发者、AI工程师、机器人研究人员、自动化系统设计者,也可作为高校人工智能相关专业的教材或教学参考书,以及企业培训课程的技术参考资料。
  • 作者介绍

  • 目录

    第1章  强化学习基础与核心概念
      1.1  强化学习基础知识
        1.1.1  强化学习的诞生背景
        1.1.2  强化学习的核心思想与要素
        1.1.3  强化学习与其他机器学习方法的区别
        1.1.4  强化学习的挑战
      1.2  强化学习的应用领域概览
        1.2.1  机器人控制与路径规划
        1.2.2  游戏与虚拟环境
        1.2.3  金融与投资决策
        1.2.4  自动驾驶与智能交通
        1.2.5  自然语言处理中的应用
      1.3  强化学习的理论基础:马尔可夫决策过程
        1.3.1  MDP的概念和定义
        1.3.2  策略、值函数(V, Q)和贝尔曼方程
      1.4  OpenAI Gym环境初探
        1.4.1  OpenAI Gym简介
        1.4.2  MountainCar环境
        1.4.3  CartPole环境
    第2章  强化学习的经典求解方法
      2.1  动态规划:策略迭代与值迭代
        2.1.1  策略迭代
        2.1.2  值迭代
      2.2  蒙特卡洛方法:从经验中学习
        2.2.1  蒙特卡洛预测
        2.2.2  蒙特卡洛控制
        2.2.3  探索策略
      2.3  时序差分学习
        2.3.1  TD(0)预测和SARSA
        2.3.2  Q-learning:离策略学习的代表
        2.3.3  综合实战:使用Q-learning解决网格世界问题
    第3章  深度Q网络:从游戏突破到通用值函数逼近
      3.1  Q-learning的局限与深度化的必要性
        3.1.1  数据相关性问题:Q-learning面临的挑战
        3.1.2  目标值的不稳定性:传统方法的缺陷
        3.1.3  高维状态空间的困难:对深度化的需求
      3.2  DQN的核心思想与突破
        3.2.1  经验回放:打破数据相关性
        3.2.2  目标网络:稳定学习目标
      3.3  DQN算法流程与实现细节
        3.3.1  DQN的神经网络结构
        3.3.2  训练循环:从环境交互到参数更新
        3.3.3  目标网络的更新过程:权重同步时机与方法
        3.3.4  超参数的选择与调整:学习率、折扣因子等的影响
      3.4  综合实战:用DQN玩转Atari游戏
        3.4.1  Atari游戏环境介绍
        3.4.2  具体实现
    第4章  DQN算法的演进
      4.1  Double DQN
        4.1.1  DQN算法的问题剖析

        4.1.2  Double DQN的核心思想
        4.1.3  Double DQN的算法流程与实现要点
        4.1.4  综合实战:使用Double DQN实现超级马里奥游戏
      4.2  Dueling DQN
        4.2.1  Dueling DQN的动机
        4.2.2  Dueling DQN网络架构设计
        4.2.3  综合实战:使用Dueling DQN实现二维网格世界导航任务
      4.3  优先级经验回放
        4.3.1  优先级经验回放的动机
        4.3.2  优先级定义与采样策略
        4.3.3  重要性采样校正
        4.3.4  综合实战:比较DQN中普通经验回放和PER在CartPole问题中的表现
    第5章  策略梯度方法:直接优化策略
      5.1  策略梯度定理:理论基础
        5.1.1  策略梯度的定义与意义
        5.1.2  与值函数方法的对比分析
        5.1.3  策略梯度定理的适用场景与局限性
      5.2  REINFORCE:蒙特卡洛策略梯度算法
        5.2.1  算法原理与实现
        5.2.2  基线的引入与作用
      5.3  综合实战:CartPole平衡控制与LunarLander软着陆
        5.3.1  背景介绍
        5.3.2  实验环境与任务建模
        5.3.3  具体实现
        5.3.4  运行结果与分析
    第6章  Actor-Critic算法:融合价值与策略
      6.1  Actor-Critic原理
        6.1.1  策略梯度与值函数结合的动机
        6.1.2  Actor与Critic的角色分工
        6.1.3  策略评估与策略改进的闭环
        6.1.4  经典AC算法流程
        6.1.5  综合实战:使用经典AC算法解决CartPole-v1平衡问题
      6.2  A2C算法
        6.2.1  优势函数的数学原理
        6.2.2  蒙特卡洛与TD误差的优势函数估计
        6.2.3  GAE技术
        6.2.4  综合实战:A2C算法实现与优势估计方法比较
      6.3  A3C算法
        6.3.1  并行化架构设计
        6.3.2  异步梯度更新与锁机制
        6.3.3  探索策略:熵正则化在A3C中的应用
        6.3.4  综合实战:A2C和A3C的性能对比
      6.4  SAC算法
        6.4.1  熵正则化与探索激励
        6.4.2  SAC算法核心设计
        6.4.3  综合实战:基于SAC算法的机械臂抓取任务
    第7章  TRPO算法核心知识与应用实践
      7.1  TRPO基础知识
        7.1.1  TRPO算法的诞生背景
        7.1.2  TRPO算法的意义

      7.2  TRPO算法的核心原理
        7.2.1  信任域概念的引入
        7.2.2  构建目标函数与约束条件
        7.2.3  综合实战:使用TRPO解决CartPole平衡问题
      7.3  综合实战:基于低秩矩阵的TRPO优化
        7.3.1  优化策略:NN-TRPO和TRLRPO
        7.3.2  项目介绍
        7.3.3  经验数据管理和状态空间离散化
        7.3.4  定义环境
        7.3.5  创建强化学习模型
        7.3.6  创建代理
        7.3.7  评估TRPO在CustomAcrobotEnv环境中的性能
        7.3.8  评估TRPO在Mountain-CarContinuous-v0环境中的性能
        7.3.9  评估TRPO在Custom-PendulumEnv环境中的性能
        7.3.10  性能可视化
    第8章  OpenAI的PPO和DeepSeek的GRPO
      8.1  PPO算法的核心知识和应用
        8.1.1  PPO的推出背景
        8.1.2  PPO算法的基本思想
        8.1.3  综合实战:使用PPO算法解决CartPole平衡问题
      8.2  GRPO算法的核心知识和应用
        8.2.1  GRPO的诞生背景
        8.2.2  GRPO算法的基本原理
        8.2.3  GRPO算法的数学推导
        8.2.4  GRPO在DeepSeek-R1模型中的作用和表现
        8.2.5  库TRL
        8.2.6  综合实战:使用GRPO算法训练数学问题解答模型
    第9章  离线强化学习:从历史数据中学习策略
      9.1  离线RL的核心挑战
        9.1.1  分布偏移
        9.1.2  外推误差
        9.1.3  数据质量依赖性
      9.2  约束策略优化
        9.2.1  常用的约束策略优化方法介绍
        9.2.2  综合实战:比较三种约束策略优化方法的性能
      9.3  基于不确定性的方法
        9.3.1  常用的基于不确定性的方法介绍
        9.3.2  综合实战:比较三种基于不确定性的方法的性能
      9.4  模仿正则化
        9.4.1  常用的模仿正则化方法介绍
        9.4.2  综合实战:评估AWAC、IQL和ORL方法的性能
    第10章  前沿技术:基于模型的强化学习
      10.1  基于模型和无模型的强化学习介绍
        10.1.1  核心区别
        10.1.2  基于模型的强化学习方法的优势
        10.1.3  无模型的强化学习方法的优势
        10.1.4  基于模型和无模型的强化学习方法的结合策略
        10.1.5  综合实战:迷宫环境中的障碍物检测与奖励分配
      10.2  学习环境动力学模型
        10.2.1  模型表示形式:确定性模型与随机模型

        10.2.2  模型学习的损失函数
        10.2.3  常用模型学习技术
        10.2.4  处理部分可观测性
        10.2.5  综合实战:基于模型的CartPole动力学学习与规划
      10.3  利用模型进行规划
        10.3.1  规划的基本概念:开环规划与闭环规划
        10.3.2  经典规划方法
        10.3.3  采样式规划方法:蒙特卡洛树搜索
        10.3.4  采样式规划方法:模型预测控制
        10.3.5  轨迹采样与策略改进
        10.3.6  综合实战:用采样规划方法解决一个网格世界问题
      10.4  集成规划与学习:前沿技术介绍
        10.4.1  学习规划器:端到端训练
        10.4.2  MuZero:统一学习、规划与表示的典范
        10.4.3  其他前沿方法简述
    第11章  多任务与元强化学习
      11.1  多任务学习:共享知识解决多个任务
      11.2  元强化学习:快速适应新任务
      11.3  综合实战:基于元强化学习的迷宫导航系统
    第12章  多智能体强化学习实战:火星殖民地游戏
      12.1  项目背景介绍
      12.2  功能介绍
      12.3  运行环境
      12.4  智能体核心逻辑