由于此商品库存有限,请在下单后15分钟之内支付完成,手慢无哦!
100%刮中券,最高99元无敌券,券有效期7天
活动自2017年6月2日上线,敬请关注云钻刮券活动规则更新。
如活动受政府机关指令需要停止举办的,或活动遭受严重网络攻击需暂停举办的,或者系统故障导致的其它意外问题,苏宁无需为此承担赔偿或者进行补偿。
正版新书]PYTHON强化学习:算法、核心技术与行业应用[美]埃内斯
¥ ×1
<br /><br />CONTENTS<br />目 录<br />译者序<br />前言<br />作者简介<br />审校者简介<br />第一部分 强化学习基础<br />第1章 强化学习简介 2<br />1.1 为什么选择强化学习 2<br />1.2 机器学习的三种范式 3<br />1.2.1 监督学习 3<br />1.2.2 无监督学习 4<br />1.2.3 强化学习 4<br />1.3 强化学习应用领域和成功案例 5<br />1.3.1 游戏 6<br />1.3.2 机器人技术和自主系统 7<br />1.3.3 供应链 8<br />1.3.4 制造业 8<br />1.3.5 个性化和推荐系统 9<br />1.3.6 智慧城市 9<br />1.4 强化学习问题的元素 10<br />1.4.1 强化学习概念 10<br />1.4.2 将井字棋游戏建模为强化<br />学习问题 11<br />1.5 设置强化学习环境 12<br />1.5.1 硬件要求 12<br />1.5.2 操作系统 13<br />1.5.3 软件工具箱 13<br />1.6 总结 14<br />1.7 参考文献 15<br />第2章 多臂老虎机 17<br />2.1 探索–利用权衡 17<br />2.2 什么是多臂老虎机问题 18<br />2.2.1 问题定义 18<br />2.2.2 一个简单多臂老虎机问题<br />的实验 19<br />2.3 案例研究:在线广告 22<br />2.4 A/B/n测试 23<br />2.4.1 符号 23<br />2.4.2 应用于在线广告场景 24<br />2.4.3 A/B/n测试的优缺点 27<br />2.5 ε-贪心策略行动 27<br />2.5.1 应用于在线广告场景 27<br />2.5.2 ε-贪心策略行动的优缺点 29<br />2.6 使用置信上界进行行动选择 30<br />2.6.1 应用于在线广告场景 30<br />2.6.2 使用置信上界的优缺点 32<br />2.7 汤普森(后)采样 33<br />2.7.1 应用于在线广告场景 33<br />2.7.2 汤普森采样的优缺点 36<br />2.8 总结 36<br />2.9 参考文献 36<br />第3章 上下文多臂老虎机 37<br />3.1 为什么我们需要函数近似 37<br />3.2 对上下文使用函数近似 38<br />3.2.1 案例研究:使用合成用户<br />数据的上下文在线广告 39<br />3.2.2 使用正则化逻辑斯谛回归<br />的函数近似 42<br />3.2.3 目标函数:悔值最小化 45<br />3.2.4 解决在线广告问题 46<br />3.3 对行动使用函数近似 50<br />3.3.1 案例研究:使用来自美国<br />人口普查的用户数据的上<br />下文在线广告 51<br />3.3.2 使用神经网络进行函数<br />近似 55<br />3.3.3 计算悔值 57<br />3.3.4 解决在线广告问题 57<br />3.4 多臂老虎机和上下文老虎机的<br />其他应用 59<br />3.4.1 推荐系统 59<br />3.4.2 网页/应用程序功能设计 60<br />3.4.3 医疗保健 60<br />3.4.4 动态定价 60<br />3.4.5 金融 60<br />3.4.6 控制系统调整 60<br />3.5 总结 61<br />3.6 参考文献 61<br />第4章 马尔可夫决策过程的制定 63<br />4.1 马尔可夫链 63<br />4.1.1 具有马尔可夫性的随机<br />过程 63<br />4.1.2 马尔可夫链中的状态分类 65<br />4.1.3 转移和稳态行为 66<br />4.1.4 示例:网格世界中的n-<br />步行为 67<br />4.1.5 示例:一个可遍历马尔可<br />夫链中的样本路径 69<br />4.1.6 半马尔可夫过程和连续时<br />间马尔可夫链 70<br />4.2 引入奖励:马尔可夫奖励过程 70<br />4.2.1 将奖励附加到网格世界<br />示例 71<br />4.2.2 不同初始化的平均奖励之<br />间的关系 72<br />4.2.3 回报、折扣和状态值 72<br />4.2.4 解析式地计算状态值 73<br />4.2.5 迭代式地估计状态值 74<br />4.3 引入行动:马尔可夫决策过程 75<br />4.3.1 定义 75<br />4.3.2 网格世界作为马尔可夫决<br />策过程 76<br />4.3.3 状态值函数 77<br />4.3.4 行动值函数 77<br />4.3.5 很优状态值和行动值<br />函数 78<br />4.3.6 贝尔曼很优性 78<br />4.4 部分可观测的马尔可夫决策过程 79<br />4.5 总结 80<br />4.6 练习 80<br />4.7 参考文献 81<br />第5章 求解强化学习问题 82<br />5.1 探索动态规划 82<br />5.1.1 示例用例:食品卡车的库存补充 82<br />5.1.2 策略评估 85<br />5.1.3 策略迭代 90<br />5.1.4 值迭代 94<br />5.1.5 动态规划方法的缺点 95<br />5.2 用蒙特卡罗法训练智能体 96<br />5.2.1 蒙特卡罗预测 97<br />5.2.2 蒙特卡罗控制 104<br />5.3 时间差分学习 111<br />5.3.1 一步时间差分学习 112<br />5.3.2 n-步时间差分学习 117<br />5.4 了解模拟在强化学习中的<br />重要性 117<br />5.5 总结 118<br />5.6 练习 119<br />5.7 参考文献 119<br />第二部分 深度强化学习<br />第6章 规模化的深度Q-学习 122<br />6.1 从表格型Q-学习到深度Q-<br />学习 122<br />6.1.1 神经网络拟合的Q-迭代 123<br />6.1.2 在线Q-学习 127<br />6.2 深度Q网络 128<br />6.2.1 DQN中的关键概念 128<br />6.2.2 DQN算法 129<br />6.3 DQN扩展:Rainbow 130<br />6.3.1 扩展 130<br />6.3.2 集成智能体的性能 134<br />6.3.3 如何选择使用哪些扩展:Rainbow的消融实验 134<br />6.3.4 “死亡三组合”发生了什<br />么变化 135<br />6.4 分布式深度Q-学习 135<br />6.4.1 分布式深度Q-学习架构<br />的组成部分 136<br />6.4.2 通用强化学习架构:<br />Gorila 136<br />6.4.3 分布式优先级经验重放:Ape-X 137<br />6.5 使用Ray实现可扩展的深度Q-<br />学习算法 140<br />6.5.1 Ray入门 140<br />6.5.2 DQN变体的Ray实现 143<br />6.6 使用RLlib实现生产级深度强化<br />学习算法 154<br />6.7 总结 156<br />6.8 参考文献 156<br />第7章 基于策略的方法 158<br />7.1 为什么我们应该使用基于策略的<br />方法 158<br />7.1.1 一种更本质的方法 158<br />7.1.2 适用连续行动空间的<br />能力 158<br />7.1.3 学习到真正随机策略的<br />能力 159<br />7.2 一般性策略梯度方法 160<br />7.2.1 策略梯度方法的优化<br />目标 160<br />7.2.2 计算梯度 161<br />7.2.3 REINFORCE算法 162<br />7.2.4 REINFORCE以及所有策<br />略梯度方法存在的问题 163<br />7.2.5 使用RLlib实现一般性策<br />略梯度方法 164<br />7.3 Actor-Critic算法 167<br />7.3.1 进一步减小策略梯度方法<br />的方差 167<br />7.3.2 优势Actor-Critic算法:<br />A2C 169<br />7.3.3 异步优势Actor-Critic算法:A3C 171<br />7.3.4 一般性优势函数估计 172<br />7.4 信任域方法 173<br />7.4.1 将策略梯度转化为策略<br />迭代 173<br />7.4.2 TRPO 176<br />7.4.3 PPO 177<br />7.5 异策略方法 179<br />7.5.1 DDPG 179<br />7.5.2 TD3 181<br />7.5.3 SAC 182<br />7.5.4 IMPALA 182<br />7.6 Lunar Lander环境中基于策略的<br />方法的比较 183<br />7.7 如何选择正确的算法 184<br />7.8 策略梯度方法的开源实现 185<br />7.9 总结 185<br />7.10 参考文献 186<br />第8章 基于模型的方法 187<br />8.1 技术要求 187<br />8.2 引入基于模型的方法 187<br />8.3 通过模型进行规划 188<br />8.3.1 定义很优控制问题 188<br />8.3.2 随机射击 190<br />8.3.3 交叉熵方法 192<br />8.3.4 协方差矩阵自适应进化<br />策略 195<br />8.3.5 蒙特卡罗树搜索 196<br />8.4 学习世界模型 197<br />8.4.1 理解模型的含义 197<br />8.4.2 确定何时学习模型 198<br />8.4.3 引入学习模型的一般<br />过程 198<br />8.4.4 理解和缓解模型不确定性的影响 199<br />8.4.5 从复杂的观测中学习<br />模型 200<br />8.5 统一基于模型的和无模型的<br />方法 201<br />8.5.1 复习Q-学习 201<br />8.5.2 使用世界模型对无模型方法进行Dyna式加速 201<br />8.6 总结 202<br />8.7 参考文献 202<br />第9章 多智能体强化学习 204<br />9.1 多智能体强化学习介绍 204<br />9.2 探索多智能体强化学习中存在的<br />挑战 207<br />9.2.1 非平稳性 207<br />9.2.2 可扩展性 207<br />9.2.3 不明确的强化学习目标 208<br />9.2.4 信息共享 208<br />9.3 在多智能体环境中训练策略 208<br />9.3.1 RLlib多智能体环境 209<br />9.3.2 竞争自博弈 210<br />9.4 通过自博弈来训练井字棋智能体 211<br />9.4.1 设计多智能体井字棋<br />环境 212<br />9.4.2 配置训练器 213<br />9.4.3 观测结果 214<br />9.5 总结 215<br />9.6 参考文献 215<br />第三部分 强化学习中的高级主题<br />第10章 机器教学 218<br />10.1 技术要求 218<br />10.2 机器教学简介 218<br />10.2.1 理解机器教学的需求 219<br />10.2.2 探索机器教学的要素 222<br />10.3 设计奖励函数 223<br />10.3.1 何时设计奖励函数 224<br />10.3.2 奖励塑造 225<br />10.3.3 示例:山地车的奖励<br />塑造 228<br />10.3.4 设计奖励函数面临的<br />挑战 230<br />10.4 课程表学习 231<br />10.5 热启动和演示学习 233<br />10.6 行动掩蔽 234<br />10.7 概念网络 235<br />10.8 机器教学的缺点和承诺 236<br />10.9 总结 236<br />10.10 参考文献 236<br />第11章 泛化和域随机化 238<br />11.1 泛化和部分可观测性概述 238<br />11.1.1 监督学习中的泛化和<br />过拟合 238<br />11.1.2 强化学习中的泛化和<br />过拟合 239<br />11.1.3 泛化与部分可观测性<br />之间的联系 239<br />11.1.4 用记忆克服部分<br />可观测性 240<br />11.1.5 通过随机化克服过<br />拟合 241<br />11.1.6 泛化的技巧 241<br />11.2 用于泛化的域随机化 241<br />11.2.1 随机化的维度 242<br />11.2.2 量化泛化 243<br />11.2.3 正则化和网络架构对<br />强化学习策略泛化的<br />影响 245<br />11.2.4 网络随机化和特征<br />匹配 248<br />11.2.5 用于泛化的课程表<br />学习 249<br />11.2.6 Sunblaze环境 252<br />11.3 使用记忆来克服部分<br />可观测性 252<br />11.3.1 堆叠观测 252<br />11.3.2 使用RNN 253<br />11.3.3 Transformer架构 255<br />11.4 总结 256<br />11.5 参考文献 256<br />第12章 元强化学习 257<br />12.1 元强化学习简介 257<br />12.1.1 学会学习 257<br />12.1.2 定义元强化学习 258<br />12.1.3 动物学习和Harlow<br />实验的关系 258<br />12.1.4 部分可观测性和域<br />随机化的关系 259<br />12.2 具有循环策略的元强化<br />学习 260<br />12.2.1 网格世界示例 260<br />12.2.2 RLlib实现 261<br />12.3 基于梯度的元强化学习 262<br />12.4 元强化学习作为部分观测强化<br />学习 264<br />12.5 元强化学习中的挑战 264<br />12.6 总结 264<br />12.7 参考文献 265<br />第13章 其他高级主题 266<br />13.1 分布式强化学习 266<br />13.1.1 可扩展且高效的深度<br />强化学习:SEED RL 266<br />13.1.2 分布式强化学习中的<br />循环经验重放 269<br />13.1.3 实验SEED RL和<br />R2D2 272<br />13.2 好奇心驱动的强化学习 273<br />13.2.1 针对硬探索问题的<br />好奇心驱动的学习 273<br />13.2.2 好奇心驱动的强化学习<br />中的挑战 275<br />13.2.3 NGU 275<br />13.2.4 Agent57改进 278<br />13.3 离线强化学习 278<br />13.3.1 离线强化学习工作<br />原理的概述 278<br />13.3.2 为什么我们需要用于<br />离线学习的特殊算法 279<br />13.3.3 为什么离线强化学习<br />至关重要 279<br />13.3.4 AWAC 280<br />13.3.5 离线强化学习基准 281<br />13.4 总结 281<br />13.5 参考文献 281<br />第四部分 强化学习的应用<br />第14章 自主系统 284<br />14.1 PyBullet 284<br />14.2 熟悉 KUKA环境 285<br />14.2.1 使用KUKA机器人抓取<br />矩形块 286<br />14.2.2 KUKA Gym环境 286<br />14.3 制定解决KUKA环境的策略 287<br />14.4 使用课程表学习训练KUKA<br />机器人 288<br />14.4.1 定制课程表学习环境 288<br />14.4.2 设计课程表中的课程 290<br />14.4.3 使用手动设计的课程表<br />训练智能体 291<br />14.4.4 使用绝对学习进度的<br />课程表学习 292<br />14.4.5 对比实验结果 294<br />14.5 超越PyBullet进入自动驾驶<br />领域 295<br />14.6 总结 296<br />14.7 参考文献 296<br />第15章 供应链管理 297<br />15.1 优化库存采购决策 297<br />15.1.1 库存的需求及管理中的<br />权衡 297<br />15.1.2 库存优化问题的组成<br />部分 298<br />15.1.3 一步库存优化:报童<br />问题 299<br />15.1.4 模拟多步库存动态 301<br />15.1.5 制定近乎很优的基准<br />策略 305<br />15.1.6 库存管理的强化学习<br />解决方案 306<br />15.2 建模路由问题 310<br />15.2.1 在线用餐订单的取货和<br />交付 310<br />15.2.2 用于动态组合优化的<br />指针网络 311<br />15.3 总结 312<br />15.4 参考文献 313<br />第16章 营销、个性化和金融 314<br />16.1 超越老虎机进行个性化 314<br />16.1.1 老虎机模型的缺点 314<br />16.1.2 用于新闻推荐的深度<br />强化学习 315<br />16.2 使用强化学习制定有效的营销<br />策略 318<br />16.2.1 个性化营销内容 318<br />16.2.2 获客营销资源配置 318<br />16.2.3 降低客户流失率 319<br />16.2.4 赢回失去的客户 319<br />16.3 在金融中应用强化学习 319<br />16.3.1 在金融中使用强化学习<br />面临的挑战 319<br />16.3.2 TensorTrade 320<br />16.3.3 制定股票交易策略 322<br />16.4 总结 323<br />16.5 参考文献 323<br />第17章 智慧城市与网络安全 324<br />17.1 交通灯控制以优化车流量 324<br />17.1.1 Flow 324<br />17.1.2 在Flow中创建实验 326<br />17.1.3 建模交通灯控制<br />问题 328<br />17.1.4 使用RLlib解决交通<br />控制问题 329<br />17.1.5 延伸阅读 331<br />17.2 为电网提供辅助服务 331<br />17.2.1 电网运营及配套服务 331<br />17.2.2 描述环境和决策问题 332<br />17.2.3 强化学习模型 334<br />17.3 检测智能电网中的网络攻击 336<br />17.3.1 电网中的网络攻击早期<br />检测问题 336<br />17.3.2 网格状态的部分<br />可观测性 337<br />17.4 总结 337<br />17.5 参考文献 337<br />第18章 强化学习领域的挑战和<br />未来方向 339<br />18.1 你从本书中得到的收获 339<br />18.2 挑战和未来方向 340<br />18.2.1 样本效率 340<br />18.2.2 需要高保真和快速模拟<br />模型 342<br />18.2.3 高维行动空间 343<br />18.2.4 奖励函数保真度 343<br />18.2.5 安全性、行为保证和<br />可解释性 343<br />18.2.6 对超参数选择的再现性<br />和敏感性 344<br />18.2.7 健壮性和对抗智能体 344<br />18.3 对有抱负的强化学习专家的<br />建议 344<br />18.3.1 深入了解理论 344<br />18.3.2 跟随优秀的从业者和<br />研究实验室 345<br />18.3.3 从论文及其良好解释中<br />学习 345<br />18.3.4 了解深度学习其他领域<br />的近期新趋势 346<br />18.3.5 阅读开源代码库 346<br />18.3.6 实践 347<br />18.4 结束语 347<br />18.5 参考文献 347
强化学习(RL)是用于创建自学习自主智能体的人工智能方法。本书基于强大的理论基础,采用实用的方法来研究强化学习,并使用受现实世界中商业和行业问题启发的实际示例来教授优选的强化学习知识。 本书首先介绍老虎机问题、马尔可夫决策过程和动态规划,带你深入了解经典强化学习技术,包括蒙特卡罗方法和时间差分学习方法。然后,你将了解深度Q-学习、策略梯度方法、Actor-Critic算法、基于模型的方法以及多智能体强化学习。接下来,本书将介绍一些最成功的强化学习实现背后的关键方法,例如,域随机化和好奇心驱动的强化学习。 随着学习的深入,你将使用现代Python库(例如,TensorFlow和Ray的RLlib包)探索许多具有高级实现的新颖算法。你还将了解如何在机器人、供应链管理、市场营销、金融、智慧城市与网络安全等领域应用强化学习技术,同时评估不同方法的利弊并避免常见的陷阱。 学完本书,你将掌握如何训练和部署自己的强化学习智能体来解决强化学习问题。通过阅读本书,你将: ? 使用强化学习建模并解决复杂的序贯决策问题。 ? 深入了解最优选的强化学习方法的工作原理。 ? 使用Python和TensorFlow从头开始编写强化学习算法。 ? 使用Ray的RLlib包并行化强化学习实现,以及扩展强化学习实现。 ? 深入了解各种强化学习主题。 ? 了解不同强化学习方法之间的利弊。 ? 发现并解决在现实世界中实现强化学习的挑战。
亲,大宗购物请点击企业用户渠道>小苏的服务会更贴心!
亲,很抱歉,您购买的宝贝销售异常火爆让小苏措手不及,请稍后再试~
非常抱歉,您前期未参加预订活动,
无法支付尾款哦!
抱歉,您暂无任性付资格
