当前位置: 首页 > news >正文

TRPO 为什么要用自然梯度优化

普通梯度下降的问题

但强化学习真正关心的不是神经网络权重挪动多少,而是:策略 pi_theta 的行为分布变化多大
权重一点点改动,有时候策略动作概率会翻天覆地;有时候权重改动很大,策略几乎没变
权重空间的欧式距离 ≠ 策略之间的真实距离

SGD 步长很难调:

  • 步长大:策略突变、训练震荡、容易崩坏、回报断崖下跌
  • 步长太小:学习速度极慢

TRPO,Trust‑Region Policy Optimization

信任区域策略优化
Trust‑Region(信任域):只在当前策略周边、可以信赖的小范围之内搜索更新
Policy Optimization:面向策略网络做优化
核心依靠自然梯度 + KL‑Divergence 约束,防止策略一次性改动过大导致训练崩溃

TRPO 的核心思想

每次更新,严格约束新旧策略的分布变化上限,不让策略跳变得太狠

TRPO (2015): Constrain KL divergence between old and new policy.
Works perfectly but requires expensive second-order optimization (Fisher information matrix, conjugate gradients).

TRPO (2015):用于约束新旧策略之间的 KL 散度。该算法效果非常好,但需要使用昂贵的二阶优化算法来处理问题(例如 Fisher 信息矩阵、共轭梯度法)



F 把参数空间扭曲成策略分布所在的黎曼空间,F⁻¹用来矫正梯度方向

  • 普通梯度是权重空间最陡方向
  • 自然梯度 = 策略分布空间上的最陡下降方向

欧式空间和黎曼空间

http://www.cnnetsun.cn/news/3942396.html

相关文章:

  • C++实战:从零构建2048游戏,掌握二维数组与游戏循环核心
  • 游戏角色技能系统与宣发素材自动化生产管线实战
  • AI学术写作工具:文献综述与知识图谱实战指南
  • Unity热更新框架TEngine:集成HybridCLR与YooAsset的商业级开发解决方案
  • 3步解决Windows视频播放难题:LAV Filters终极使用指南
  • 深耕本土化体验与高效转化:全面解析菲律宾菠菜网站建设的全流程关键要素
  • 揭秘游戏高光集锦自动化生产:从算法推送到技术实现
  • Unity Hub安装包验证失败:从日志分析到网络代理配置的完整排错指南
  • ContextMenuManager:Windows右键菜单终极管理指南
  • nvm管理Node.js版本全指南与实战技巧
  • PLC Modbus 轮询卡顿?在 Qt 中实现异步读写队列与优先级调度,实测吞吐提升 3 倍
  • 上海网站建设y021:从代码到灵魂,一家本地团队的真诚自白与行业观察
  • 2026年8月:探秘外星人产品售后情况
  • 微信小程序数字博物馆开发实践与性能优化
  • 艾尔登法环帧率解锁终极指南:免费提升游戏体验的完整教程
  • 淘宝淘金币自动化脚本:5分钟解放25分钟,重新定义你的时间价值
  • GitHub Copilot 斜杠命令实战指南:提升AI编程效率的快捷指令
  • OpenClaw问题排查指南:从安装到部署的完整解决方案
  • 揭秘真相:固镇网站建设哪家好?资深开发者告诉你背后的行业内幕与避坑指南
  • Anthropic的异端之路:从宪法AI到可解释性,AI安全如何重塑技术范式
  • SpringBoot+Vue医疗电商系统开发实战
  • 基于开源大模型的人脸属性分析与技术伦理探讨
  • 彻底告别杂乱!Windows右键菜单清理优化全攻略
  • Unity JSON序列化性能优化:JsonUtility与LitJson深度对比与实践指南
  • C++参数传递:传值、传址与传引用的核心原理与性能优化实战
  • 3步实现手机号码精准定位:ASP.NET开源工具如何让位置查询变得如此简单?
  • 深入解析福建住房和城乡建设部网站:如何助力百姓安居乐业与城市发展
  • 5分钟快速上手:用ExplorerPatcher免费恢复Windows 10经典界面,解决Windows 11兼容性问题
  • 暗黑破坏神2存档修改器终极指南:如何5分钟打造完美角色
  • Codex AI助手从零到一:本地模型集成与高效开发工作流搭建指南