当前位置: 首页 > news >正文

大模型学习基础(六) 强化学习(Reinforcement Learning,RL)初步1.2

我们已经知晓强化学习的基本要素有actor、environment、reward。强化学习的基本模型如下:

environment交给actor一个observation,即s;actor得到s向量以后给出动作action,即a;a、s输入reward模型,得到分数r,通过分数来衡量优势函数A的取值(上述例子直接用奖励r定义优势函数);损失函数通过交叉熵和A共同定义,通过减小损失函数,优化actor的参数

而实际上,每一个动作a会直接影响到后续的s和a,因此a之间并不是相互独立的。另外一个问题是,如果简单的用r来作为A的数值,会有一个问题,就是只有在做固定的action时A才会增加,这会导致actor只会选择固定的action,实际上的RL对A的定义有多种方法。

一种定义优势函数的方法是把动作a之后所有动作获得的r累计起来,作为该动作的优势函数。

优势函数,使用此优势函数将会使actor的action选择更加多样化,而不是只采用reward为正的动作,从而更可能从全局视角考虑问题的最优解。

但是上述定义优势函数的方法有一个问题,那就是奖励的值似乎并不直接受到动作的影响,或者说受到其影响较小,更合适的一种优势函数设定的方法是

可能存在一种情况,即所有的action对应的A都是大于零的,这样actor将会认为所有的action都是好的,这显然不对;所以还需要对A进行标准化。最简单的标准化方法是直接减去一个baseline,即,就是baseline,人为设定。

接下来介绍上述思想的程序逻辑:
1.actor是一个神经网络模型,首先需要初始化actor的参数

2.actor初始化之后,用其跟environment进行互动,得到一系列的

3.计算优势函数,用于评价对的得分

4.定义损失函数,如交叉熵

5.用优化器结合损失函数更新actor参数

这里有一个重要问题,actor在训练过程中所使用的训练集使它自己和环境交互产生的,这是RL显著区别于传统的监督学习的地方。

上述例子中,actor每和environment互动一次,产生一组{s,a},然后再计算价值函数A,接着计算出损失函数,更新actor的参数;在下一个循环中,actor已经是新的actor了,其和environment互动将产生新的{s,a},然后循环此过程。这意味着actor每次用来的训练的数据都是它自己产生的。这种训练用自己产生的数据训练自己的方法叫做on-policy。这种方法的局限在于收集资料的过程太过于漫长,而不能像监督学习一样直接使用现成的数据集。

对应的,自然有actor依赖别的actor所产生的数据进行训练的方法,叫做off-policy。一种经典的off-policy算法就是之前提到过的PPO(近端策略优化)。

在训练过程中,为了使得模型泛化能力更强,需要给actor增加一定的随机性,如在actor的参数上加一些noise或者扩大actor输出的交叉熵

http://www.cnnetsun.cn/news/114158.html

相关文章:

  • 人才发展ℓℓ 人才盘点怎么做?这篇完全应用手册给出答案
  • 真相来了|字节跳动的人才真相:真正拉开差距的,是“人才密度”(附人才密度清单)
  • 力扣(LeetCode) 66: 加一 - 解法思路
  • HC32L130精准延时实现指南
  • 收藏必看!大学生网络安全学习5大方向,校招不踩坑,小白也能逆袭!
  • 收藏!从“黑客梦“到网络安全专家:过来人告诉你自学路线图
  • Bagisto 产品更新后,前台默认语言的内容不更信,其他语言正常。
  • 【收藏】运维转网安的黄金路径:4个高适配岗位+3步落地指南,薪资提升50%
  • 大语言模型全解析:一篇文章带你深入理解AI的强大能力!
  • 【网络】网络通信模型
  • Slimjet浏览器:基于Chromium的高效网页浏览解决方案,内置广告拦截与多功能工具
  • AMP页面还要做吗?2025替代方案及优化指南
  • 为什么你的RAG总是“一本正经地胡说八道”?EAG-RAG揭示真相,准确率暴涨300%的秘密!
  • iOS 项目中证书管理常见的协作问题
  • 理解线程不安全:从观察到原因分析
  • 《Java Web开发入门很简单》——学习笔记,新手入门,收藏这篇就够了
  • 2025年,国内外最火的10款降AI率工具亲测!(持续更新)
  • 基于大数据的餐饮食材管理系统的设计与实现开题报告
  • 基于大数据的交通信号智能控制系统的设计与实现开题报告
  • 基于大数据的交通信号智能控制系统的设计与实现任务书
  • 蜘蛛池站点优化思路分享
  • 2025 OA 选型关键看这 4 点:集成、灵活、安全、易用,附高性价比系统清单
  • 图神经网络与pytorch
  • Xiaomi 商城页面布局(部分)
  • FPGA以太网升级程序:便捷qspi Flash升级,具备校验功能,适用于Xilinx 7系列...
  • 运料小车装卸料控制:西门子1200PLC与TP700触摸屏联机仿真博途16
  • S32K311启动过程中,向量表重定向
  • 从蓝图到产线:高效产品信息传递的桥梁建设
  • 时间复杂度
  • 网站建设公司怎么选?2025年网站设计制作公司推荐指南