深度学习之增强式学习篇
RL增强式学习
supervise learning监督学习->RL
概述
机器学习就是找一个功能,由外界给到actor输入s再将行为a传递输出到外界。
RL就是内部定义一个政策网络(police network)进行分类任务,给定每个类别一个分数,随机性选择;再定义一个“loss",计算本轮训练 每一步的reward之和得到的Total reward,这个是求最大值的过程;最后是优化阶段”Optimization“,在外界到actor再到外界这样的循环往复的过程中,会得到reward值,求reward总和得到最大值的reward,这样一个黑盒子的过程无从得知,但是需要调整参数以得到最大输出的优化过程。(类比GAN网络)
actor分类问题:

定义一个loss,去训练机器执行我们想要执行的行为,对于想要执行的a为正数,不想要执行的a为负数。

对每一轮训练都进行评价,上一步的结果会影响到下一步的效果,用每一轮reward值的和去评估训练效果的好坏,设置一个超参数γ<1,就是对远近步数的reward赋上不同权值,Sn越大权值定义越小。

策略梯度
概念:一种强化学习算法,通过计算策略函数关于参数的梯度来优化策略,从而实现对智能体行为的改进。
用法:用训练得到的loss评估指标收集资料进行调参优化,每次只更新一次又重新返回收集资料。(因为每一次更新后都相较之前是有所优化的,所以需要再次收集新的资料)
off-policy-->proximal policy optimination(PPO):修改策略算法,离线转为近端优化,让机器自己学习认识到前后产生的差距。
Exploration:加大样本训练中的数据随机性,得到机器学习多样性。
value function:在强化学习中,价值函数用于评估一个状态或状态-动作对的长期价值,即从当前状态开始,未来可能获得的累积奖励。
Critic评估
如何训练critic?
MC方法:观察actor与外界的传递资料,每轮计算后都会得到一个G,直接用训练资料来训练价值函数,这是一个从头到尾都需要计算的过程;

TD方法:观察在某一步和下一步的资料中,得到关联推导公式去训练价值函数。

二者比较:从不同方式进行假设计算,观察资料选取时间不同,二者最终得到的结果可能会不同。
平均期望的比较
AAC:St阶段得一个reward,St+1得到另一个reward,比较间隔步的差距做相减操作,判断训练效果变好还是变差。
采用DQN网络变形训练效果:

附上相关链接:
更多推荐
所有评论(0)