一、基础篇

1、学习的目标

强化学习在解决什么任务,数学刻画,学习的目标,与预测型有监督学习方法的根本性区别,如何设计强化学习算法

1.1什么是强化学习

机器与环境进行交互:在环境状态下做一个动作决策,应用于环境,环境发生改变,并将奖励和将下一轮状态反馈到机器,并且状态会迭代。机器目标:最大化在多轮交互过程中获得累积奖励的期望。

智能体三种关键因素:

感知:能感知当前状态,eg:alpha-go:感知棋盘情况

决策:根据当前状态计算达到目标需采取的动作,eg:针对棋盘情况下棋

奖励:环境根据状态计算出达到目标需采取的动作,产生一个标量信号作为奖励反馈。此标量信号衡量智能体这一轮动作的好坏。eg:下棋博弈是否胜利

面向决策任务的强化学习和面向预测任务的有监督学习

首先,决策任务往往涉及多轮交互,即序贯决策(随某些因素的变化不断演变,往往用随机过程来刻画);而预测任务总是单轮的独立任务。如果决策也是单轮的,那么它可以转化为“判别最优动作”的预测任务。其次,因为决策任务是多轮的,智能体就需要在每轮做决策时考虑未来环境相应的改变,所以当前轮带来最大奖励反馈的动作,在长期来看并不一定是最优的。

1.2强化学习的环境

agent在与动态环境中完成序贯决策,这过程往往用随机过程刻画,对于一随机过程,最关键要素就是状态以及状态转移的条件概率分布。

若在环境一个自身演变的随机过程中加入一个外来的干扰因素,即智能体动作,则环境的下一个状态概率分布由当前状态智能体动作共同决定,数学公式:

与面向决策任务的智能体交互环境是一个动态的随机过程,并且每一轮状态转移都伴随着两方面的随机性:一是智能体决策的动作的随机性,二是环境基于当前状态和智能体动作来采样下一刻状态的随机性。这一过程就是对着一个随机过程的刻画。

1.3强化学习的目标

在agent与环境交互过程中,agent每轮获得的信号可以叠加,形成智能体整体return。强化学习中,我们关注return的期望,并定义为value,这就是强化学习中agent学习的优化目标。

1.4强化学习中的数据

数据层面谈有监督学习和强化学习的区别

有监督学习:给定的distribution中采样得到的database设定objective function,通过gradient descent进行optimization,找到最优的参数(weights bias etc)

强化学习:数据在智能体与环境交互的过程中得到,智能体的训练数据来自之前智能体的决策结果。智能体策略不同,与环境交互产生的数据分布就不同。

占用度量:归一化的占用度量用于衡量在一个智能体决策与一个动态环境的交互过程中,采样到一个具体的状态动作对(state-action pair)的概率分布。其有两个重要性质:

  • 强化学习的策略在训练中会不断更新,其对应的数据分布(即占用度量)也会相应地改变。因此,强化学习的一大难点就在于,智能体看到的数据分布是随着智能体的学习而不断发生改变的。
  • 由于奖励建立在状态动作对之上,一个策略对应的价值其实就是一个占用度量下对应的奖励的期望,因此寻找最优策略对应着寻找最优占用度量。(这里寻找最优都是指的是整体非单单局部)

1.5强化学习的独特性

有监督学习:最小化一个给定的损失函数

强化学习:最大化value-->奖励函数在策略占用度量上的期望,即:

两者相似点:优化目标相似,优化某数据分布下的一个分数值的期望

不同点:优化途径不同,有监督学习:修改目标函数而分布不变;强化学习:改变策略调整智能体和环境交互数据的分布,即修改数据分布而目标函数(最大化累积奖励)不变。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐