RL-learning

return 与路径的定义

Bootstrapping

就能求解v了
矩阵 I-γP 是可逆的

策略决定下一个采取什么行动(action)
奖励策略决定下一个行动获得什么奖励(reward)
状态转换策略决定下一个行动转换为什么状态(state transition)

多步形成轨迹(trajectory)
经过衰减后得到的评分(discounted return) 衰减率γ(discounted rate)

状态分数集

return是一个轨迹的评分 state value是从该状态出发能得到的所有分数(state value是该状态下出发后 所有trajectory得到return的平均值)
下面是三个策略,每个策略可以算最终state value(s1)来得到最后分数谁更好

贝尔曼公式:


当下的立即回报+未来的预期回报=state value
当下得到所有的return与他们的概率求和:

当下能达到的所有state的概率与他们的state value求和(带衰减):

矩阵形式(马可夫性质 条件概率与历史无关 只考虑当下):

当k足够大时 收敛到vπ(整个策略的价值)

state value分布示例:

定义action value:

贝尔曼公式等价于:
在s状态下 选择不同action的概率与该action得到的分数的依概率求和


可以得到action value的表达式


贝尔曼最优公式:

通过放缩原理、不动点推出贝尔曼公式的最优解
价值迭代的根本目的是为了找到最优状态价值函数 $v^*$,使得它满足贝尔曼最优方程:
$$v^* = \max_{\pi} (r_{\pi} + \gamma P_{\pi} v^*)$$
由于贝尔曼最优算子 $f(v)$ 在压缩映射原理(Contraction Mapping Principle)下是一个 $\gamma$-压缩映射,满足:
$$\Vert{}f(u) - f(v)\Vert{}\infty \le \gamma \Vert{}u - v\Vert{}\infty$$
这意味着无论你初始的 $v_0$ 是什么,随着迭代次数 $k \to \infty$,价值序列 $v_k$ 必然会收敛到唯一的确定不动点——最优价值函数 $v^*$。
在实际计算中,当 $\Vert{}v_{k+1} - v_k\Vert{} < \epsilon$($\epsilon$ 是一个极小的正数阈值)时,停止迭代。




有点贪心原理内味,那个action回报最高,他的权重就拉的最高:

为了求出最优解,我们的目标就是为了设定红色的参数,以求出最优策略

即:为了求状态 $s$ 在第 $k+1$ 步的价值,我们尝试所有动作 $a$,看哪个动作带来的“当前奖励 $\mathcal{R}$ + 以后状态的折扣期望价值 $\gamma \sum \mathcal{P}v_k$”最大,就选哪个作为新的 $v_{k+1}(s)$。
对比下设计参数带来的影响:


γ变小后,会变得极其的近视
γ较大时,会比较注重未来收益
因为公式的定义是:当下的立即回报+γ*未来的预期回报
γ还是为了防止绕远路而设计的,因为会有衰减,导致越绕到达目标的步数越长,相乘的γ阶数越多,得到的分数越低:






![[论文阅读]G-OLAP](http://aplainjane.github.io/article/3356482c/wallhaven-7jpjzv_1920x1080.png)