eb66b14bacc4c37a4ce2365681c5d5d0

return 与路径的定义

c2fb0ca01a097cc9cc88f5ea764cc6f8

Bootstrapping

00704f224d726493b9aa62c26d75ee4e

就能求解v了

矩阵 I-γP 是可逆的

image-20260719165355587

策略决定下一个采取什么行动(action)

奖励策略决定下一个行动获得什么奖励(reward)

状态转换策略决定下一个行动转换为什么状态(state transition)

image-20260719165643374

多步形成轨迹(trajectory)

经过衰减后得到的评分(discounted return) 衰减率γ(discounted rate)

image-20260719165925173

状态分数集

image-20260719170036867

return是一个轨迹的评分 state value是从该状态出发能得到的所有分数(state value是该状态下出发后 所有trajectory得到return的平均值)

下面是三个策略,每个策略可以算最终state value(s1)来得到最后分数谁更好

image-20260719170128897

贝尔曼公式:

image-20260719170355624

image-20260719170648374

当下的立即回报+未来的预期回报=state value

当下得到所有的return与他们的概率求和:

image-20260719171200523

当下能达到的所有state的概率与他们的state value求和(带衰减):

image-20260719171400659

矩阵形式(马可夫性质 条件概率与历史无关 只考虑当下):

image-20260719172214548

当k足够大时 收敛到vπ(整个策略的价值)

image-20260719172631369

state value分布示例:

image-20260719173211531

定义action value:

image-20260719173639336

贝尔曼公式等价于:

在s状态下 选择不同action的概率与该action得到的分数的依概率求和

image-20260719173753778

image-20260719173822610

可以得到action value的表达式

image-20260719173857145

image-20260719173849890

贝尔曼最优公式:

image-20260719195603493

通过放缩原理、不动点推出贝尔曼公式的最优解

价值迭代的根本目的是为了找到最优状态价值函数 $v^*$,使得它满足贝尔曼最优方程:

$$v^* = \max_{\pi} (r_{\pi} + \gamma P_{\pi} v^*)$$

由于贝尔曼最优算子 $f(v)$ 在压缩映射原理(Contraction Mapping Principle)下是一个 $\gamma$-压缩映射,满足:

$$\Vert{}f(u) - f(v)\Vert{}\infty \le \gamma \Vert{}u - v\Vert{}\infty$$

这意味着无论你初始的 $v_0$ 是什么,随着迭代次数 $k \to \infty$,价值序列 $v_k$ 必然会收敛到唯一的确定不动点——最优价值函数 $v^*$。

在实际计算中,当 $\Vert{}v_{k+1} - v_k\Vert{} < \epsilon$($\epsilon$ 是一个极小的正数阈值)时,停止迭代。

image-20260719200450664

image-20260719200544288

image-20260719200556616

image-20260719200618694

有点贪心原理内味,那个action回报最高,他的权重就拉的最高:

image-20260719200932640

为了求出最优解,我们的目标就是为了设定红色的参数,以求出最优策略

image-20260719201155339

即:为了求状态 $s$ 在第 $k+1$ 步的价值,我们尝试所有动作 $a$,看哪个动作带来的“当前奖励 $\mathcal{R}$ + 以后状态的折扣期望价值 $\gamma \sum \mathcal{P}v_k$”最大,就选哪个作为新的 $v_{k+1}(s)$。

对比下设计参数带来的影响:

image-20260719201422525

image-20260719201432226

γ变小后,会变得极其的近视

γ较大时,会比较注重未来收益

因为公式的定义是:当下的立即回报+γ*未来的预期回报

γ还是为了防止绕远路而设计的,因为会有衰减,导致越绕到达目标的步数越长,相乘的γ阶数越多,得到的分数越低:

image-20260719202157038