rl学习

强化学习,reinforcement learning,按照我的理解,是小步长逐步调整模型,使之能够拟合复杂的现实情况,或者实时拟合现实情况。

强化学习的主体被称为智能体,agent,其余部分是环境。agent作出动作,然后环境给予反馈或者说奖励,然后agent根据反馈调整自己的行为,重复以上过程。

换言之,agent的工作是交替进行观察(获取state,observation)和作出行动(action),二者的交替排列被称为轨迹,trajectory。

强化学习不一定是用神经网络模型,也可能是通过其他方法,例如决策树,或者简单的Q表格(Q-learning)、规则等。

“同轨”是agent与环境存在交互,“离轨”是agent不直接观测环境。

基本设定

A: Action,动作
S: State,状态
R: Reward,奖励
P: Transition probability,转移概率,用于描述agent在不同状态下采取不同动作后转移到下一个状态的概率

除此之外还有:

$\gamma$: Discount factor,折扣因子,用于权衡短期和长期奖励
$\alpha$: Learning rate,学习率,用于控制模型的更新速度
$\beta$: Exploration rate,探索率,用于控制agent的探索行为


rl学习
http://blog.wspdwzh.space/2025/06/28/rl学习/
作者
peter?
发布于
2025年6月28日
许可协议