标签: Reinforcement Learning

2 篇文章

2026

我的强化学习奇妙冒险:从 PPO 到 GRPO
学习笔记 2026年6月28日 Reinforcement Learning
从策略梯度、TRPO 和 PPO 出发,理解面向大语言模型后训练的 GRPO。
我的强化学习奇妙冒险:时序差分学习
学习笔记 2026年5月6日 Reinforcement Learning
从马尔可夫决策过程出发,经由动态规划与蒙特卡洛方法,理解时序差分学习。