从零实现训练框架在: GSM8K 上跑通 GRPO、PPO、DPO 对比实验的完整流程
本文做了一个简单的项目 grpo-llm在 GSM8K 数学推理任务上对 GRPO、PPO、DPO 做的一次受控对比。
广义优势估计(GAE):端策略优化PPO中偏差与方差平衡的关键技术
GAE的理论基础建立在资格迹(eligibility traces)和时序差分λ(TD-λ)之上,是近端策略优化(PPO)算法的重要基础理论
本文做了一个简单的项目 grpo-llm在 GSM8K 数学推理任务上对 GRPO、PPO、DPO 做的一次受控对比。
GAE的理论基础建立在资格迹(eligibility traces)和时序差分λ(TD-λ)之上,是近端策略优化(PPO)算法的重要基础理论