从零实现训练框架在: GSM8K 上跑通 GRPO、PPO、DPO 对比实验的完整流程

本文做了一个简单的项目 grpo-llm在 GSM8K 数学推理任务上对 GRPO、PPO、DPO 做的一次受控对比。

广义优势估计(GAE):端策略优化PPO中偏差与方差平衡的关键技术

GAE的理论基础建立在资格迹(eligibility traces)和时序差分λ(TD-λ)之上,是近端策略优化(PPO)算法的重要基础理论

登录可以使用的更多功能哦! 登录
作者榜
...
资讯小助手

资讯同步

...
内容小助手

文章同步

...
Deephub

公众号:deephub-imba

...
奕凯

公众号:奕凯的技术栈