10
Lumine
blog.snowflake.zone
勋章等级:
Lv 5
评分明细:当前评分 90 ,近 30 天独立访客 0/30,资料完整度 30/50(站点图标 10/10、博客描述 10/10、关键词 10/10、快照 0/10、Feed 地址 0/10),可访问性 50/50,风险状态 10/10,收录时长 0/10,勋章友链(反链) 0/50,回访评分 0/50
博客描述:
在大语言模型的强化学习中,PPO、GRPO、DAPO、GSPO 和 GEPO 经常被画成一条不断演进的路线。这个说法大体正确,却容易掩盖一个关键事实:它们并非都在修改同一个部件。 PPO → GRPO:主要改变优势(advantage)的估计方式,以同一问题下多个回答的相对奖励取代价值模型; GRPO → DAPO:保留 token 级重要性比率,重点修正采样、裁剪、损失归一化和超长回答的奖励; GRPO → GSPO → GEPO:逐步将重要性权重的统计粒度从 token 提升到 sequence,再提
关 键 词:
标签
收录时间:
缩略图仅在成功获取并验证后缓存;点击快照可查看大图、缩放与旋转;若显示异常请点击“刷新信息”重新尝试