GIFT:通过变分有限温格布斯初始化协调训练后目标
HuggingFace Daily Papers · · 发布于 2026-09-11 · 1 分钟阅读
arXiv:2601.09233v3 发布类型:替换-交叉 摘要:大型推理模型(LRMs)的主流后训练范式——先监督微调(SFT)然后强化学习(RL)——存在一个固有的优化不匹配问题:刚性的似然最大化
要点 1
arXiv:2601.09233v3 发布类型:替换-交叉 摘要:大型推理模型(LRMs)的主流后训练范式——先监督微调(SFT)然后强化学习(RL)——存在一个固有的优化不匹配问题:刚性的似然最大化
SOURCES
共 1 个来源