NewsFi.AI
返回今日
已核验来源

强化学习改善法学硕士参数知识的遍历

HuggingFace Daily Papers · · 发布于 2026-09-11 · 1 分钟阅读

NewsFi 导读1 分钟速览

arXiv:2511.05933v3 公告类型:替换交叉 摘要:强化学习(RL)通常被认为是在牺牲事实知识的情况下提升推理能力。我们反而发现,推理模型通过访问 e,在事实回忆方面表现优于其指令调优版本。

1

要点 1

arXiv:2511.05933v3 公告类型:替换交叉 摘要:强化学习(RL)通常被认为是在牺牲事实知识的情况下提升推理能力。

2

要点 2

我们反而发现,推理模型通过访问 e,在事实回忆方面表现优于其指令调优版本。

当前为原文抽取式整理,不包含站外事实推断。
SOURCES

来源与引用

共 1 个来源
官方原文HuggingFace Daily Papers 原始发布2026-09-11 · 一手信息