NewsFi.AI
返回今日
已核验来源

为何对可枚举空间进行采样?基因组工具选择中的精确策略优化

arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读

NewsFi 导读3 分钟速览

论文指出,在工具子集空间可枚举的专业科学场景中,基于冻结推理器的强化学习(如 GRPO)存在结构性失配:它仍从少量采样轨迹估计动作期望,且随训练推进策略集中于偏好子集,采样奖励趋同、组归一化优势消失。在基因组推理任务中,无奖励信号的问题比例从统一参考策略的 0.2% 升至 GRPO 训练后的 20.8%。作者提出 FGPO(全组策略优化),对每个工具子集打分并优化精确动作期望,同时预计算问题-子集奖励表以移除训练循环中的冻结推理器调用。在五种冻结推理器和三个基因组基准上,FGPO 在全部 15 个设置中平均优于 GRPO 6.75 分,最高 14.20 分,并将 GenomeQA 每问题调用工具数从 2.36 降至 1.40。

当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。
1

背景

基于冻结推理器的强化学习已成为教策略调用哪些外部工具的常见配方。

2

结构性错配

论文认为该配方在完整工具子集空间可枚举的专业科学设置中发生结构性错配。

3

可枚举场景

在专业科学领域,少量重复计算能力覆盖领域,工具子集空间具有组合性但小到可枚举。

4

GRPO 的采样估计

GRPO 仍从少量采样回合估计动作期望,未利用可枚举的完整动作空间。

5

训练退化机制

随着训练成功,策略集中于偏好子集并重采样它们,采样奖励碰撞,组归一化优势消失。

6

基因组证据

在基因组推理中,产生无奖励信号的问题比例从均匀参考策略下的 0.2% 上升到 GRPO 训练后的 20.8%。

7

FGPO 精确期望

FGPO 为每个工具子集打分并优化精确动作期望,使每次更新看到完整动作空间。

8

FGPO 穷举奖励表

FGPO 将每个问题—子集对的奖励预计算为穷举表,从训练循环中完全移除冻结推理器调用。

9

性能结果

在五个冻结推理器和三个基因组基准的全部 15 个设置中,FGPO 均优于 GRPO,平均提升 6.75 分,最高提升 14.20 分。

10

效率与工具调用

标准按需 GRPO 调度需要 2.4 倍的冻结推理器奖励评估;在 GenomeQA 上,FGPO 将每题调用工具数从 2.36 降到 1.40。

SOURCES

来源与引用

共 1 个来源
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息
https://arxiv.org/abs/2609.10221