NewsFi.AI
返回今日
已核验来源

RobustSGPO:面向智能体框架演化的搜索空间控制

arXiv cs.AI · · 发布于 2026-09-11 · 2 分钟阅读

NewsFi 导读2 分钟速览

语义梯度提示优化(SGPO)利用执行反馈改进智能体运行框架,但其局部更新规则未解决编辑范围与操作选择问题。本文提出RobustSGPO,明确请求的编辑、构建并检查补丁,并从当前方案或保留快照继续搜索。作者在AgentX头脑风暴工作流中评估权限调度、累积控制与任务家族迁移,使用120个任务、95次运行和7350次候选尝试。周期性1→2→3调度比固定最大权限高0.28个测试分。在2000万词元预算下,RobustSGPO将30个留出任务的完成率从60.0%提高到80.0%,测试质量从3.77提高到4.14。类别保留可减少任务转移后的源任务退化,而随机保留达到更高的目标终点。搜索空间控制通过可执行编辑和替代起点提升质量,并带来可测量的保留开销。

当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。
1

研究问题

SGPO 通过执行反馈改进智能体外壳,但其局部更新规则未解决编辑范围与编辑操作应如何选择的问题。

2

方法要点

RobustSGPO 明确指定所请求的编辑,构造并检查补丁,并从当前方案或保留的快照继续搜索。

3

实验设置

评估在 AgentX 头脑风暴工作流中进行,覆盖 120 个任务、95 次运行与 7350 次候选尝试。

4

权限调度效果

周期性 1→2→3 调度比固定最大权限高出 0.28 个测试分。

5

留出任务表现

在 30 个留出任务上,完成率由 60.0% 提升至 80.0%,测试质量由 3.77 提升至 4.14,预算为 2000 万 token。

6

保留策略对比

类别保留减少任务切换后的源任务退化,随机保留则达到更高的目标端点。

7

机制与代价

搜索空间控制借助可执行编辑和备选起点提升质量,但伴随可测量的保留开销。

SOURCES

来源与引用

共 1 个来源
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息
https://arxiv.org/abs/2609.09646