RobustSGPO:面向智能体框架演化的搜索空间控制
arXiv cs.AI · · 发布于 2026-09-11 · 2 分钟阅读
语义梯度提示优化(SGPO)利用执行反馈改进智能体运行框架,但其局部更新规则未解决编辑范围与操作选择问题。本文提出RobustSGPO,明确请求的编辑、构建并检查补丁,并从当前方案或保留快照继续搜索。作者在AgentX头脑风暴工作流中评估权限调度、累积控制与任务家族迁移,使用120个任务、95次运行和7350次候选尝试。周期性1→2→3调度比固定最大权限高0.28个测试分。在2000万词元预算下,RobustSGPO将30个留出任务的完成率从60.0%提高到80.0%,测试质量从3.77提高到4.14。类别保留可减少任务转移后的源任务退化,而随机保留达到更高的目标终点。搜索空间控制通过可执行编辑和替代起点提升质量,并带来可测量的保留开销。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。研究问题
SGPO 通过执行反馈改进智能体外壳,但其局部更新规则未解决编辑范围与编辑操作应如何选择的问题。
方法要点
RobustSGPO 明确指定所请求的编辑,构造并检查补丁,并从当前方案或保留的快照继续搜索。
实验设置
评估在 AgentX 头脑风暴工作流中进行,覆盖 120 个任务、95 次运行与 7350 次候选尝试。
权限调度效果
周期性 1→2→3 调度比固定最大权限高出 0.28 个测试分。
留出任务表现
在 30 个留出任务上,完成率由 60.0% 提升至 80.0%,测试质量由 3.77 提升至 4.14,预算为 2000 万 token。
保留策略对比
类别保留减少任务切换后的源任务退化,随机保留则达到更高的目标端点。
机制与代价
搜索空间控制借助可执行编辑和备选起点提升质量,但伴随可测量的保留开销。
SOURCES
共 1 个来源来源与引用
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息https://arxiv.org/abs/2609.09646