CityPlanner:面向可执行城市规划的沙盒智能体
arXiv cs.AI · · 发布于 2026-09-11 · 2 分钟阅读
论文提出 CityPlanner,一个用于可执行城市规划的沙盒智能体框架。城市规划是现实世界中的空间优化问题,需要在成本与服务质量等实际目标下,从庞大候选空间中选出可行行动。现有优化与强化学习方法适用于固定问题形式,但往往依赖特定任务的表示与约束处理。CityPlanner 引入 UrbanSandbox,这是一个统一的基于文件的环境,智能体可检查任务文件、生成方案、运行评估器,并依据可执行反馈修正决策。为提升学习可行性,论文进一步提出原子任务强化学习,将较长的沙盒轨迹分解为用于初始建设的 BuildPlan 和用于基于反馈改进的 ImprovePlan。在真实基准上的实验显示,CityPlanner 持续优于启发式方法、特定任务的强化学习方法以及通用大语言模型智能体基线;消融实验验证了 UrbanSandbox、原子任务强化学习与迭代部署的贡献。代码与数据集已发布。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。研究问题
城市规划属于真实世界空间优化问题,需要在成本、服务质量等实际目标下,从庞大的候选空间中挑选可行动作。
现有方法局限
已有优化方法与强化学习方法对固定问题建模有效,但往往依赖任务特定的表示方式与约束处理机制,迁移与通用性受限。
核心方案
论文提出 CityPlanner,一个面向可执行城市规划的沙箱智能体框架。
环境设计
框架引入 UrbanSandbox,作为统一的基于文件的环境,智能体可在其中查看任务文件、生成规划方案、运行评估器,并依据可执行反馈修正决策。
学习机制
为使学习可行,论文提出原子任务强化学习,将较长的沙箱轨迹分解为 BuildPlan(初始构建)与 ImprovePlan(基于反馈的改进)两类原子任务。
实验结果
在真实世界基准上,CityPlanner 稳定优于启发式方法、任务特定强化学习以及通用大语言模型智能体基线。
消融结论
消融实验验证了 UrbanSandbox、原子任务强化学习以及迭代部署三部分的贡献。
资源开放
代码与数据集通过匿名链接 https://anonymous.4open.science/r/co-agent-C1C8 发布。