基于依据的评估与修复:自然语言到PDDL问题生成
arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读
本文研究端到端自然语言到PDDL问题生成流程,结合大语言模型生成、PDDL解析与规划验证检查、领域一致性检查器、大语言模型评审以及迭代修复。研究指出,语法有效性或规划器成功等常规评估标准会明显高估对任务描述的忠实度:生成的问题可能可解析、可求解,却错误表达初始状态、目标、对象结构或优化目标。细粒度修复反馈由领域描述、生成问题、自然语言问题描述与运行诊断共同构成。基于参考的对比采用人工整理的基准PDDL问题描述开展事后基准分析,离线检查包括重命名不变的结构匹配与语义等价。在Planetarium、AutoPlanBench与整理后的PDDL 2.1问题上,结果显示运行成功与基准参考重建可能显著背离;结构化修复具有实际作用,而PDDL 2.1的参考重建仍具挑战,即使运行成功有所提升。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。评估偏差问题
语法合法性与规划器成功等常规标准可能高估生成问题对自然语言任务描述的忠实度。
错误表现维度
生成问题可能可解析且可求解,但错误表示初始状态、目标、对象结构或优化目标。
端到端流程
论文研究一个流程,结合大语言模型生成、PDDL 解析、规划与验证检查、领域一致性检查器、大语言模型批评器和迭代修复。
修复反馈构造
细粒度修复反馈来自领域描述、生成的问题、自然语言问题描述以及运行诊断。
离线基准分析
使用精选基准 PDDL 问题描述进行基于参考的比较,包括重命名不变的结构匹配与语义等价,在有领域支持时可用。
实验覆盖范围
评估覆盖 Planetarium、AutoPlanBench 与精选 PDDL 2.1 问题。
核心发现
运行成功与基准参考重构可能显著分离,说明可求解不等于忠实重构。
修复与挑战
结构化修复可能有用,但 PDDL 2.1 对参考重构仍然具有挑战性,即使运行成功改善。
SOURCES
共 1 个来源来源与引用
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息https://arxiv.org/abs/2609.09898