从符号感知到逻辑推理:引导语言模型进行几何推理的框架
arXiv cs.AI · · 发布于 2026-09-11 · 2 分钟阅读
平面几何一直是人工智能面临的重大挑战,需要融合视觉感知与数学推理能力。大型多模态模型虽能自然处理视觉与语言混合输入,但往往计算开销大且过程不透明。该研究证明,纯大语言模型在配备专用模块后,可在复杂几何问题上与当前最先进的多模态模型相媲美。其框架包含几何视觉解析器,将图形转化为符号形式,并配合符号求解器执行形式化演绎,从而减少幻觉并提升推理的可解释性。为进行严格评估,研究者基于 2025 年中国中考题目构建了高难度基准,以保证数据新颖性并检验更深层的演绎能力。实验表明,该方法性能与 Gemini 2.5 Pro 相当,同时能给出更清晰、更接近人类解题过程的解答。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。研究问题
平面几何仍是人工智能的重要挑战,要求同时整合视觉感知与数学推理。
现有模型局限
大型多模态模型能自然处理视觉与语言输入,但往往计算密集且不透明。
核心主张
纯大语言模型在配备专门模块后,可在复杂几何问题上与最先进的大型多模态模型匹敌。
方法框架
框架整合几何视觉解析器与符号求解器:前者把图形转换为符号形式,后者执行形式化推导。
评测基准
作者整理2025年中国中考的挑战性题目作为基准,强调数据新颖性并测试更深层演绎技能。
实验结果
实验表明该方法性能与 Gemini 2.5 Pro 相当,同时提供更清晰、类人的解答。
SOURCES
共 1 个来源来源与引用
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息https://arxiv.org/abs/2609.10335