LLM-BabyBench:语言模型能在它们可以模拟的世界中进行规划吗?
HuggingFace Daily Papers · · 发布于 2026-09-14 · 1 分钟阅读
arXiv:2505.12135v2 公告类型:替换-cross 摘要:当一个交互式基准测试为语言模型代理报告单一成功率时,很少清楚该数字衡量的是什么。失败可能来自感知、模糊指令、检索、缺失的常识
要点 1
arXiv:2505.12135v2 公告类型:替换-cross 摘要:当一个交互式基准测试为语言模型代理报告单一成功率时,很少清楚该数字衡量的是什么。
要点 2
失败可能来自感知、模糊指令、检索、缺失的常识
SOURCES
共 1 个来源