从固定键到可读模式:面向车载智能体函数调用的小语言模型
arXiv cs.AI · · 发布于 2026-09-11 · 4 分钟阅读
车载助手需在严格的内存与延迟约束下将自然语言请求转化为准确的车辆函数调用,小语言模型因此适合端侧部署。函数接口的呈现方式主要有两种:为每个函数设置专用的功能令牌(FT),或直接在提示中提供函数模式(SIP)。FT推理紧凑但仅限训练中学过的函数,SIP可泛化到未见函数,但提示更长、推理开销更高。研究构建了包含9,822条单轮示例、覆盖Android Automotive的79个车辆函数的基准,并对比了270M至1.7B四种小语言模型在相同微调条件下的表现。结果显示,已见函数上规模收益有限,270M模型可匹配1.7B模型,整体最佳出现在0.6B;未见函数上FT准确率为零,SIP则随规模显著提升;超范围请求上SIP更可靠地拒答,但内存占用与延迟更高。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。研究问题
车载助手需在严格内存与延迟约束下把自然语言请求转成准确的车辆函数调用,因此适合端侧部署的小语言模型(SLM)受到关注。
核心设计选择
如何向模型呈现可用函数面是关键:既可用专用功能令牌(FT)表示每个函数,也可在提示词中直接提供函数模式(SIP)。
两种方案的取舍
FT 推理更紧凑,但只能覆盖训练时学过的函数;SIP 可泛化到未见函数,代价是提示词更长、推理开销更高。
基准数据集
作者构建了 9,822 条单轮样本的基准,覆盖源自 Android Automotive 的 79 个车辆函数,并包含留出函数与需要拒答的请求。
实验设置
在四种参数规模从 270M 到 1.7B 的小语言模型上,对两种方法进行匹配条件下的微调与比较。
已见函数表现
在训练中出现过的函数上,扩大模型规模收益有限:270M 模型可匹敌 1.7B 模型,整体最强性能出现在 0.6B。
未见函数表现
在留出函数上,FT 按构造即准确率为零;SIP 能够泛化,并随模型规模扩大而显著提升。
超范围请求表现
面对超出范围的请求,FT 可能调用它被训练输出的但当前不可用的函数,而 SIP 更能依据实际提供的函数可靠拒答。
成本与理论
SIP 的灵活性带来更高的内存占用与延迟;理论分析解释了 SIP 为何能泛化,以及更长的模式上下文为何增加推理成本。
总体结论
决定基于 SLM 的车载函数调用能力与失效模式的,是函数面的表示方式,而不仅仅是模型规模。