CT-SAFR:面向自主机器人的安全可解释思维链推理——可信人工智能驱动机器人决策的多层验证框架
arXiv cs.AI · · 发布于 2026-09-11 · 2 分钟阅读
思维链提示使大语言模型能够进行显式的逐步推理,为构建复杂的自主机器人创造了机会。但近期研究显示,推理模型仅在25%至39%的情况下表达其真实决策过程,在复杂任务中推理忠实度下降44%。本文提出CT-SAFR(面向机器人学的思维链安全与忠实性)多层验证框架,其幻觉检测率达到94.2%(样本量500,95%置信区间为91.8%至95.9%),延迟低于500毫秒。通过仓储机器人案例研究,该工作显示不安全推理输出减少87%(显著性水平小于0.001),并就负责任地部署具备推理能力的自主机器人提出建议。
研究背景
思维链(CoT)提示使大语言模型(LLM)能够进行显式、逐步推理,为复杂自主机器人创造机会。
忠实性问题
近期研究显示,推理模型仅 25-39% 的时间表达实际决策过程,复杂任务上忠实性下降 44%。
提出框架
论文提出 CT-SAFR,即面向机器人学的思维链安全与忠实性,是一个多层验证框架。
检测性能
CT-SAFR 实现 94.2% 的幻觉检测率,样本量 n=500,95% 置信区间为 91.8-95.9%。
延迟指标
该框架的延迟低于 500 毫秒。
案例结果
通过仓库机器人案例研究,展示不安全推理输出减少 87%,p<0.001。
部署建议
论文为具备推理能力的自主机器人的负责任部署提供建议。
平台附加说明
原文包含 arXivLabs 说明:合作者可直接在 arXiv 网站开发并共享新功能。
平台价值观
与 arXivLabs 合作的个人和组织接受开放、社区、卓越与用户数据隐私等价值观;arXiv 只与遵守这些价值观的伙伴合作。
SOURCES
共 1 个来源来源与引用
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息https://arxiv.org/abs/2609.09692