超越表面模仿:面向多模态上下文学习推理路径对齐的对比建模
arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读
多模态大语言模型中的上下文学习(ICL)应用广泛,并在多种多模态任务上取得良好表现。但现有多模态上下文学习方法往往依赖对上下文示例的表面模仿,使模型难以让回答对齐给定多模态输入所需的推理路径;这一问题在复杂多模态任务中更为突出,从而限制了模型性能的进一步提升。为此,研究者提出一种新的多模态上下文学习框架,将对比式示例建模与多模态大语言模型的自我精炼能力相结合:在同一输入下显式对比次优回答与更优回答,并给出说明回答应如何改进的推理路径,使通往目标回答的推理路径更加明确,引导模型超越浅层模仿。由于有效精炼依赖当前回答,该框架还引入以回答为条件的检索机制,选择推理路径与当前回答更相关的示例;同时使用轻量级对齐控制器预测回答质量,判断是否需要进一步精炼。在三类多模态任务上的实验表明,该框架持续提升多模态大语言模型性能,在视觉问答任务上的提升尤为明显。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。问题定位
现有多模态上下文学习方法往往依赖对示例的表层模仿,导致 MLLM 难以将响应与给定多模态输入所要求的推理路径对齐。
问题在复杂任务中加剧
原文指出,这一局限在复杂多模态任务中更为明显,并因此限制了 MLLM 性能的进一步提升。
核心方案
作者提出新的多模态 ICL 框架,将对比式示例建模与 MLLM 自身的自精炼能力相结合。
示例重构方式
每条示例被重构为同一输入下次优响应与更优响应的显式对比,并附带揭示响应应如何被精炼的推理路径。
方法效果说明
这种对比式表述使通往期望响应的推理路径更加显式,从而引导 MLLM 超越浅层模仿。
响应条件检索
由于有效精炼依赖当前响应,框架引入以响应为条件的检索机制,选择推理路径与当前响应更相关的示例。
对齐控制器
框架使用一个轻量对齐控制器来预测响应质量,并决定是否需要进一步精炼。
实验结论
在三类多模态任务上的实验显示,该框架一致提升 MLLM 性能,视觉问答(VQA)上的增益尤为突出。