NewsFi.AI
返回今日
已核验来源

VANTAGE-Bench:评估视觉语言模型中的基础设施人工智能差距

arXiv cs.AI · · 发布于 2026-09-11 · 4 分钟阅读

NewsFi 导读4 分钟速览

论文提出 VANTAGE-Bench 基准,用于衡量视觉语言模型在“基础设施人工智能”上的差距。现有研究多聚焦以主体为中心的消费级视频与具身智能,忽视了依赖固定摄像头实现安全监控与运营记录等开环洞察的物理人工智能。该基准覆盖物流、交通运输与智能空间三大领域,统一图像与视频在语义、空间、时间与时空四类能力上的评测,并超越选择题形式,设置包括密集描述与时空定位在内的八种任务形式;同时引入单目标跟踪的单次轨迹协议,据称是首个在固定摄像头基础设施视频上、以专用跟踪器为对照的此类评测。标注覆盖三种标注机制,共 3346 项媒体资产:3342 条视频任务标注、4281 条图像定位标注与 27404 个检测框。对 17 个模型进行零样本评测发现,相对消费级基准的不足是集中而非普遍的:事件核验、指代表达与时间定位在各模型规模上下降约 9 至 24 分,而视频问答与 VideoMME 差距在 5.3 分以内,二维空间指向相对 BLINK 无不足。时间维度绝对表现最弱:时间定位无人超过 55.7 mIoU,密集视频描述无人超过 37.3 SODA_c。跟踪方面,前沿模型在短时程内与专用跟踪器相差约 5 分,随时程延长差距扩大。开放权重模型在二维目标定位上领先,因此规模与专有访问均无法解释这一现象。数据、评测工具与排行榜见 https://vantage-bench.org/

当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。
1

研究动机

视觉语言模型正走向物理部署,但评测仍偏向以动作和主体为中心的具身 AI 与消费级视频,忽视了依赖固定摄像头提供开环洞察的基础设施 AI。

2

基准定位

VANTAGE-Bench 旨在度量“基础设施 AI 差距”,即模型在固定摄像头、开环监测类场景中的能力不足。

3

覆盖范围

基准跨物流、交通与智能空间三个运行域,统一图像与视频评测,涵盖语义、空间、时间与时空能力。

4

任务形式

不止于多选题,包含八种任务形式,其中包括密集描述与时空定位。

5

跟踪评测

新增单目标跟踪的单遍轨迹协议,作者称这是首个在固定摄像头基础设施视频上并与专业跟踪器对比评分的评测。

6

标注规模

标注覆盖三种机制,共 3,346 个媒体资产:3,342 条视频任务标注、4,281 条图像定位标注与 27,404 个检测框。

7

评测结果

对 17 个模型零样本评测显示差距集中而非普遍:事件验证、指称表达、时间定位在每个模型规模上下降约 9 至 24 分。

8

强弱对比

视频问答与 VideoMME 差距在 5.3 分以内,2D 空间指向相对 BLINK 无差距;时间维度最弱,时间定位无人超过 55.7 mIoU,密集视频描述无人超过 37.3 SODA_c。

9

跟踪表现

前沿模型在短时间跨度内与专业跟踪器差距约 5 分,随跨度延长而拉大。

10

开放权重表现

开放权重模型在 2D 目标定位上直接领先,说明规模或专有访问都不能解释这一模式。

11

资源公开

数据、评测工具与榜单发布于 https://vantage-bench.org/。

SOURCES

来源与引用

共 1 个来源
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息
https://arxiv.org/abs/2609.09396