NewsFi.AI
返回今日
已核验来源

TimeBlind:面向视频大语言模型的时空组合性基准

HuggingFace Daily Papers · · 发布于 2026-09-11 · 1 分钟阅读

NewsFi 导读1 分钟速览

arXiv:2602.00288v4 发布类型:替换交叉 摘要:细粒度的时空理解对于视频推理和具身人工智能至关重要。然而,虽然多模态大语言模型(MLLMs)掌握了静态语义,它们对时间动态的把握仍然脆弱。我们

1

要点 1

arXiv:2602.00288v4 发布类型:替换交叉 摘要:细粒度的时空理解对于视频推理和具身人工智能至关重要。

2

要点 2

然而,虽然多模态大语言模型(MLLMs)掌握了静态语义,它们对时间动态的把握仍然脆弱。

当前为原文抽取式整理,不包含站外事实推断。
SOURCES

来源与引用

共 1 个来源
官方原文HuggingFace Daily Papers 原始发布2026-09-11 · 一手信息