NewsFi.AI
返回今日
已核验来源

CoVeR:用于VLMs多视角3D推理的基于覆盖的令牌剪枝

HuggingFace Daily Papers · · 发布于 2026-09-11 · 1 分钟阅读

NewsFi 导读1 分钟速览

arXiv:2609.08345v1 公告类型:跨领域 摘要:将三维场景表示为多视图图像允许二维视觉语言模型通过重用预训练的先验知识在三维中进行推理,从而规避带注释的三维数据稀缺的问题。然而,这会产生数千个冗余的视觉标记,其成本

1

要点 1

arXiv:2609.08345v1 公告类型:跨领域 摘要:将三维场景表示为多视图图像允许二维视觉语言模型通过重用预训练的先验知识在三维中进行推理,从而规避带注释的三维数据稀缺的问题。

2

要点 2

然而,这会产生数千个冗余的视觉标记,其成本

当前为原文抽取式整理,不包含站外事实推断。
SOURCES

来源与引用

共 1 个来源
官方原文HuggingFace Daily Papers 原始发布2026-09-11 · 一手信息