CoVeR:用于VLMs多视角3D推理的基于覆盖的令牌剪枝
HuggingFace Daily Papers · · 发布于 2026-09-11 · 1 分钟阅读
arXiv:2609.08345v1 公告类型:跨领域 摘要:将三维场景表示为多视图图像允许二维视觉语言模型通过重用预训练的先验知识在三维中进行推理,从而规避带注释的三维数据稀缺的问题。然而,这会产生数千个冗余的视觉标记,其成本
要点 1
arXiv:2609.08345v1 公告类型:跨领域 摘要:将三维场景表示为多视图图像允许二维视觉语言模型通过重用预训练的先验知识在三维中进行推理,从而规避带注释的三维数据稀缺的问题。
要点 2
然而,这会产生数千个冗余的视觉标记,其成本
SOURCES
共 1 个来源