文章主要内容与创新点总结
一、主要内容
本文针对视觉推理任务中如何整合多个视觉语言模型(VLMs)的互补能力这一核心问题,提出了一种名为Cola的新型范式。视觉推理需同时具备多模态感知与常识认知能力,现有方法(如集成学习)难以实现模型间的高阶通信与有效聚合,而Cola通过引入大型语言模型(LLM)作为协调者,利用自然语言通信整合多个VLMs的优势,完成视觉推理任务。
Cola包含两个核心变体:
- Cola-FT:基于指令微调(instruction tuning),仅需1个训练周期即可在多个数据集上实现最优性能;
- Cola-Zero:基于上下文学习(in-context learning),无需微调,在零样本和少样本场景下表现出竞争力。
实验覆盖视觉问答(VQA)、外部知识VQA、视觉蕴含、视觉空间推理等多个任务,验证了Cola在A-OKVQA、OK-VQA、e-SNLI-VE、VSR等数据集上的SOTA性能,且在与更大模型或更多训练计算量的方法对比中仍具优势。同时,通过消融实验、显著性可视化等分析,证实了LLM能够理解指令提示和各VLMs的独特功能,并有效协调其完成推理。
二、创新点
- 新型协调范式:首次提出以LLM作为协调者整合多个VLMs的视觉推理框架,突破传统集成学习仅依赖权重或预测结果聚合的局限,通过自然语言通信实现模型间的高阶协作;
- 双变体适配不同场景
订阅专栏 解锁全文

2875

被折叠的 条评论
为什么被折叠?



