Hallucination of Multimodal Large Language Model: A Survey
Paper Link: https://arxiv.org/abs/2404.18930
Catalogue
- Definition and Category of Hallucination
- Hallucination Causes and Solutions
- Benchmark and Metrics
- Challenges and Future Directions
Definition and Category of Hallucination
Definition
幻觉(Hallucination)指MLLM的输出与视觉输入不一致或生成事实错误的文本内容。
Category
幻觉的分类,主要分三种
-
Object Hallucination
即生成的内容中包含了图像输入中不存在/不正确的物体
-
Attribute Hallucination
即错误描述已存在物体的属性(这里将对象计数 / 对象事件等统一归入属性幻觉)
-
Relation Hallucination
即错误描述物体间的空间或逻辑关系
Architecture of MLLM
现代的主流 MLLM 架构主要分两种,一种是 Interface-Based MLLM ,另一种是 End-to-End的 MLLM。

上面是 Interface-Based MLLM 的模型架构,主要有视觉部分和文本部分组成。
视觉部分负责接收视觉输入并进行视觉特征提取,然后将视觉信息通过 vision model 和 LLM 连接的 interface 映射到 LLM 的输入嵌入空间中,这一步即实现了模态转换。
文本内容处理与 LLM 的文本处理过程相同,先进行分词、向量化,在 decoder 中自回归预测下一个 token 。
Training Stage
MLLM 的训练和 LLM 的训练阶段类似,主要有两部分:预训练(pre-train)和 SFT
pre-train
预训练的主要目的是完成跨模态对齐,具体的方法是冻结vision encoder 和 LLM ,仅训练vision model -> LLM的模态转换接口,完成视觉特征到 LLM 输入embedding 空间
这个阶段用于评估训练效果的指标仍然是 LLM 的输出,传统上使用的是交叉熵损失,现在流行使用对比损失和图文匹配损失来增强对齐效果。
SFT
和 LLM 的 Instruction Tuning 一样,目的是让 MLLM 能够遵循人类指令,从而更好的进行交互。
需要构造 视觉内容 - 指令 - 回答 格式的数据集,利用 FFT / LoRA等方法进行微调。
Hallucination Causes and Solutions
幻觉的成因主要分为四个方面:数据(Data)、模型(Model)、训练(Train)和推理(Inference),数据是幻觉的主要原因。
1. 数据(Data)

数据层面具体有三种幻觉成因,分别是数据量(Quantity)、数据质量(Quality)和统计偏差(Statistic Bias)
-
数据量不足:MLLM 的训练数据量远没有 LLM 的数据量大,所需的图片-文本对数据集和视觉问答数据集不够多,数据量不足可能会导致跨模态对齐出现问题,从而产生幻觉。
-
数据质量不高:
-
噪声数据(Noisy data)
预训练所使用的由网络上爬取的图片-文本对数据可能含有未对齐、不准确或损坏的数据,不利于进行模态对齐。
SFT阶段使用人工标注的数据相比使用 GPT-4 这种非视觉语言模型进行标注效果要更好,因此需要注意使用模型标注所带来的潜在幻觉影响。
-
缺少多样性(Lack of Diversity)
主要是 SFT 阶段,大多数的数据都是关于图像内容和理解的正例(Positive Instruction),缺少一些负例(Negative Instruction)和拒答(Rejection Instruction)。这导致在使用场景中模型对任意的指令都偏向于正例回答,即使正确的描述是错误或者拒答。基于这些内容需要平衡训练数据中的多样性。
-
开放问题(Open Question): 训练数据的细粒程度
有一些研究发现训练数据中没有完整的描述物体位置、物体属性和物间关系,导致模态对齐时有一定的偏差,模型失去定位能力;而另一些研究发现过于详细的描述信息可能超越了 LLM 的感知极限,导致一些细节难以被模型捕捉到,从而产生幻觉。
-
-
统计偏差(Statistic Bias)
有研究指出,训练数据中的实体(物体)分布对模型的表现有显著的影响,主要是频繁出现的物体(Frequent Objects)和共现物体(Objects Occurrence)两个主要的统计偏差类型。 统计偏差存在于大多的数据集中,能够通过增加数据量的形式减轻偏差,但是鉴于真实世界的长尾分布,无法完全消除偏差。
缓解方法

正负例均衡样本
引入负面数据(Negative Data)、反事实数据(Counterfactual Data)、推理数据(Reasoning Data)、数据清洗,构造 LRV-Instruction 正负例指令样本
- 负面数据:包含错误或负面信息的训练样本
- 反事实数据:构造与实际情况相反的假设性数据
- 推理数据:加强模型逻辑推理能力的训练数据
- 数据清洗:减少现有的数据集中的噪声和错误
因果数据(Counterfactual Data)
引入因果数据(Counterfactual Data),建立视觉信息与文本描述之间因果对应关系,提高模型对图像内容的准确描述和理解。
推理数据(Reasoning Data)
引入推理数据,通过训练内化指令和响应之间的推理逻辑。
数据清洗(Clean Data)
ReCaption: 重写图片-文本对的文本描述,从描述中提取关键词,然后使用 LLM 基于提取的关键词重写描述句子。
EOS Decision:EOS之前的工作指出,幻觉通常声称在描述中位置靠后的对象中出现,可能超越了 LLM 的感知极限,理想情况是能够及时终止生成过程。
2. 模型(Model)



596

被折叠的 条评论
为什么被折叠?



