论文精读:Hallucination of Multimodal Large Language Model: A Survey

Hallucination of Multimodal Large Language Model: A Survey

Paper Link: https://arxiv.org/abs/2404.18930

Catalogue


Definition and Category of Hallucination

Definition

幻觉(Hallucination)指MLLM的输出与视觉输入不一致或生成事实错误的文本内容。

Category

幻觉的分类,主要分三种

  • Object Hallucination

    即生成的内容中包含了图像输入中不存在/不正确的物体

  • Attribute Hallucination

    即错误描述已存在物体的属性(这里将对象计数 / 对象事件等统一归入属性幻觉)

  • Relation Hallucination

    即错误描述物体间的空间或逻辑关系

Architecture of MLLM

现代的主流 MLLM 架构主要分两种,一种是 Interface-Based MLLM ,另一种是 End-to-End的 MLLM。

请添加图片描述

上面是 Interface-Based MLLM 的模型架构,主要有视觉部分和文本部分组成。

视觉部分负责接收视觉输入并进行视觉特征提取,然后将视觉信息通过 vision model 和 LLM 连接的 interface 映射到 LLM 的输入嵌入空间中,这一步即实现了模态转换。

文本内容处理与 LLM 的文本处理过程相同,先进行分词、向量化,在 decoder 中自回归预测下一个 token 。

Training Stage

MLLM 的训练和 LLM 的训练阶段类似,主要有两部分:预训练(pre-train)和 SFT

pre-train

预训练的主要目的是完成跨模态对齐,具体的方法是冻结vision encoder 和 LLM ,仅训练vision model -> LLM的模态转换接口,完成视觉特征到 LLM 输入embedding 空间

这个阶段用于评估训练效果的指标仍然是 LLM 的输出,传统上使用的是交叉熵损失,现在流行使用对比损失和图文匹配损失来增强对齐效果。

SFT

和 LLM 的 Instruction Tuning 一样,目的是让 MLLM 能够遵循人类指令,从而更好的进行交互。

需要构造 视觉内容 - 指令 - 回答 格式的数据集,利用 FFT / LoRA等方法进行微调。


Hallucination Causes and Solutions

幻觉的成因主要分为四个方面:数据(Data)、模型(Model)、训练(Train)和推理(Inference),数据是幻觉的主要原因

1. 数据(Data)

在这里插入图片描述

数据层面具体有三种幻觉成因,分别是数据量(Quantity)、数据质量(Quality)和统计偏差(Statistic Bias)

  • 数据量不足:MLLM 的训练数据量远没有 LLM 的数据量大,所需的图片-文本对数据集和视觉问答数据集不够多,数据量不足可能会导致跨模态对齐出现问题,从而产生幻觉。

  • 数据质量不高:

    • 噪声数据(Noisy data)

      预训练所使用的由网络上爬取的图片-文本对数据可能含有未对齐、不准确或损坏的数据,不利于进行模态对齐。

      SFT阶段使用人工标注的数据相比使用 GPT-4 这种非视觉语言模型进行标注效果要更好,因此需要注意使用模型标注所带来的潜在幻觉影响

    • 缺少多样性(Lack of Diversity)

      主要是 SFT 阶段,大多数的数据都是关于图像内容和理解的正例(Positive Instruction),缺少一些负例(Negative Instruction)和拒答(Rejection Instruction)。这导致在使用场景中模型对任意的指令都偏向于正例回答,即使正确的描述是错误或者拒答。基于这些内容需要平衡训练数据中的多样性。

    • 开放问题(Open Question): 训练数据的细粒程度

      有一些研究发现训练数据中没有完整的描述物体位置、物体属性和物间关系,导致模态对齐时有一定的偏差,模型失去定位能力;而另一些研究发现过于详细的描述信息可能超越了 LLM 的感知极限,导致一些细节难以被模型捕捉到,从而产生幻觉。

  • 统计偏差(Statistic Bias)

    有研究指出,训练数据中的实体(物体)分布对模型的表现有显著的影响,主要是频繁出现的物体(Frequent Objects)和共现物体(Objects Occurrence)两个主要的统计偏差类型。 统计偏差存在于大多的数据集中,能够通过增加数据量的形式减轻偏差,但是鉴于真实世界的长尾分布,无法完全消除偏差。

缓解方法

在这里插入图片描述

正负例均衡样本

引入负面数据(Negative Data)、反事实数据(Counterfactual Data)、推理数据(Reasoning Data)、数据清洗,构造 LRV-Instruction 正负例指令样本

  • 负面数据:包含错误或负面信息的训练样本
  • 反事实数据:构造与实际情况相反的假设性数据
  • 推理数据:加强模型逻辑推理能力的训练数据
  • 数据清洗:减少现有的数据集中的噪声和错误
因果数据(Counterfactual Data)

引入因果数据(Counterfactual Data),建立视觉信息与文本描述之间因果对应关系,提高模型对图像内容的准确描述和理解。

推理数据(Reasoning Data)

引入推理数据,通过训练内化指令和响应之间的推理逻辑。

数据清洗(Clean Data)

ReCaption: 重写图片-文本对的文本描述,从描述中提取关键词,然后使用 LLM 基于提取的关键词重写描述句子。

EOS Decision:EOS之前的工作指出,幻觉通常声称在描述中位置靠后的对象中出现,可能超越了 LLM 的感知极限,理想情况是能够及时终止生成过程。

2. 模型(Model)

在这里插入图片描述

<
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值