文章主要内容与创新点总结
一、主要内容
本文聚焦热带气旋威胁下美国港口运营的防灾准备需求,针对现有工具依赖专家判断、多模态数据整合不足及多模态大语言模型(MLLMs)在该场景下性能未被验证的问题,开展了以下研究:
- 数据整合与场景构建:整合2015-2023年美国145个主要港口、90个命名热带气旋的多源数据(NOAA热带气旋预报产品、港口运营影响记录、美国海岸警卫队港口状况公告),筛选并构建了2917个真实港口 disruption 场景。
- 基准数据集创建:基于上述场景,通过自动化流水线生成117178个结构化问答对,构建首个针对热带气旋下港口防灾准备的多模态基准数据集CyPortQA,该数据集涵盖三大核心任务——情境理解(S1,含空间感知、时间理解等维度)、影响评估(S2,含影响时间、恢复时长等子任务)、决策推理(S3,含状况预警、运营规划子任务)。
- 模型评估实验:在CyPortQA上对7个MLLMs(5个开源模型:LLaVA-1.6-7B、Llama-3.2-Vision-11B等;2个专有模型:ChatGPT-4o、Gemini-2.5-Flash-Lite)进行测试,采用准确率、基于容忍度的准确率、LLM作为评判者打分等指标评估。结果显示,专有模型整体性能优于开源模型,所有模型在情境理解任务中表现较好(部分子任务准确率超80%),但在影响评估(如概率风险表述转换)和决策推理(如低估风险、遗漏领域规范)任务中存在显著不足。
订阅专栏 解锁全文

378

被折叠的 条评论
为什么被折叠?



