一文读懂医疗大模型测评基准

拒不完全统计,目前全国已有近300个医疗垂类大模型,医疗大模型的研发与场景落地,已成为医院数智化建设的重点话题。

区别于传统信息化项目,大模型是个“黑盒子”,普通医疗机构很难对大模型的准确度、可解释性、数据隐私、医疗伦理等方面做出专业判断和市场横向对比。

面对市场上浩若星海的大模型,医院管理者如何采购适合自身场景的解决方案?如何选取好的模型作为基础进行课题研究?都是医院需要特别重视的问题。评测基准则benchmark是这些问题的重要解法,国内北京、上海、浙江已然开展了相关的标准化工作。

那么,如今市场上有哪些成熟的医疗评测基准?未来模型评测又有哪些趋势?对医疗机构和企业又有哪些影响?跟着小编,一探究竟。

01 盘点全国医疗大模型测评验证工作

随着行业发展,行业标准化的工作已悄然进行,我们看到:

浙江:2025年9月25日,国家人工智能应用中试基地(医疗)·浙江(简称基地),联合中国医学科学院北京协和医学院、中国信息通信研究院成立“医学人工智能测评验证联合实验室”。11月18日,基地面向全国有关医疗人工智能企业、科研机构、高校、医院,组织开展医疗大模型第二阶段测评验证工作。

上海:2025年1月3日,上海市医疗大模型应用检测验证中心在沪成立,华山医院、中山医院、瑞金医院等12家医疗机构成为中心首批验证单位。11月20日,上海人工智能实验室发布MedBench 4.0,并牵头成立的“医学人工智能评测联盟”。

北京:2025年11月7日,北京市卫生健康委正式宣布启动医疗人工智能应用评测服务,评测范围聚焦胸外科诊疗领域,评测对象为各类具备胸外科临床辅助决策能力的人工智能应用或模型。

深圳:2025年11月28日,深圳启动医疗人工智能测评中心及 Medunibench 医疗大模型测评平台的建设,在深圳市卫生健康委员会指导下,由国家健康医疗大数据研究院(深圳)、深圳市大数据研究院、深圳市卫生健康发展研究和数据管理中心联合牵头开展

02 了解评测集、评测基准、评测榜单

想要了解评测基准,以下三个概念要理清:评测集、评测基准、评测榜单的关系

  • 评测基准(Benchmark)

是一套标准化的评估框架,是测评的起点,回答的是为什么而测?拿什么测?怎么测?

好的评测基准,个人认为应该包含四大要素:

  1. 科学的测评体系(为何而测?考查哪些能力?设定哪些科目?)

  2. 高质量的测评数据集(用哪些题目来考试?)

  3. 合理的测评方法(如何评估、如何记分?)

  4. 智能化的测评工具(为测评基准的可执行性提供支撑)

  • 评测集(Dataset)

是大模型评测的核心,是让模型回答的具体“题目”,其质量直接决定测评结果的可靠性、权威性、科学性。

评测集的构建,通常可分为权威机构的公开评测集以及围绕特定目的联合专业人才构建的自建评测集。

如常见的MedQA(模拟美国医疗执照考试(USMLE)的风格,旨在评估模型对医学知识的理解和推理能力)、MedMCQA(专为解决实际医学入学考试问题而设计的大规模多选题问答数据集)、PubMedQA (从PubMed摘要中收集的新颖的生物医学问答(QA)数据集,要求模型能够理解并推理生物医学研究文本)等。

而当评测集具备了明确的评测维度、方法甚至榜单时,就可以算做评测基准。针对评测集的构建、发展,这里不做过多介绍,以后我们可以单开一篇介绍。

  • 评测榜单(Leaderboard)

是相同基准下,不同模型/应用的表现排名,是评测基准执行后的“果”,是体现不同模型在不同评测维度下的得分,可用于模型的比较和选拔。

可以理解成模型的“高考成绩”,这个成绩有总分排名、有分科排名。有些特优生就是各方面都很强,有些特长生就是分科特别强。无论哪种视角都可以为模型选择和后续优化提供有效支撑。

03 常见的医疗大模型测评基准有哪些 

最早LLM的发展期,通常使用GLUE(通用语言理解测评基准)、CLUE(中文语言理解测评基准)、SuperCLUE等大模型通用测评基准

(自制 大模型测评发展)

(2025.09 SuperCLUE 报告)

而后随着越来越多垂类模型的涌现,衍生出了CMB、CBLUE(中文医学问答评测基准)、Medbench等医疗领域大模型测评基准。

现如今北京、浙江也在依托国家人工智能应用中试基地(医疗)开展大模型测评工作,相信对应的基准和管理要求也会陆续公开。

常见医疗benchmark一览表

名称 发起方 github
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值