新闻中心News

分会新闻动态、行业要闻、通知公告与政策法规。

国产医疗大模型在多中心临床评测中表现亮眼

行业要闻

2026-03-14

返回行业要闻
前沿技术来源:多中心临床评测公开发布

国产医疗大模型在多中心临床评测中表现亮眼

多家国产医疗大模型在影像辅助诊断与病历理解任务上达到领先水平,部分指标超越国际同类产品。

2026年3月,多家国产医疗大模型在多中心临床评测中取得亮眼成绩。评测覆盖影像辅助诊断、病历理解、临床决策支持等核心任务,多款国产模型在多个细分子任务上达到领先水平,部分关键指标已超越国际同类产品。评测同时关注模型在真实临床环境中的稳健性、可解释性与合规性,倡导以临床价值为核心的研发导向。

一、评测背景

2026年1月,上海人工智能实验室发布了MedBench 4.0,这是全国首个且唯一面向垂直模型、专业模型和应用场景的医疗大模型评测与验证体系。该体系基于医学权威标准,评估大语言模型、多模态大模型及智能体在医疗领域的能力,系统检验模型在影像识别、跨模态理解与临床推理等维度的综合水平。同期,由医疗人工智能科研评测协作联盟联合哈佛医学院、斯坦福医学AI中心顶尖专家团队编撰的《2026年临床AI现状报告》,依托全球多中心临床试验数据与真实落地案例,系统盘点了全球临床AI的技术迭代与实证结果。

二、影像辅助诊断:多项突破达到领先水平

在医学影像辅助诊断领域,国产医疗大模型表现尤为突出。

胸片智能诊断系统进入真实临床。 武汉大学计算机学院杜博、赵煌旋团队基于DeepSeek多模态大模型,成功研发出轻量级胸片智能诊断系统Janus-Pro-CXR,并在3家医院纳入296例患者开展了多中心前瞻性研究。该系统采用大-小模型协同架构与两级知识蒸馏框架,将推理能力浓缩至仅10亿参数,在普通消费级显卡电脑上即可实现1-2秒快速阅片。前瞻性临床验证表明,AI辅助组报告质量与一致性评分显著优于标准诊疗组,单份报告平均耗时缩短约27秒(降幅达18.3%),初级医师对肺炎诊断的阳性率从36.1%大幅提升至52.4%。

可验证推理链开启新范式。 上海交通大学、上海创智学院与瑞金医院联合发布CX-Mind,这是首个将胸片诊断推进为“可验证推理链”的多模态大模型——从看到异常到解释原因、排除什么、结论怎么来,每一步都有影像证据支撑。在横跨23个数据集、708,473张影像的评测中,CX-Mind在视觉理解、报告生成和时空对齐三大能力域平均提升25.1%;在真实世界测试集Rui-CXR上,多中心医生主观评估五项维度全部排名第一。

三、权威榜单登顶:多项指标超越国际竞品

在权威医疗大模型评测中,多款国产模型实现登顶。

MedBench多模态榜单。 2026年2月7日,MedBench公布最新多模态大模型评测榜单,数坤科技的数坤坤多模态医学大模型V3以63.6分拿下综合第一。V3在医疗视觉感知与跨模态语义理解与推理两个细分指标上均排名第一。该模型基于PB级医疗专业数据训练,采用医学MDT(多学科会诊)式训练策略,让模型像人类专家会诊一样进行深度关联学习。

HealthBench国际评测。 在OpenAI提出的权威医疗评测HealthBench上,百川智能与清华大学联合打造的Baichuan-M4综合得分68.6,位列世界第一,领先第二名GPT-5.5超过10分;在最考验复杂临床决策的Hard子集上领先达15.9分,事实性幻觉率低至3.3%。M4在HealthBench及其Hard、Professional三个榜单上同时位列世界第一,全面超越GPT-5.5、Claude Opus 4.7、DeepSeek-V4-Pro等国际主流模型。

多维度权威评测领先。 讯飞医疗发布的星火医疗大模型V3.5,在IDC《中国医疗大模型技术评估,2026》权威测评中综合实力位列行业榜首,涵盖15项核心指标,在辅助诊断、病历生成、健康咨询、诊后管理及随访等12项能力均获第一。在医疗知识问答、诊断推荐、文书生成等任务上,该模型同样超越GPT-5.5、DeepSeek-V4-Pro等主流模型。

四、专科应用深入临床

国产医疗大模型正从通用能力向专科场景纵深推进。百川智能与国家癌症中心、中国医学科学院肿瘤医院联合共建的肿瘤专科AI,以及与国家儿童医学中心、北京儿童医院联合共建的AI儿科医生,均已在真实临床场景中开展验证。在北京儿童医院40余场会诊、大查房及百余病例验证中,AI儿科医生与专家诊断符合率达到95%。云知声U2-Med系列在MedBench 5.0中以逼近满分的99.2分强势登顶,全面领先Claude Opus 4.7等国内外模型。

五、评测趋势与行业展望

当前,医疗大模型的评测正从静态指标向动态临床能力验证演进。业界已搭建“临床认知应答”与“医疗原子技能”双维度评测框架,覆盖13个子方向,全面评估大语言模型的临床能力。业界首个疑难病例诊疗评测基准MedXIAOHE-1.0也已发布,汇聚多位院士及权威医疗机构力量,搭建覆盖30个临床专科的千题级专业评测体系。

评测标准的日趋完善,为国产医疗大模型的持续迭代与临床落地提供了坚实保障。随着多中心临床验证的不断深入,国产医疗大模型正加速从实验室走向诊室,从技术验证迈向规模化应用,为卫生产业数智化转型注入强劲动力。