百川智能联合清华大学发布医疗大模型Baichuan-M4

6月22日 17:12
该模型在OpenAI权威评测中综合得分68.6,于动态问诊与长上下文记忆维度实现突破,并引入证据锚定技术以强化临床决策准确性。

百川智能携手清华大学研究团队于6月22日共同推出新一代医疗增强大模型Baichuan-M4。该模型在由OpenAI构建的HealthBench评测体系中,于综合榜单、Hard子集及Professional榜单三项指标均取得全球第一的成绩,其综合得分为68.6分,较排名第二的GPT-5.5高出超过10分。在针对复杂临床决策能力的Hard子集测试中,M4以领先15.9分的幅度刷新纪录。此外,该模型将事实性幻觉率控制在3.3%,显著低于同类竞品,显示出从单纯知识问答向具备实际诊疗辅助能力转变的技术进展。

在交互逻辑与记忆机制方面,Baichuan-M4摒弃了被动等待用户完整输入的传统模式,转而采用类似临床医生的主动追问策略,能够针对症状性质与诱因进行多轮动态排查,优先识别危急重症。为验证这一能力,团队联合150多位一线医生参照OSCE(客观结构化临床考试)方法构建了SCAN-bench动态评测体系。在该体系中,M4的初诊得分达到79.0分,复诊得分为74.7分,均优于GPT-5.5、DeepSeek-V4-Pro及Claude Opus 4.7等竞品。同时,模型实现了全病程记忆功能,能够整合历史病历、多轮问诊记录、化验指标趋势及用药反馈,在长上下文临床记忆评测中以86.9分的成绩位居同类最高,较上一代产品M3提升了21.1分。

为确保医学结论的严谨性,Baichuan-M4首创了“证据锚定”技术,要求模型生成的每一项结论必须精确对应至原始医学论文或指南的具体段落,而非仅标注文献来源。依托包含权威指南与专家共识的六源循证库,该模型在Baichuan-EBM评测中的循证引用精度达到90.0%,较GPT-5.5提升64%。在实际应用层面,某三甲医院的临床验证数据显示,M4生成的处方与专家共识符合率高达92%,相比传统模型提升了35个百分点,标志着医疗人工智能在标准化临床路径拆解与精准诊疗建议生成方面取得了实质性进展。