中国医疗AI拿下全球第一新智元
过去十年,医疗AI经历了两次范式跃迁。
第一次浪潮,是「知识数字化」。
从2010年代中期开始,海量医学教材、指南、论文被数字化,AI具备了检索知识的能力。这个阶段的核心价值,是「信息可及」。
第二次浪潮,是「对话生成」。
LLM出现后,AI不再只是检索和呈现,而是能像人一样组织语言、生成回答。这个阶段的核心价值,是「表达流畅」。
这两次浪潮解决了一个问题:让知识离人更近。但它们都没有解决另一个更深层的问题——让知识真正服务于这个人。用户问了一个健康问题,AI给了一段回答,并没有对这个人长期健康的持续关注。
这,正是今天医疗AI正在跨越的第三个拐点:从「一次回答」到「持续服务」。
2026年7月底,智诊科技正式发布新一代医学大模型WiseDiag V3及全新升级的好伴AI。
这一次升级的核心,不是参数更大、分数更高,而是能力形态的根本转变:好伴AI从「能聊」升级为「能持续服务」。
通过模型、记忆、服务三大底层能力的同步跃迁,好伴AI正在将医疗AI从「单轮问答工具」推向「长期陪伴、主动组织、持续负责」的新阶段。
这是一次技术路线的重新定调,也是一个行业拐点的到来。
从此,模型不再只是一个知识引擎,而是成为能持续理解用户、对结果负责的「健康伙伴」。
跃迁一:更专业,从「医学题库」到「专家级医疗大脑」
今年年初,智诊科技发布了WiseDiag V2。
V2完成的一次关键升级,是让医疗AI从以文本问答为主,进一步具备对医学影像、报告、化验单和体征照片的多模态理解能力。它解决的是医疗AI「看得见、看得懂」的问题,为复杂医疗信息进入统一推理过程建立了底座。
但当模型真正进入家庭健康咨询和复杂病例分析,仅仅「看懂信息」还不够。
一个真实健康问题,往往同时涉及多个科室、既往病史、长期用药和不同时间点的检查结果。模型不仅要识别信息,还必须判断哪些线索更重要、哪些风险应优先排查,以及什么时候应该追问、什么时候必须保持谨慎。
因此,从V2到V3,WiseDiag的升级重点从「多模态认知」,进一步走向「综合医学判断与安全对齐」。
相较于V2,WiseDiag V3的医学继续预训练数据由800亿tokens扩展至1000亿tokens,覆盖科研、疾病、药学、标注问答、临床真实数据、规范、中医及书籍字典八大医学知识层。
按整体数据规模换算,其中包括约27.5万篇论文、36万条优质医疗问答、25,200篇指南共识、2,360本医学书籍,并由50位医学专家参与监督对齐。
更重要的是,WiseDiag V3在后训练体系中加入了OPD多科室专家融合与在线蒸馏机制。
先针对不同专科分别训练专家模型,再将各专科的判断能力汇聚进一个统一的模型。
这让V3具备了从多个专科视角综合分析的能力,模型能够把多个线索放在同一套医学逻辑中分析,减少症状、报告和用药信息彼此割裂的情况。能给出一组经过多角度验证的判断。
与此同时,WiseDiag V3还部署了一套自研的生成式奖励模型GRM。
GRM在模型训练过程中充当「医学评审官」角色——模型训练中每生成一个回答,评审官会从准确性、完整性、安全性、表达清晰度四个维度给它打分,然后用这个分数反过来优化模型本身。这样,就减少了AI胡说八道的可能。
正是这套训练体系的升级,让WiseDiag V3在权威评测中全面领跑,取得多次全球第一。
MedXpertQA文本推理:56.4,全球第一
DoctorBench综合得分:82.5,全球第一
MedBench:全球第一
在真实的用药咨询场景中,这种升级带来的差异极为明显,因为WiseDiag V3看见的,是整个人的健康风险结构。
V2回答了一个问题,V3给出了一套可执行的行动方案,这就是从「医学题库」到「专家级医疗大脑」的跨越。
下面就是一个真实的用户案例。
一位28岁的年轻女性,脸上反复长痘、月经不规律、体重半年涨了15斤。
期间,她曾分三次向某AI求助,系统依次给了三个独立判断:皮肤问题推荐药膏,月经紊乱建议调作息,发胖归因代谢变慢。对于这三个症状,AI给出了三个答案,却从未把它们联系到一起。
直到做孕前检查,她才确诊了多囊卵巢综合征。看似各不相干的「长痘、发胖、月经乱」,其实是同一个病在皮肤、代谢、生殖系统的同步投影。
因为错失了早期干预窗口,患者的排卵功能已经受到明显影响,医生评估未来可能需要借助辅助生殖才能怀孕。
而WiseDiag V3在面对类似主诉时,会综合内分泌、妇科、皮肤科等多学科知识进行关联推理,主动提示「多囊卵巢综合征的可能性需排查」,并建议完善性激素六项和妇科B超,而不是孤立地给出三个答案。
更专业的医疗AI,就是应该给出综合的医学判断与安全对齐。


