全球首次AI医生“大考”成绩出炉了!
这次“应考”的“AI医生”是GPT-4o、Claude 3.5、千问、DeepSeek-R1、OpenAI o1五款顶级大模型。考官是北京友谊医院联合国内外多家机构,考题来自心内科、眼科、神经内科、肿瘤科等7个科室的真实病例。判卷的,是400多位不同年资、不同地区的执业医生,还有一批评委就是AI自己。
结果出人意料。AI评委自己选出的“第一名”是OpenAI o1,而人类医生则更青睐DeepSeek-R1和GPT-4o。为什么?因为AI只认“标准答案”,但真实的医学案例,往往是一道“多选题”甚至“开放题”。同样的胸痛,心内科、呼吸科、急诊科的判断可能完全不同,没有绝对的对错。
最终得出的结论是:AI眼下还无法取代人类医生,但可以辅助医生提高效率。高年资医生更认可DeepSeek-R1和GPT-4o,年轻医生则更认可千问。但哪款大模型更适合临床辅助诊疗,尚无定论。不同科室、不同医生的需求,AI一个都满足不了。
日常健康咨询、慢病管理,AI确实能帮忙。但确诊开药、重大决策,还得找正规医院的医生。善用AI,不迷信AI——这可能是我们这代人必备的健康素养。
评论区聊聊:你会让AI帮你看病吗?




