当AI出错时,第二个AI能帮到年轻医生
如今,AI模型可以查看一张X光片和患者病史,并给出带有书面理由的诊断建议。这是否有帮助,不仅取决于模型,还取决于医生的反应——尤其是当建议错误的时候。论文引用的早期研究发现,经验较少的医生从AI辅助中获益最多,但也最容易被它的错误带偏。
南昌大学和香港科技大学的一个团队检验了一个源自群体智慧的简单想法:给医生展示两个独立的AI意见,而不是一个。
一项三组随机试验
Lin Wu、Zhe Xu、Fuqing Zhou及其同事于2026年7月至9月在中国的三家医院开展了这项试验,并在中国临床试验注册中心进行了注册。他们招募了132名工作经验不足三年的住院医师,既有放射科的,也有其他专科的(内科、普通外科、急诊科),并将他们随机分为三组:
- A组:仅有GPT-5.4的建议;
- B组:GPT-5.4加Kimi-K2.6;
- C组:GPT-5.4加Gemini-3.6 Flash。
参与者并不知道自己看到的是哪些模型。有九名住院医师因网络故障或身体不适退出,最终纳入分析的有123名。
所有人阅读的都是同样的60张胸部和腹部X光片。对于每一张,他们先独立给出诊断并锁定,然后查看一个或两个AI建议,再给出最终答案。这些病例经过刻意挑选,使得每个模型恰好在60例中的39例(65%)上判断正确——而共同使用的模型GPT-5.4在21例上判断错误。作为对比,五位有一至五年经验的放射科医生在没有AI的情况下得分为54.3%。
一个出错的AI会造成什么影响
就全体参与者而言,有了AI辅助,准确率从46.3%提高到61.5%。有意思的是在GPT-5.4判断错误的那21张X光片上发生了什么:
- 只有一个AI辅助的放射科住院医师在这些病例上的最终准确率为20.0%。没有AI时,同一组的得分是31.4%:错误的建议把他们拉了下来。
- 有两个AI辅助时,放射科住院医师达到了40.1%和40.4%。
- 其他专科的住院医师也呈现同样的规律,从一个AI时的12.1%提高到两个AI时的约31%。
在全部60个病例上,放射科住院医师在一个AI辅助下提高了9.6个百分点,在两个AI辅助下分别提高了16.3和17.5个百分点——多出约7个百分点。各组之间的阅片时间和信心没有差异。
天下没有免费的午餐
第二种意见也有代价。对于放射科以外的住院医师,当GPT-5.4判断正确时,加入第二个模型反而让准确率从87.4%降到约75%:一个持不同意见的AI可能会把他们从正确答案上劝走。总体而言,他们在一个AI和两个AI辅助下的提升没有差异。而当两个模型都出错时,一项探索性分析发现第二个模型没有带来显著益处。
作者的结论是,两条建议“可能”会限制错误AI的影响,但总体上只有放射科住院医师从中获益。
需要注意的局限
- 这60个病例是为了让每个模型的准确率相同而挑选的,因此并不反映日常临床实践。
- 效果可能取决于两个模型意见不一致的频率,而这一频率因模型组合而异。
- 研究没有进行正式的样本量计算;参与者人数基于可行的招募规模。
- 随机分组本身是通过让另一个语言模型DeepSeek生成一份均衡名单完成的,名单未经修改即被使用。
作者表示,下一步将开展纳入未经筛选患者并结合眼动追踪的研究,以了解医生在面对两台意见相左的机器时实际上如何权衡。
