医学与健康预印本数据分析阅读 1 分钟

AI给出的抑郁评分取决于AI本身

抑郁症没有可用于诊断的血液检测。大语言模型有望根据临床对话给出不知疲倦、成本低廉且可重复的评分,早期评估结果也令人鼓舞。精神病学以前就遇到过类似的问题:1971年的一项研究发现,美国和英国的精神科医生在观看同样的访谈录像后意见不一,该领域随后用明确的诊断标准和结构化访谈作出了回应。

但语言模型要成为一个“评分器”,必须经过一系列选择。有人要挑选模型,要给请求措辞——是以问卷形式、以精神科医生的口吻,还是让模型扮演患者回答关于自己的问题——要决定答案用数字还是字母,要决定模型只读患者的话还是读整段对话,还要把模型的输出转换成分数。评估中很少展示这些不同的选择。

构建一个评分器的880种方式

纽约西奈山伊坎医学院的Baihan Lin将11个开源模型(参数量从10亿到210亿)与五种措辞、两种对话视角、两种读取答案的方式和四种构建分数的方式交叉组合。这样共得到880个评分器,每一个都被应用于同样的189段访谈录音,这些访谈由一个动画虚拟访谈者主持。每次访谈前,参与者都填写了PHQ-8,这是一份包含八个条目的抑郁问卷,得分范围为0至24分;10分及以上是常用的筛查阈值。约30%的参与者超过了这一阈值。

这项研究进行了预注册:分析代码在与问卷进行任何比较之前就已冻结。随后,这套锁定的流程在86段新访谈上运行了一次,这些访谈由一个完全自主的虚拟访谈者主持,并使用自动转录文本。所有处理都在一台本地工作站上完成。

评分器的影响盖过了患者

  • 同一场访谈,截然相反的结论。 一位症状轻微的参与者(PHQ-8得分为5,低于阈值)被880个评分器中的一半判定为筛查阳性。没有任何一位参与者得到一致的结论。
  • 准确的评分器之间仍有分歧。 在540个区分能力良好(AUC达到0.70或以上)的评分器中,随机抽取两个,它们对**40%**的参与者的筛查决定不一致。
  • 模型比人更重要。 模型的选择解释了评分变异的30.0%;参与者之间的稳定差异只解释了10.5%——少了2.8倍。

零点没校准的秤

通常所说的准确率,衡量的是评分器给人排序的能力。它并不说明评分器会筛出多少人。各评分器筛出的参与者比例从**0%到100%**不等,而实际比例是30%。决定这一比例的,是每个评分器整体上倾向于高估还是低估(R² = 0.91)。作者将其比作一台零点没校准的浴室秤:它也许能把人排好顺序,但它的偏移量决定了谁会越过那条线。两个准确率几乎相同的模型,Qwen2.5 7B和Mistral 7B,每100人中分别会筛出24人和80人。

一些细小的技术细节就能挪动这条线。把答案字母的顺序倒过来——让“A”表示“几乎每天”而不是“完全没有”,这在临床上毫无意义——被筛出的比例中位数变化了21个百分点,最多达85个百分点。把同一个模型以压缩文件形式在不同软件中运行,中位数有21%的决定发生了改变。

这些评分捕捉到的也不仅仅是抑郁。它们与创伤后应激症状的吻合程度和与抑郁的吻合程度一样高;话多的参与者更常被筛出;还有16%的评分器把问卷所报告的女性与男性之间那一点小差异的方向弄反了。

校准有帮助,但有限度

既然偏移量的影响如此之大,作者尝试了一种修补方法:用40名本地已标注的参与者重新设定每个评分器的阈值。准确率从约60%提高到75%,分歧减半,从40%降到20%。但即使强制每个评分器筛出相同数量的人,它们仍有大约五分之一的时候挑中的是不同的人。

在86段新访谈中,六项可检验的预注册预测里有五项得到了证实。作者列出了明确的局限:只使用了参数量不超过210亿的开源模型,因为数据不能离开工作站;以自评问卷而非诊断作为标准;没有临床医生对同样的转录文本评分;访谈均为英语,且来自单一实验室。

相信一个分数之前的五项检查

论文最后给出了实用建议:报告在各种合理配置下得出的决定的范围,而不是单一数字;事先确定一个中性配置;在本地进行校准并测量剩余的分歧;检验评分器还捕捉到了什么别的东西;把模型、软件、转录或措辞的任何改变都视为一件新的工具。正如作者所说,当提问方式的改变会改变我们识别出的人时,工具本身就成了解释的一部分。

Legal notice