AIのうつ病スコアはAI次第
うつ病には診断のための血液検査がない。大規模言語モデルは、臨床での会話から、疲れ知らずで安く、何度でも同じように評価できると期待されており、初期の評価結果も心強いものだった。精神医学は以前にも似た問題に直面している。1971年のある研究で、米国と英国の精神科医が同じ録画面接を見たあとで意見を食い違わせることがわかった。精神医学はこれに、明確な診断基準と構造化面接で応えた。
だが、言語モデルが「評価者」になるまでには、いくつもの選択が積み重なる。誰かがモデルを選び、依頼の文面を決める。質問票の形にするのか、精神科医の口調にするのか、患者が自分について答える形にするのか。回答に数字を使うか文字を使うかを選び、モデルに患者の発言だけを読ませるか会話全体を読ませるかを決め、出力をスコアに変換する。評価研究がこうした別の選択肢を示すことはめったにない。
一つの評価者をつくる880通りの方法
ニューヨークのマウントサイナイ・アイカーン医科大学のバイハン・リン(Baihan Lin)は、11の公開モデル(パラメータ数10億〜210億)を、5種類の文面、会話の2通りの見せ方、回答の2通りの読み取り方、スコアの4通りの組み立て方と掛け合わせた。こうして880の評価者ができ、それぞれを、アニメーションの仮想面接官が行った189件の録画面接に適用した。参加者は各面接の前に、PHQ-8に答えていた。これは8項目のうつ病質問票で、0〜24点で採点され、10点以上が通常のスクリーニングの基準値だ。参加者の約30%がこれを超えていた。
この研究は事前登録されていた。解析コードは、質問票との比較を一度もしないうちに固定された。固定された手順はその後、完全に自律した仮想面接官が行い、文字起こしも自動の新しい86件の面接に一度だけ適用された。処理はすべて手元のワークステーション内で行われた。
患者より評価者のほうが効く
- 一つの面接に正反対の判定。 軽い症状の参加者(PHQ-8が5点で基準値未満)が、880の評価者の半数からスクリーニング陽性とされた。全員一致の判定を受けた参加者は一人もいなかった。
- 正確な評価者どうしでも意見が割れる。 識別力が良好な540の評価者(AUCが0.70以上)の中から2つを無作為に選ぶと、参加者の**40%**についてスクリーニングの判定が食い違った。
- 人よりモデルのほうが効く。 スコアのばらつきのうち30.0%はモデルの選択で説明でき、参加者間の安定した違いで説明できたのは10.5%、つまり2.8分の1だった。
ゼロ点のずれた体重計
ふつう測られる「正確さ」は、評価者が人をどれだけうまく順位づけできるかを示す。何人を陽性とするかは示さない。評価者が陽性とした割合は**0%から100%**までばらばらで、実際は30%だった。その割合を決めていたのは、各評価者の、平均して高めまたは低めに評価する傾向だった(R² = 0.91)。著者はこれを、ゼロ点がずれた体重計にたとえる。人を順位づけるのはうまいかもしれないが、そのずれが、誰が線を越えるかを決めてしまう。正確さがほぼ同じ二つのモデル、Qwen2.5 7BとMistral 7Bは、100人中それぞれ24人と80人を陽性とすることになる。
ちょっとした技術的な違いが、その線を動かした。回答の文字を逆にする、つまり「A」を「まったくない」ではなく「ほとんど毎日」の意味にするという、臨床的には何の意味もない変更で、陽性とされる割合が中央値で21ポイント、最大で85ポイント動いた。同じモデルを圧縮ファイルとして別のソフトウェアで動かすと、判定の中央値21%が変わった。
評価はうつ病以外のものも拾っていた。心的外傷後ストレスの症状にも、うつ病と同じくらい密接に連動していた。よくしゃべる参加者ほど陽性とされやすく、評価者の16%は、質問票で示された女性と男性のあいだの小さな差の向きを逆にしていた。
調整は役立つが、限界もある
これほどずれが効くなら、と著者は修正を試みた。地元でラベル付けされた40人の参加者を使って、各評価者の基準値を設定し直したのだ。正確さは約60%から75%に上がり、意見の食い違いは40%から20%へと半分になった。だが、すべての評価者に同じ人数を選ばせても、選ばれる人は約5回に1回の割合で違っていた。
新しい86件の面接では、検証可能だった事前登録の予測6つのうち5つが成り立った。著者は明確な限界を挙げている。データをワークステーションの外に出せなかったため、使ったのは210億パラメータまでの公開モデルだけであること。基準が診断ではなく自己申告の質問票であること。同じ文字起こしを評価した臨床医がいないこと。面接は英語で、一つの研究室のものだけであること。
スコアを信じる前の五つの確認
論文は実践的な助言で締めくくられる。一つの数字ではなく、妥当な設定の範囲で判定がどれだけ変わるかを報告すること。中立的な設定を前もって決めておくこと。地元で調整し、残る食い違いを測ること。評価者がほかに何を拾っているかを検証すること。そして、モデル、ソフトウェア、文字起こし、文面のどれを変えても、それを新しい測定器として扱うこと。著者の言葉を借りれば、尋ね方を変えると誰が見つかるかが変わるなら、測定器そのものが説明の一部になる。
