AIがまちがえたとき、もう一つのAIが若手医師を助ける
いまやAIモデルは、X線写真と患者の病歴を見て、文章による根拠つきで診断を提案できる。それが役に立つかどうかは、モデルだけでなく、医師がどう反応するかにもかかっている。とくに提案がまちがっているときだ。論文が引用している以前の研究によれば、経験の浅い医師ほどAIの助けから得るものが大きいが、AIの誤りに惑わされやすいのも彼らだという。
南昌大学と香港科技大学のチームは、集合知から引き出した単純なアイデアを試した。医師に一つではなく、二つの独立したAIの意見を見せるのだ。
三つの群によるランダム化試験
リン・ウー(Lin Wu)、ジャ・シュー(Zhe Xu)、フーチン・ジョウ(Fuqing Zhou)らは、2026年7月から9月にかけて中国の三つの病院でこの試験を行い、中国臨床試験登録センターに登録した。放射線科と、他の診療科(内科、一般外科、救急医学)の両方から、経験3年未満の研修医132人を集め、ランダムに三つのグループに割り当てた。
- グループA:GPT-5.4だけの提案。
- グループB:GPT-5.4とKimi-K2.6。
- グループC:GPT-5.4とGemini-3.6 Flash。
参加者は、どのモデルの提案を見ているのか知らされなかった。ネットワークの不具合や体調不良で9人が脱落し、解析に残ったのは123人だった。
全員が同じ胸部と腹部のX線写真60枚を読んだ。それぞれについて、まず自分だけで診断を下して確定し、次にAIの提案(一つまたは二つ)を見て、最後に最終的な答えを出した。症例は、どのモデルもちょうど60例中39例(65%)で正解するように意図的に選ばれていた。共通のモデルであるGPT-5.4は21例でまちがえた。比較のために、経験1〜5年の放射線科医5人がAIなしで読むと、正答率は54.3%だった。
まちがったAIが引き起こすこと
全員を合わせると、AIの助けによって正答率は46.3%から61.5%に上がった。興味深いのは、GPT-5.4がまちがえた21枚のX線写真で何が起きたかだ。
- AIが一つだった放射線科の研修医は、それらの症例で最終的に**20.0%**の正答率だった。AIなしでは、同じグループは31.4%だった。まちがった提案が彼らを引きずり下ろしたのだ。
- AIが二つあると、放射線科の研修医は**40.1%と40.4%**に達した。
- 他の診療科の研修医も同じパターンを示し、AIが一つのときの**12.1%から、二つのときには約31%**になった。
60例全体では、放射線科の研修医はAIが一つで9.6ポイント、二つで16.3ポイントと17.5ポイント改善した。約7ポイント多い。読影にかかった時間と自信の程度は、グループ間で差がなかった。
ただではない
二つめの意見には代償がある。放射線科以外の研修医では、GPT-5.4が正しかったとき、二つめのモデルを加えると正答率が87.4%から約75%に下がった。異なる意見のAIが、正しい答えを捨てるよう彼らを説き伏せてしまうことがあったのだ。全体として、彼らの改善の度合いはAIが一つでも二つでも変わらなかった。そして両方のモデルがまちがえたとき、探索的な解析では二つめのモデルによる有意な利点は見られなかった。
著者らは、二つの提案はまちがったAIの影響を抑える「可能性がある」と結論づけているが、全体として得をしたのは放射線科の研修医だけだった。
心にとめておきたい限界
- 60の症例は、どのモデルも同じ正答率になるように選ばれたもので、日常の診療を反映しているわけではない。
- 効果は二つのモデルの意見が食い違う頻度に左右される可能性があり、その頻度はモデルの組み合わせによって異なる。
- 正式なサンプルサイズの計算は行われていない。参加者の数は、実際に集められる人数をもとに決められた。
- ランダムな割り付けそのものは、別の言語モデルであるDeepSeekにバランスのとれたリストをつくらせ、それをそのまま使って行われた。
著者らによれば、次は選別していない患者と視線追跡を使った研究で、医師が意見の食い違う二つの機械を実際にどう比べて判断しているのかを調べるという。
