計算機科学・AIプレプリント実験1分で読めます

AIの要約はあなたの記憶を書き換える

生成AIは、重大な結果を伴う仕事にも広がりつつある。警察はいまや、ボディカメラの映像や音声から報告書を自動で作成できる。採用や医療の現場にもAIが入り込んでいる。そしてAIは間違える。報告されたある事例では、AIが作成した警察の報告書に、警官がカエルに変身したと書かれていた。背景で流れていた『プリンセスと魔法のキス』(The Princess and the Frog)の音声を拾ってしまったのだ。

よくある安全策は、人間が出力をチェックすることだ。しかし人間の記憶もまた誤りやすい。

50年前から知られる効果

1978年、心理学者のエリザベス・ロフタス(Elizabeth Loftus)は、出来事のあとに受け取った情報が、その出来事の記憶を変えうることを示した。これが誤情報効果(misinformation effect)である。彼女の古典的な実験では、参加者は一時停止標識か「譲れ」の標識がある交差点での自動車事故を見たあと、誤った標識が書かれた文章を読んだ。すると多くの人が標識を誤って記憶した。動詞をたった1つ(「ぶつかった」ではなく「激突した」に)変えるだけでも、人々が思い出す車の速度が変わることがある。

ジョージタウン大学とワシントン大学のマッテア・シム(Mattea Sim)、ヤエル・アイガー(Yael Eiger)、コウノ・タダヨシ(Tadayoshi Kohno)は、AIの要約にも同じことが起こりうるのかを問うた。

ステップ1:AIの要約はどれほど正確か

研究チームは、ロフタスの研究を現代に再現した実験から、25秒のアニメーション動画を2本使った。赤い車が一時停止標識か「譲れ」の標識のある交差点に差しかかり、右折し、歩行者をはねる。歩行者は倒れて起き上がり、運転手が車から降りてくる。チームはChatGPT-5.5とGemini 2.5 Flash-Liteに、「重要なことをすべて」含んだ、事実に即した中立的な300語以上の要約を求めた。要約は合わせて20件である。

  • 要約はすべて誤りを含んでいた。約305語の中に、1件あたり7〜21個の誤りがあった。
  • 平均して、中心となる細部の51.6%が欠けていた。
  • 20件中19件の要約で、衝突そのものが抜け落ちていた。最も重要な出来事であるにもかかわらずだ。
  • 60%の要約には、存在しない歩行者や車両など、実際にはなかった細部が付け加えられていた。ある要約は、「ほかの登場人物や車両が場面に直接関わることはなかった」とまで述べていた。
  • 誤りは試行のたびに変わった。ある要約では車は右折し、別の要約では左折していた。

ステップ2:人々の記憶は変わるのか

米国の参加者328人が、どちらかの動画を見た。1〜2日後、参加者はChatGPTが書いた21文の要約を読んだ。要約には正しい交通標識か、誤った標識のどちらかが書かれていた。一部の参加者にはAIが書いたと伝え、ほかの参加者にはプロの人間の書き起こし担当者が書いたと伝えた。文章はまったく同じだった。その後、記憶テストが行われた。

  • 正しい要約を読んだ場合、正しい標識を覚えていたのは**83.6%**だった。
  • 誤解を招く要約では、わずか**44.8%**だった。
  • 要約がAIによるものだと思っていたか(正答46.3%)、人間によるものだと思っていたか(43.4%)で違いはなかった。
  • AIへの信頼度も、AIの利用頻度も、有意な違いを生まなかった。

一貫した要約と誤解を招く要約、AIと人間のラベル別に見た想起の正確さのグラフ。

正しい交通標識を思い出した参加者の割合。正しい要約のあとでは約80%、誤解を招く要約のあとでは50%未満だった。AIと表示されていても人間と表示されていても同じである。— 図1、Sim, Eiger & Kohno (2026), arXiv:2609.28820.

参加者は動画そのものはちゃんと覚えていた。要約には書かれていなかった「事故は昼間に起きた」という細部を、96.6%が正しく思い出した。興味深いことに、「人間」の要約のほうが、一字一句同じだったにもかかわらず、わかりやすいと評価された。

ループに人間を入れるだけでは足りない

著者らは、AIを正すはずの人物が、逆にAIの誤りによって記憶を書き換えられることがありうると結論づけている。しかも、誰にも悪意がないままにだ。目撃者の記憶が長く懸念されてきた警察活動のような場では、そもそもAIを使うべきかどうかに著者らは疑問を呈している。この研究の短縮版は、AI・倫理・社会に関するAAAI/ACM会議の論文集(2026年10月)に掲載されている。

限界

使われたのは単純なアニメーション動画2本、プロンプト1つ、要約20件であり、オンラインで検証された誤解を招く細部は1種類だけだった。参加者に見せた要約は、何回かの試行の中から選ばれ、正確さのために軽く手直しされていた。

Legal notice