LOS RESÚMENES DE LA IA PUEDEN REESCRIBIR TU MEMORIA
La IA generativa se está extendiendo a trabajos donde hay mucho en juego: los departamentos de policía ya pueden generar informes automáticamente a partir de grabaciones de cámaras corporales o de audio; la IA también aparece en la contratación y en la sanidad. Y se equivoca. En un caso conocido, un informe policial generado por IA afirmaba que un agente se había convertido en rana: había captado la banda sonora de Tiana y el sapo, que sonaba de fondo.
La salvaguarda habitual es un humano que revisa el resultado. Pero la memoria humana también falla.
Un efecto de hace 50 años
En 1978, la psicóloga Elizabeth Loftus demostró que la información recibida después de un suceso puede cambiar cómo lo recordamos: es el efecto de desinformación (misinformation effect). En su experimento clásico, los participantes veían un accidente de coche en un cruce con una señal de stop o de ceda el paso, y luego leían un texto que mencionaba la señal equivocada; muchos la recordaban mal. Incluso un solo verbo («se estrelló» en lugar de «chocó») puede cambiar la velocidad a la que la gente recuerda que iban los coches.
Mattea Sim, Yael Eiger y Tadayoshi Kohno, de la Universidad de Georgetown y la Universidad de Washington, se preguntaron si los resúmenes de IA podían hacer lo mismo.
Paso 1: ¿qué tan exactos son los resúmenes de IA?
Tomaron dos vídeos animados de 25 segundos de una réplica moderna del estudio de Loftus: un coche rojo llega a un cruce con una señal de stop o de ceda el paso, gira a la derecha, atropella a un peatón que cae y se levanta, y el conductor se baja. Pidieron a ChatGPT-5.5 y a Gemini 2.5 Flash-Lite resúmenes factuales y neutrales de al menos 300 palabras que incluyeran «todo lo importante»: 20 resúmenes en total.
- Todos los resúmenes contenían errores: de 7 a 21 cada uno, en unas 305 palabras.
- De media, faltaba el 51,6 % de los detalles centrales.
- 19 de los 20 resúmenes omitieron el propio choque, el suceso más importante de todos.
- El 60 % añadió detalles que no existían, como peatones o vehículos inventados. Un resumen llegó a afirmar que «ningún otro personaje o vehículo interactuó directamente con la escena».
- Los errores cambiaban de un intento a otro: el coche giraba a la derecha en un resumen y a la izquierda en otro.
Paso 2: ¿cambia lo que la gente recuerda?
328 participantes en Estados Unidos vieron uno de los vídeos. Entre uno y dos días después, leyeron un resumen de 21 frases escrito por ChatGPT. Mencionaba la señal de tráfico correcta o la equivocada. A unos se les dijo que lo había escrito una IA; a otros, un transcriptor humano profesional: el texto era idéntico. Luego vino una prueba de memoria.
- Con un resumen correcto, el 83,6 % recordó la señal correcta.
- Con uno engañoso, solo el 44,8 %.
- No hubo diferencia entre quienes creían que el resumen venía de una IA (46,3 % de aciertos) o de un humano (43,4 %).
- Ni la confianza en la IA ni la frecuencia con que la usaban marcaron una diferencia significativa.

Proporción de participantes que recordaron la señal de tráfico correcta: alrededor del 80 % tras un resumen correcto, menos del 50 % tras uno engañoso, tanto si estaba etiquetado como de IA como de humano. — Figura 1, Sim, Eiger y Kohno (2026), arXiv:2609.28820.
Los participantes sí recordaban el vídeo en sí: el 96,6 % recordó correctamente que el accidente ocurrió de día, un detalle ausente del resumen. Curiosamente, el resumen «humano» se valoró como más claro, aunque era idéntico palabra por palabra.
Un humano en el circuito no basta
Los autores concluyen que la persona que debe corregir a la IA puede, en cambio, ver su memoria alterada por los errores de esta, sin intención maliciosa por parte de nadie. En ámbitos como el policial, donde la memoria de los testigos preocupa desde hace tiempo, se preguntan si la IA debería usarse siquiera. Una versión abreviada de este trabajo se publica en las actas de la Conferencia AAAI/ACM sobre IA, Ética y Sociedad (octubre de 2026).
Limitaciones
Dos vídeos animados sencillos, una sola instrucción (prompt) y 20 resúmenes; un único tipo de detalle engañoso, probado en línea. El resumen mostrado a los participantes se seleccionó entre varios intentos y se retocó ligeramente para que fuera exacto.
