رایانش و هوش مصنوعیپیش‌چاپآزمایش۵ دقیقه مطالعه

یک جمله رانندگان هوش مصنوعی را در ترافیک گیر می‌اندازد

عامل‌های هوش مصنوعی که بر چند مدل مشترک ساخته شده‌اند، روزبه‌روز بیشتر از جانب انسان‌های زیادی عمل می‌کنند. تاکاهیرو ازاکی، ناوتو ایمورا و کاتسوهیرو نیشیناری از دانشگاه توکیو می‌خواستند بدانند وقتی بسیاری از این عامل‌ها یک پیام یکسان دریافت می‌کنند چه رخ می‌دهد — به‌ویژه پیش‌بینی‌ای دربارهٔ اینکه دیگران چه خواهند کرد. چنین پیش‌بینی‌ای همین که پخش شود، وضعیتی را که توصیف می‌کند تغییر می‌دهد و می‌تواند پیش‌بینی خودش را باطل کند.

برای آزمودن آن، یکی از ساده‌ترین موقعیت‌هایی را برگزیدند که در آن مردم بر سر منبعی محدود رقابت می‌کنند: رفت‌وآمد روزانه.

دو جاده، یک قاعده

دو جادهٔ یکسان یک حومه را به یک منطقهٔ تجاری وصل می‌کنند. هر صبح همهٔ مسافران هم‌زمان انتخاب می‌کنند. جاده‌ای که سهم n/N از آن‌ها از آن استفاده کنند 20 + 80 n/N دقیقه طول می‌کشد: اگر ترافیک به‌طور مساوی تقسیم شود یک ساعت، و اگر تقریباً همه به یک جاده هجوم ببرند نزدیک به 100 دقیقه. در تقسیم مساوی، هیچ‌کس نمی‌تواند با تغییر مسیرِ تنها سودی ببرد.

در آزمایش اصلی، هر یک از 50 عامل یک فراخوانی جداگانه از همان مدل، GPT-5.4-mini، است که بدون استدلال گسترده اجرا شده. هر عامل قواعد، جاده و زمان‌های سفر خودش در پنج روز گذشته و یک گزارش روزانه را می‌بیند. هر پرامپت همچنین از عامل می‌خواهد فکر کند که رانندگان دیگر ممکن است به همان اطلاعات چه واکنشی نشان دهند. گزارش در چهار نسخه ارائه می‌شود:

  • بدون هیچ گزارشی؛
  • اعداد: زمان سفر دیروز در هر جاده؛
  • یک توصیه: «مسیر B در حال حاضر خلوت‌تر است»؛
  • توصیه به‌علاوهٔ هشدار: همان توصیه، به دنبالش «اما انتظار می‌رود بسیاری از رانندگان همین اطلاعات را ببینند و به مسیر B بروند، پس مسیر B ممکن است شلوغ شود.»

بازی دو جاده، چهار گزارش، و سهم عامل‌هایی که در طول 60 دور برای هر گزارش جادهٔ خلوت‌تر را برگزیدند.

بازی و چهار گزارش (بالا)؛ پایین، برای هر گزارش، سهم عامل‌هایی که در طول 60 دور جادهٔ خلوت‌ترِ دیروز را برگزیدند، همراه با میانهٔ زمان سفر. با هشدار، این سهم نزدیک صفر می‌ماند، حتی وقتی بازی تا دور 100 ادامه می‌یابد. — شکل 1، Ezaki، Imura و Nishinari (2026)، arXiv:2609.30883.

هشداری که خودش را باطل می‌کند

بدون هیچ گزارشی، عامل‌ها گله‌وار حرکت کردند: تقریباً همه هر صبح مسیر عوض می‌کردند و جمعیت فقط از یک جاده به جادهٔ دیگر نوسان می‌کرد، با میانگین 96 دقیقه. اعداد این را به 71 دقیقه رساندند؛ توصیهٔ خالی بهترین نتیجه را داد: 64 دقیقه، نزدیک به ایده‌آل 60 دقیقه‌ای.

افزودن جملهٔ هشدار همه‌چیز را تغییر داد. حدود 96٪ عامل‌ها در یک جاده — همان که تازه شلوغ بود — مستقر شدند و همان‌جا ماندند. میانگین زمان سفر به 95 دقیقه رسید، 30 دقیقه بیشتر از حالت توصیهٔ تنها، در هر ده اجرای جفت‌شده. در تقسیم 47 به 3، عاملی که در جادهٔ شلوغ است به 95.2 دقیقه نیاز دارد؛ تغییر مسیرِ تنها آن را به 26.4 دقیقه کاهش می‌داد. عامل‌ها به‌ندرت چنین کردند. وقتی ده اجرا تا 100 دور ادامه یافت، هیچ‌کدام رها نشد.

توضیح‌های یک‌خطی خود عامل‌ها این الگو را نشان می‌دهد. در یک اجرا، 89٪ آن‌ها به تغییر مسیر یا ازدحام رانندگان دیگر اشاره کردند. نمونه‌ای معمول: «A برای من مدام خیلی کند بوده، اما گزارش هشدار می‌دهد که B تغییرمسیردهندگان زیادی را جذب خواهد کرد، پس A گزینهٔ مطمئن‌تری است.» نویسندگان تأکید می‌کنند که این جمله‌ها متن تولیدشده را توصیف می‌کنند، نه محاسبات درونی مدل را.

این راه‌بندان دائمی نبود. جایگزین کردن هشدار با اعداد ساده در دور 31، 96 تا 100٪ عامل‌ها را به سوی جادهٔ تقریباً خالی روانه کرد — که برای مدتی کوتاه همان را بند آوردند — و سپس هزینه‌ها دوباره به حدود 67 تا 74 دقیقه برگشت. هشدار دادن فقط به برخی عامل‌ها هم کمک کرد: وقتی 5 عامل از 20 هشدار گرفتند و به بقیه اعداد داده شد، سفرها به‌طور میانگین 65 دقیقه طول کشید، بهتر از اعداد به‌تنهایی.

مدل‌های دیگر، حدود دیگر

جهت این اثر به مدل‌های دیگر هم منتقل شد، اما نه با تمام شدتش. Claude Haiku 4.5 و Gemini 3.5 Flash نیز با هشدار به سمت پرهیز از جادهٔ توصیه‌شده رفتند و حدود 3 و 5 دقیقه افزودند، اما هیچ‌یک از اجراهایشان کاملاً منجمد نشد. GPT-5.4-mini با استدلال فعال هم همچنان به پرهیز گرایش داشت، بی‌آنکه منجمد شود. مدلی جدیدتر، GPT-6 Luna، در تنظیم پیش‌فرض استدلالش، حتی با توصیهٔ خالی هم منجمد شد. اینکه یک جمعیت قفل شود یا نه، به مدل و نحوهٔ اجرای آن بستگی دارد.

آدم‌ها پخش می‌شوند — و جادهٔ آزاد را می‌گیرند

گروه این بازی را با 240 نفر که به‌صورت آنلاین جذب شده بودند نیز اجرا کرد، در اتاق‌های 20 نفره، با اعداد یا با هشدار. هر دوازده اتاق نزدیک به توازن ماندند، در حدود 62 دقیقه، نزدیک به نتیجه‌ای که شیر یا خط تصادفی می‌داد. افراد با هم فرق داشتند: برخی پیوسته از توصیه پیروی می‌کردند، برخی پیوسته از آن پرهیز می‌کردند. نویسندگان هشدار می‌دهند که این مقایسه فقط جنبهٔ زمینه‌ای دارد: پژوهش‌های انسانی و هوش مصنوعی در زمان‌های متفاوت و با مشوق‌های متفاوت انجام شدند، و از آدم‌ها خواسته نشده بود رفتار دیگران را پیش‌بینی کنند.

سپس نوبت اتاق‌های مختلط رسید: 24 اتاق 20 صندلی‌ای، با 5، 10 یا 15 عامل هوش مصنوعی، همه با هشدار، که با 240 نفر دیگر پر شدند. عامل‌ها همچنان از جادهٔ توصیه‌شده پرهیز کردند. آدم‌ها آن را گرفتند: به‌طور میانگین 65٪، 83٪ و 91٪ مواقع — و در اتاق‌های دارای 10 یا 15 عامل، هرچه جلسه پیش‌تر رفت بیشتر. در پایان، در هر هشت بلوک مقایسه، گروه‌هایی که عامل بیشتری داشتند نامتوازن‌تر بودند.

دو نمودار: سهم صندلی‌های انسانی و هوش مصنوعی در جادهٔ توصیه‌شده، و میانگین زمان سفر هرکدام، بر حسب تعداد عامل‌های هوش مصنوعی در میان 20 بازیکن.

چپ: آدم‌ها بیش از پیش جاده‌ای را می‌گیرند که عامل‌ها از آن پرهیز می‌کنند. راست: با 15 عامل، صندلی‌های انسانی به‌طور میانگین 44 دقیقه و صندلی‌های هوش مصنوعی 80 دقیقه، در برابر 60 دقیقه در تقسیم برابر. — شکل 5 (B، C)، Ezaki، Imura و Nishinari (2026)، arXiv:2609.30883.

هزینهٔ راه‌بندان را چه کسی می‌پردازد

اتاق‌های مختلط در مجموع بهتر از اتاق‌هایی بودند که فقط عامل داشتند — 71 دقیقه با 15 عامل، در برابر حدود 96. اما این میانگین نابرابری‌ای را پنهان می‌کرد. با 15 عامل، صندلی‌های انسانی به‌طور میانگین 43.5 دقیقه بودند، بسیار کمتر از یک ساعتِ تقسیم منصفانه، در حالی که صندلی‌های عامل به‌طور میانگین 80.2 دقیقه بودند. از 240 شرکت‌کننده، 129 نفر نتیجه‌ای بهتر از 60 دقیقه گرفتند؛ هیچ عاملی نگرفت. وقتی بعداً از شرکت‌کنندگان پرسیده شد، حدس زدند 63 تا 69٪ اتاقشان هوش مصنوعی بوده، چه سهم واقعی 25٪ بود، چه 50٪ و چه 75٪.

نویسندگان سه درس برای هر کسی که عامل‌هایی با منبع مشترک را ارزیابی می‌کند بیرون می‌کشند: کل جمعیت‌ها را بیازمایید، نه یک عامل را در هر بار؛ هر پیام را یک مداخله در نظر بگیرید؛ و هزینه‌ها را بر حسب نوع شرکت‌کننده گزارش کنید، نه فقط میانگین گروه. محدودیت‌هایشان را هم صریح بیان می‌کنند: یک بازی دو جاده‌ای، پرامپت‌هایی که به پیش‌بینی دیگران دعوت می‌کنند، و اتاق‌های مختلطی که ترکیبشان به ترتیب جذب شرکت‌کنندگان گره خورده بود. اگر عامل‌های مردم در نهایت بار هزینه‌ها را به دوش بکشند، سپردن کارها به آن‌ها ممکن است همان جادهٔ کند از آب درآید.

Legal notice