رایانش و هوش مصنوعیپیش‌چاپتحلیل داده۵ دقیقه مطالعه

مقاله‌های عصر هوش مصنوعی هفت برابر بیشتر می‌گویند «rather than»

مدل‌های زبانی بزرگ اکنون در نوشتن بخش قابل‌توجهی از مقاله‌های علمی کمک می‌کنند و ردپایی برجا می‌گذارند: واژه‌های محبوب، لحنی خاص. یک عادت آزردن پژوهشگران پردازش زبان طبیعی (NLP) را آغاز کرده است: جمله‌هایی که بر پایهٔ «X rather than Y» («X به جای Y») ساخته می‌شوند و ادعایی را تا حدی با آنچه نیست تعریف می‌کنند. به گفتهٔ مقاله، داوران تازه‌ترین دور مقاله‌های ارسالی به همایش‌های NLP از آن شکایت کردند، و برگزارکنندگان همایش‌ها اکنون دربارهٔ نوشته‌های «آکنده از کلیشه‌های هوش مصنوعی» بحث می‌کنند.

اولگا زامارایوا، آدریان گوده، روی سانتوس‌ریوس و کارلوس گومس‌رودریگس، در دانشگاه آکورونیا در اسپانیا، به سنجش آن پرداختند — با عنوانی که خودش حرف را می‌زند.

هفت برابر بیشتر

آن‌ها ۴٬۷۴۴ مقاله از نشست‌های ۲۰۱۹ انجمن زبان‌شناسی رایانشی (Association for Computational Linguistics)، پیش از رواج دستیارهای نگارش هوش مصنوعی، را با ۱٬۸۲۱ مقالهٔ NLP که در ۲۰۲۶ با همان قالب همایش در arXiv منتشر شده بودند مقایسه کردند.

نمودار میله‌ای مقایسهٔ شش عبارت تقابلی در هر ۱٬۰۰۰ واژه در مقاله‌های ۲۰۱۹ و ۲۰۲۶؛ «rather than» از ۰٫۱۳۴ به ۰٫۹۹۳ جهش می‌کند.

بسامد در هر ۱٬۰۰۰ واژه در مقاله‌های ۲۰۱۹ (آبی) و ۲۰۲۶ (نارنجی): «rather than» و «X, not Y» اوج می‌گیرند، در حالی که «instead of» و «as opposed to» کاهش می‌یابند. — Figure 1, Zamaraeva et al. (2026), arXiv:2610.10092.

  • «rather than» از ۰٫۱۳۴ به ۰٫۹۹۳ بار در هر ۱٬۰۰۰ واژه رسید، یعنی حدود هفت برابر.
  • عبارت هم‌خانوادهٔ «X, not Y» («X، نه Y») چهار برابر شد؛ در همین حال «instead of» و «as opposed to» («به جای»، «در مقابلِ») کم‌کاربردتر شدند.
  • ۹۴٪ مقاله‌های ۲۰۲۶ «rather than» دارند، در برابر ۳۶٪ در ۲۰۱۹، و به‌طور میانگین حدود هشت بار آن را به کار می‌برند. یک مقالهٔ ۲۰۲۶ آن را ۶۹ بار، تقریباً هر ۱۷۰ واژه یک بار، به کار می‌برد؛ هیچ مقاله‌ای از ۲۰۱۹ از ۱۲ بار فراتر نمی‌رود.

گروه همچنین از مدل‌ها خواست بر اساس عنوان و چکیدهٔ مقاله‌های واقعی، مقاله‌هایی کامل بنویسند. GPT-5.6-sol و GPT-6-sol این عبارت را در همهٔ مقاله‌ها، و بیشتر از نویسندگان ۲۰۲۶، به کار بردند. Claude Haiku 4.5، Sonnet 5.5 و Opus 5.5 از Anthropic نیز آن را تقریباً در همهٔ مقاله‌ها، با نرخ‌هایی اندکی پایین‌تر، به کار بردند. یک مدل باز به نام Tülu 3 8B در هیچ مرحله‌ای از آموزشش آن را جز به‌ندرت به کار نبرد. بازنگری مقاله‌ها این عادت را از میان نبرد: نسخه‌های بعدی همان مقاله‌های ۲۰۲۶ در arXiv کمی بیشتر از آن دارند.

آزارنده، اما کدام‌ها؟

بسامد به‌تنهایی چیزی را ثابت نمی‌کند: این عبارت کاربردهای مشروع فراوانی دارد. از این رو دو تن از نویسندگان که داوران باتجربه‌ای هستند، ۱٬۰۰۰ کاربرد را که به‌صورت کور به آن‌ها نشان داده شد، «آزارنده» یا «مشروع» برچسب زدند.

  • تقریباً هیچ کاربردی از ۲۰۱۹ آن‌ها را نیازرد (۱٫۶٪ برای یکی، ۰٪ برای دیگری).
  • حدود یک کاربرد از هر ده کاربرد ۲۰۲۶ آزارشان داد (۱۱٫۵٪ و ۸٫۳٪).
  • آن‌ها به‌ندرت بر سر این‌که کدام کاربردها آزارنده‌اند توافق داشتند. اما چون یک مقالهٔ ۲۰۲۶ کاربردهای بسیار زیادی دارد، نویسندگان برآورد می‌کنند که حدود نیمی از مقاله‌های ۲۰۲۶ دست‌کم یک کاربرد دارند که هر یک از آن دو را می‌آزارد، و نزدیک به دو سوم کاربردی دارند که دست‌کم یکی از آن دو را می‌آزارد — در برابر حدود ۱٪ در ۲۰۱۹.

آنچه کاربردهای آزارنده را متمایز می‌کند عمدتاً شیوهٔ برخوردشان با گزینهٔ ردشده است. آن‌ها گرایش دارند یک گزینه را بستایند و دیگری را کوچک بشمارند، و افراد دیگر نیز گزینهٔ ردشده را بیشتر یک پهلوان‌پنبه، یعنی موضعی که هیچ پژوهشگر کاردانی از آن دفاع نمی‌کند، ارزیابی کردند. خوانندگان خود این عبارت را نیز نشانهٔ نگارش هوش مصنوعی دانستند، در حالی که نمی‌توانستند بخش‌های نوشته‌شده با GPT را از بخش‌های نوشته‌شده توسط انسان در ۲۰۱۹ تشخیص دهند.

نتایج Claude، که تا کنون تنها یک برچسب‌زن آن‌ها را برچسب زده، دوگانه است. پیش‌نویس‌های نخست Claude بیش از مقاله‌های ۲۰۱۹ آزارنده نبودند و کمتر از پیش‌نویس‌های GPT-6-sol آزار می‌دادند. بازنگری‌هایش به همان اندازهٔ بازنگری‌های GPT-6-sol آزارنده بودند، حدود دو برابر پیش‌نویس‌های نخست خودش. تفاوت از «انکارها» می‌آمد، که در آن‌ها نویسندگان از ادعایی قوی‌تر دربارهٔ کار خودشان کناره می‌گیرند («یک فرضیه به جای سازوکاری آزموده‌شده»)، و هنگامی که مدل‌ها مقاله‌هایشان را بازنگری کردند بیشتر شدند.

پاداش از سوی ارزیابان

این عادت از کجا می‌آید؟ چت‌بات‌ها روی جفت‌پاسخ‌هایی تنظیم دقیق می‌شوند که یک انسان یا یک داور هوش مصنوعی یکی از آن‌ها را ترجیح می‌دهد. در چهار مجموعه‌دادهٔ عمومی از چنین ترجیح‌هایی، پاسخ‌های دارای «rather than» در سه مجموعه احتمال بیشتری برای انتخاب شدن داشتند، به‌روشن‌ترین شکل وقتی داوران انسان بودند. چهار «مدل پاداش» (reward model) باز، جمله‌ای را با بند «rather than»اش امتیاز بالاتری دادند تا بدون آن، حتی وقتی بندی خنثی با همان طول جایگزینش شد. و گفتن به یک مدل که «صادق» باشد باعث شد کمی بیشتر از این عبارت استفاده کند.

نویسندگان حدس می‌زنند که این ساختار پیامد جانبی این نوع آموزش است: در یک پاسخ منفرد چت‌بات، یک انکار محتاطانه صادقانه به نظر می‌رسد؛ اما وقتی در سراسر یک مقاله، و سراسر یک ادبیات علمی، تکرار شود، همچون جانب‌داری خوانده می‌شود. ممنوع کردن این عبارت احتمالاً فقط همان کارکرد را به جای دیگری منتقل می‌کند، همان‌طور که GPT-6-sol هنگام بازنگری «rather than» را با «X, not Y» عوض می‌کند.

این سبک در حال گسترش است

این پژوهش محدودیت‌های روشنی دارد: دو برچسب‌زن که خود از نویسندگان‌اند، و مقایسهٔ Claude که تا کنون تنها یکی از آن‌ها برچسبش زده است؛ تطبیق الگویی که ممکن است برخی کاربردها را از قلم بیندازد؛ و داده‌های ترجیحی که تنها همبستگی نشان می‌دهند. اما نتیجه‌گیری آن از یک عبارت فراتر می‌رود. مقاله‌هایی که انسان‌ها امضا کرده‌اند این ساختار را برگرفته‌اند، پس سبک ادبیات علمی به سوی سبک مدل‌ها می‌لغزد — مدل‌هایی که به نوبهٔ خود از آن خواهند آموخت.

تعارض منافع. نویسندگان بیان می‌کنند که از Claude Code (Claude Sonnet 5، Sonnet 5.5 و Opus 5.5) برای نوشتن کدهایشان، اجرای تحلیل‌ها و پیش‌نویس کردن متن در سراسر مقاله، از جمله بخش‌های روش‌ها و نتایج، استفاده کرده‌اند و سپس آن را دستی ویرایش کرده‌اند — از جمله با حذف ده «rather than» که هنگام تولید وارد شده بود. مدل‌های Claude همچنین در شمار سامانه‌های بررسی‌شده‌اند و در نقش ارزیاب خودکار به کار رفتند. Claude همچنین نویسندهٔ همین مقاله است.

Legal notice