رایانش و هوش مصنوعیپیش‌چاپتحلیل داده۴ دقیقه مطالعه

آیا علم دارد خودش را تکرار می‌کند؟

ادبیات علمی پیوسته رشد می‌کند — بر پایهٔ ارقامی که مقاله نقل می‌کند، تقریباً 4% در سال، یعنی دو برابر شدن در هر حدود 17 سال. ادبیاتی بزرگ‌تر می‌تواند به معنای مرزی گسترده‌تر از ایده‌ها باشد. همچنین می‌تواند به معنای مقاله‌های بیشتری باشد که آنچه را پیش‌تر نوشته شده تکرار می‌کنند. ایلان دورون-آراد و الکانان موسل، ریاضی‌دانانی در MIT، بر آن شدند تا یک جنبه از این پرسش را اندازه بگیرند.

اصالت ابعاد بسیاری دارد و هیچ معیار مورد توافقی ندارد. اما یکی از این ابعاد اکنون در مقیاس بزرگ اندازه‌پذیر است: تمایز متنی، یعنی اینکه چه مقدار از یک مقاله شبیه کارهای اخیر خوانده می‌شود. مدل‌های زبانی امروزی می‌توانند یک بند را به فهرستی از اعداد تبدیل کنند که معنای آن را در بر می‌گیرد، به‌طوری که دو بند که همان چیز را با واژه‌های متفاوت می‌گویند در نهایت به هم نزدیک می‌افتند.

نویسندگان دربارهٔ اینکه این روش چه چیزی را می‌سنجد و چه چیزی را نمی‌سنجد محتاط‌اند. یک یافتهٔ واقعاً تازه می‌تواند با جمله‌های آشنا نوشته شود؛ یک عبارت غیرمعمول، ایده‌ای تازه نیست.

ثابت نگه داشتن مقایسه

یک مقایسهٔ ساده‌انگارانه گمراه‌کننده می‌بود: با رشد ادبیات، هر بندی شانس بیشتری دارد که به چیزی شبیه باشد. بنابراین نویسندگان مجموعهٔ مقایسه را ثابت نگه داشتند. برای هر یک از هشت رشته — اخترفیزیک، بیوانفورماتیک، شیمی، تغییر اقلیم، یادگیری ماشین، پزشکی، روان‌شناسی و رایانش کوانتومی — و برای هر سال از 2015 تا 2025، آن‌ها 300 مقاله از پایگاه دادهٔ دسترسی آزاد CORE برداشتند و آن‌ها را با 3,000 مقاله از پنج سال پیش از آن مقایسه کردند. در مجموع، حدود 26,000 متن کامل.

هر مقاله به بندهای هم‌پوشان 160 واژه‌ای بریده شد. برای یک تطابق لازم بود: شباهت معنایی بالا، دست‌کم شش اصطلاح تخصصی مشترک، هیچ رشتهٔ یکسانی از پنج واژه — تا کپی‌برداری ساده کنار گذاشته شود — هیچ نویسندهٔ مشترک، و نه دو نسخه از یک مقاله. روی یک مجموعهٔ آزمون که برای همین منظور ساخته شده بود، این آشکارساز تقریباً هیچ تطابق نادرستی نداشت (دقت 99.6%)، در حالی که برخی تطابق‌های واقعی را از دست می‌داد.

ثابت، سپس جهشی تند

تا 2020، سهم متن یک مقاله که با کارهای اخیر تطابق داشت حول 0.43% در نوسان بود. از 2021 بالا رفت و در 2025 به 1.34% رسید — 3.1 برابر سطح پیشین. یک آزمون آماری آغاز این افزایش را در 2021 قرار می‌دهد.

دو نمودار خطی: سهم متن منطبق و سهم مقاله‌های دارای تطابق، هر دو تا 2020 هموار و سپس با شیب تند تا 2025 رو به بالا.

چپ: میانگین سهم متن هر مقاله که به کارهای اخیر شبیه است. راست: سهم مقاله‌هایی که دست‌کم یک چنین بندی دارند. — شکل 1a–b، Doron-Arad & Mossel (2026)، arXiv:2609.32963.

این افزایش از چند وام‌گیرندهٔ پرکار نیامد. سهم مقاله‌هایی که دست‌کم یک بند پژواک‌گونه دارند در 2025 به 25% رسید. هر هشت رشته افزایش داشتند، با آهنگ‌های متفاوت.

پژواک‌هایی بدون ارجاع

آیا نویسندگان به سادگی به کاری که پژواکش را تکرار می‌کنند ارجاع داده‌اند؟ به‌ندرت. تنها برای 6.4% از جفت‌مقاله‌های منطبق پیوند ارجاعی یافت شد، و بررسی دستی 176 جفت به 7% رسید. میان 2015 و 2025، جفت‌های منطبق از 449 به 1,831 رسیدند — اما شمار جفت‌های دارای ارجاع در هر دو سال 59 ماند.

نمودار میله‌ای جفت‌مقاله‌های منطبق در هر سال، بیشترشان بدون ارجاع شناسایی‌شده، با رشدی تند پس از 2021.

شمار جفت‌مقاله‌های منطبق در هر سال، بر حسب وضعیت ارجاع: تقریباً همهٔ رشد در جفت‌هایی است که ارجاعی برایشان یافت نشده. — شکل 3a، Doron-Arad & Mossel (2026)، arXiv:2609.32963.

گروه همچنین پرسید آیا ایده‌ها تکرار می‌شوند، نه فقط واژه‌ها. مدل‌های هوش مصنوعی شرکت Anthropic هر بند را در چند واژه خلاصه کردند، سپس بدون دیدن متن اصلی داوری کردند که آیا دو خلاصه در اصل همان ادعای علمی را بیان می‌کنند. با تعریفی سخت‌گیرانه، چنین جفت‌هایی از میانگین حدود 26 در سال در 2015–2020 به 139 در 2025 رسیدند.

این الگو در برابر بررسی‌های بسیاری پایدار ماند — آستانه‌های متفاوت، طول‌های متفاوت بند، حذف بخش‌های روش‌شناسی و پرکپی‌ترین منابع — و در پایگاه دادهٔ دوم و مستقلی، Europe PMC، تکرار شد، جایی که سهم متن پژواک‌گونه دو برابر شد.

یک مظنون، نه یک حکم

بزرگ‌ترین افزایش با پذیرش سریع ابزارهای هوش مصنوعی برای نگارش علمی هم‌زمان است، و نویسندگان آن‌ها را عاملی محتمل می‌دانند، چون این ابزارها به گسترش رایج‌ترین عبارت‌پردازی‌ها گرایش دارند. اما پژوهش علت را اثبات نمی‌کند. زبان مشترک رشته‌ها و تمرکز توجه بر همان چند مقاله نیز ممکن است نقش داشته باشند؛ از این دیدگاه، هوش مصنوعی تازه‌ترین شتاب‌دهندهٔ هم‌گرایی‌ای است که از پیش در جریان بوده. نویسندگان همچنین تأکید می‌کنند که شباهت معنایی به معنای تخلف نیست.

آن‌ها ابزارهایی پیشنهاد می‌کنند که اصالت را برای نویسندگان، داوران، ویراستاران و تأمین‌کنندگان مالی آشکار کنند — با یک هشدار: هرگز امتیاز تمایز را به هدف تبدیل نکنید، چون عبارت‌پردازی غیرمعمول را بر بینش واقعی پاداش می‌دهد و دور زدنش آسان خواهد بود.

Legal notice