విజ్ఞానశాస్త్రం తనను తానే పునరావృతం చేసుకుంటోందా?
శాస్త్రీయ సాహిత్యం పెరుగుతూనే ఉంది — పత్రంలో ఉటంకించిన గణాంకాల ప్రకారం, ఏటా సుమారు 4%, అంటే సుమారు ప్రతి 17 ఏళ్లకు రెట్టింపు. పెద్ద సాహిత్యం అంటే ఆలోచనల విస్తృత సరిహద్దు అని అర్థం కావచ్చు. ఇప్పటికే రాసినదాన్ని పునరావృతం చేసే మరిన్ని పత్రాలు అని కూడా అర్థం కావచ్చు. MIT గణిత శాస్త్రవేత్తలు ఇలాన్ డోరోన్-అరాద్, ఎల్కానన్ మోసెల్ ఆ ప్రశ్నలో ఒక పార్శ్వాన్ని కొలవడానికి పూనుకున్నారు.
మౌలికతకు అనేక పార్శ్వాలు ఉన్నాయి, అందరూ అంగీకరించిన కొలమానం లేదు. కానీ వాటిలో ఒకదాన్ని ఇప్పుడు భారీ స్థాయిలో కొలవవచ్చు: పాఠ విశిష్టత, అంటే ఒక పత్రంలో ఎంత భాగం ఇటీవలి పరిశోధనలా చదువుతుంది. ఆధునిక భాషా నమూనాలు ఒక భాగాన్ని దాని అర్థాన్ని పట్టుకునే సంఖ్యల జాబితాగా మార్చగలవు, కాబట్టి ఒకే విషయాన్ని వేర్వేరు మాటల్లో చెప్పే రెండు భాగాలు ఒకదానికొకటి దగ్గరగా చేరతాయి.
ఇది దేన్ని పట్టుకుంటుంది, దేన్ని పట్టుకోదు అనే విషయంలో రచయితలు జాగ్రత్తగా ఉన్నారు. నిజంగా కొత్త ఆవిష్కరణను కూడా సుపరిచిత వాక్యాలతో రాయవచ్చు; అసాధారణమైన పదబంధం కొత్త ఆలోచన కాదు.
పోలికను స్థిరంగా ఉంచడం
అమాయకమైన పోలిక తప్పుదోవ పట్టిస్తుంది: సాహిత్యం పెరిగేకొద్దీ, ఏ భాగానికైనా ఏదో ఒకదాన్ని పోలి ఉండే అవకాశాలు పెరుగుతాయి. అందుకే రచయితలు పోలిక సమూహాన్ని స్థిరంగా ఉంచారు. ఎనిమిది రంగాల్లో ప్రతిదానికీ — ఖగోళ భౌతికశాస్త్రం, బయోఇన్ఫర్మాటిక్స్, రసాయనశాస్త్రం, వాతావరణ మార్పు, మెషిన్ లెర్నింగ్, వైద్యం, మనోవిజ్ఞానం, క్వాంటం కంప్యూటింగ్ — 2015 నుంచి 2025 వరకు ప్రతి సంవత్సరానికీ, వారు CORE అనే బహిరంగ-ప్రవేశ డేటాబేస్ నుంచి 300 పత్రాలను తీసుకుని, వాటిని అంతకుముందు ఐదేళ్లకు చెందిన 3,000 పత్రాలతో పోల్చారు. మొత్తంగా సుమారు 26,000 పూర్తి పాఠాలు.
ప్రతి పత్రాన్ని 160 పదాల, ఒకదానిపై ఒకటి పాక్షికంగా వచ్చే భాగాలుగా కోశారు. ఒక సరిపోలికకు అవసరమైనవి: అర్థంలో అధిక సారూప్యత, కనీసం ఆరు ఉమ్మడి నిర్దిష్ట పదాలు, వరుసగా ఐదు పదాలు ఒకేలా ఉండే ఏ క్రమమూ లేకపోవడం — దీనివల్ల సాధారణ నకలు మినహాయించబడుతుంది — ఉమ్మడి రచయిత లేకపోవడం, ఒకే పత్రపు రెండు రూపాలు కాకపోవడం. ఈ ప్రయోజనం కోసం నిర్మించిన పరీక్షా సమితిపై, డిటెక్టర్ దాదాపు ఏ తప్పుడు సరిపోలికలూ చేయలేదు (99.6% ఖచ్చితత్వం), కొన్ని నిజమైనవాటిని మాత్రం కోల్పోయింది.
స్థిరంగా, తర్వాత తీవ్రమైన పెరుగుదల
2020 వరకు, ఇటీవలి పరిశోధనతో సరిపోలే పత్ర పాఠపు వాటా సుమారు 0.43% చుట్టూ ఉంది. 2021 నుంచి అది పెరిగి, 2025లో 1.34% కి చేరింది — మునుపటి స్థాయికి 3.1 రెట్లు. ఒక గణాంక పరీక్ష ఈ పెరుగుదల ప్రారంభాన్ని 2021లో ఉంచుతుంది.

ఎడమ: ప్రతి పత్రపు పాఠంలో ఇటీవలి పరిశోధనను పోలిన భాగపు సగటు వాటా. కుడి: కనీసం అలాంటి ఒక భాగం ఉన్న పత్రాల వాటా. — చిత్రం 1a–b, Doron-Arad & Mossel (2026), arXiv:2609.32963.
ఈ పెరుగుదల కొద్దిమంది భారీగా అరువు తెచ్చుకునేవారి వల్ల రాలేదు. ప్రతిధ్వనించే కనీసం ఒక భాగం ఉన్న పత్రాల వాటా 2025లో 25% కి చేరింది. ఎనిమిది రంగాలూ వేర్వేరు రేట్లలో పెరిగాయి.
ఉటంకింపులు లేని ప్రతిధ్వనులు
రచయితలు తాము ప్రతిధ్వనించిన పరిశోధనను కేవలం ఉటంకించారా? అరుదుగా. సరిపోలిన పత్రాల జంటల్లో కేవలం 6.4% కు మాత్రమే ఉటంకింపు సంబంధం కనిపించింది, 176 జంటలను చేతితో పరిశీలించగా 7% వచ్చింది. 2015, 2025 మధ్య సరిపోలిన జంటలు 449 నుంచి 1,831 కి పెరిగాయి — కానీ ఉటంకింపు ఉన్నవి రెండు సంవత్సరాల్లోనూ 59 గానే ఉన్నాయి.

ప్రతి సంవత్సరం సరిపోలిన పత్రాల జంటల సంఖ్య, ఉటంకింపు స్థితిని బట్టి: దాదాపు పెరుగుదల అంతా ఉటంకింపు కనిపించని జంటల్లోనే. — చిత్రం 3a, Doron-Arad & Mossel (2026), arXiv:2609.32963.
కేవలం పదజాలమే కాదు, ఆలోచనలు కూడా పునరావృతమవుతున్నాయా అని బృందం పరిశీలించింది. Anthropic కు చెందిన AI నమూనాలు ప్రతి భాగాన్ని కొన్ని మాటల్లో సంగ్రహించి, తర్వాత అసలు పాఠాన్ని చూడకుండా, రెండు సంగ్రహాలు సారాంశంలో ఒకే శాస్త్రీయ వాదనను వ్యక్తం చేస్తున్నాయో లేదో నిర్ణయించాయి. కఠినమైన నిర్వచనాన్ని వాడితే, అలాంటి జంటలు 2015–2020లో సంవత్సరానికి సగటున సుమారు 26 నుంచి 2025లో 139 కి పెరిగాయి.
ఈ ధోరణి అనేక పరీక్షల్లోనూ నిలిచింది — వేర్వేరు పరిమితులు, భాగాల పొడవులు, పద్ధతుల విభాగాలను, అత్యధికంగా నకలు చేయబడిన మూలాలను తొలగించడం — Europe PMC అనే రెండో, స్వతంత్ర డేటాబేస్లోనూ పునరావృతమైంది, అక్కడ ప్రతిధ్వనించే పాఠపు వాటా రెట్టింపైంది.
అనుమానితుడు, తీర్పు కాదు
అతిపెద్ద పెరుగుదల విజ్ఞానశాస్త్ర రచన కోసం AI సాధనాలను వేగంగా స్వీకరించడంతో సమానంగా జరిగింది, అవి అత్యంత సాధారణ పదజాలాన్ని వ్యాపింపజేసే ధోరణి కలిగి ఉంటాయి కాబట్టి రచయితలు వాటిని ఒక సంభావ్య కారకంగా చూస్తున్నారు. కానీ అధ్యయనం కారణాన్ని నిర్ధారించదు. శాస్త్ర విభాగాల ఉమ్మడి భాష, అవే కొన్ని పత్రాలపై దృష్టి కుంచించుకుపోవడం కూడా పాత్ర పోషించవచ్చు; ఈ దృష్టిలో, ఇప్పటికే సాగుతున్న ఏకరూపతకు AI తాజా వేగవర్ధకం మాత్రమే. అర్థ సారూప్యత దుష్ప్రవర్తనను సూచించదని కూడా రచయితలు నొక్కి చెబుతున్నారు.
రచయితలకు, సమీక్షకులకు, సంపాదకులకు, నిధులిచ్చేవారికి మౌలికతను కనిపించేలా చేసే సాధనాలను వారు సూచిస్తున్నారు — ఒక హెచ్చరికతో: విశిష్టత స్కోర్ను ఎప్పుడూ లక్ష్యంగా చేయవద్దు, ఎందుకంటే అది నిజమైన అంతర్దృష్టికి బదులు అసాధారణ పదజాలానికి బహుమతి ఇస్తుంది, దాన్ని మోసగించడం సులభం.
