செயற்கை நுண்ணறிவு தவறும்போது, இரண்டாவது செயற்கை நுண்ணறிவு இளம் மருத்துவர்களுக்கு உதவுகிறது
செயற்கை நுண்ணறிவு மாதிரிகள் இப்போது ஒரு கதிர்ப்படத்தையும் நோயாளியின் வரலாற்றையும் பார்த்து, எழுதப்பட்ட காரணத்துடன் ஒரு நோயறிதலை முன்மொழிய முடியும். அது உதவுகிறதா என்பது மாதிரியை மட்டுமல்ல, மருத்துவர்கள் எப்படி வினைபுரிகிறார்கள் என்பதையும் சார்ந்தது — குறிப்பாகப் பரிந்துரை தவறாக இருக்கும்போது. குறைந்த அனுபவமுள்ள மருத்துவர்கள் செயற்கை நுண்ணறிவு உதவியால் அதிகம் பயனடைகின்றனர், ஆனால் அதன் பிழைகளால் வழிதவறும் வாய்ப்பும் அவர்களுக்கே அதிகம் என்று கட்டுரை மேற்கோள் காட்டும் முந்தைய ஆய்வுகள் கண்டறிந்தன.
நான்சாங் பல்கலைக்கழகம், ஹாங்காங் அறிவியல் தொழில்நுட்பப் பல்கலைக்கழகம் ஆகியவற்றைச் சேர்ந்த ஒரு குழு, கூட்டு நுண்ணறிவிலிருந்து பெறப்பட்ட ஓர் எளிய கருத்தைச் சோதித்தது: மருத்துவர்களுக்கு ஒன்றுக்குப் பதிலாக இரண்டு சுயாதீனச் செயற்கை நுண்ணறிவுக் கருத்துகளைக் காட்டுவது.
மூன்று கைகள் கொண்ட சீரற்ற சோதனை
லின் வூ, ஜே ஷூ, ஃபூச்சிங் ஜோவ் மற்றும் சக ஆய்வாளர்கள், ஜூலை முதல் செப்டம்பர் 2026 வரை சீனாவின் மூன்று மருத்துவமனைகளில் இந்தச் சோதனையை நடத்தினர்; இது சீன மருத்துவச் சோதனைப் பதிவகத்தில் (Chinese Clinical Trial Registry) பதிவு செய்யப்பட்டது. கதிரியலிலும் பிற துறைகளிலும் (உள் மருத்துவம், பொது அறுவை சிகிச்சை, அவசர மருத்துவம்) மூன்று ஆண்டுகளுக்கும் குறைவான அனுபவம் கொண்ட 132 பயிற்சி மருத்துவர்களைச் சேர்த்து, அவர்களைச் சீரற்ற முறையில் மூன்று குழுக்களாகப் பிரித்தனர்:
- குழு A: GPT-5.4இன் பரிந்துரைகள் மட்டும்;
- குழு B: GPT-5.4 உடன் Kimi-K2.6;
- குழு C: GPT-5.4 உடன் Gemini-3.6 Flash.
பங்கேற்பாளர்களுக்குத் தாங்கள் எந்த மாதிரிகளைப் பார்க்கிறோம் என்று தெரியாது. ஒன்பது பயிற்சி மருத்துவர்கள் வலைப்பின்னல் கோளாறுகள் அல்லது உடல்நலக் குறைவால் விலகினர்; பகுப்பாய்வில் 123 பேர் இருந்தனர்.
அனைவரும் அதே 60 மார்பு, வயிற்றுக் கதிர்ப்படங்களைப் படித்தனர். ஒவ்வொன்றுக்கும், முதலில் தாங்களாகவே ஒரு நோயறிதலைக் கொடுத்து அதைப் பூட்டினர், பின்னர் செயற்கை நுண்ணறிவுப் பரிந்துரையை அல்லது பரிந்துரைகளைப் பார்த்தனர், பிறகு இறுதிப் பதிலைக் கொடுத்தனர். ஒவ்வொரு மாதிரியும் 60இல் சரியாக 39 நேர்வுகளில் (65%) சரியாக இருக்கும்படி நேர்வுகள் வேண்டுமென்றே தேர்ந்தெடுக்கப்பட்டன — பொது மாதிரியான GPT-5.4, 21 நேர்வுகளில் தவறியது. ஒப்பீட்டுக்கு, ஒன்று முதல் ஐந்து ஆண்டு அனுபவம் கொண்ட ஐந்து கதிரியலாளர்கள் செயற்கை நுண்ணறிவின்றி 54.3% மதிப்பெண் பெற்றனர்.
தவறான செயற்கை நுண்ணறிவு என்ன செய்கிறது
அனைவரையும் சேர்த்து, செயற்கை நுண்ணறிவு உதவியுடன் துல்லியம் 46.3%இலிருந்து 61.5%ஆக உயர்ந்தது. சுவாரசியமான பகுதி, GPT-5.4 தவறிய 21 கதிர்ப்படங்களில் நடந்ததுதான்:
- ஒரு செயற்கை நுண்ணறிவுடன் இருந்த கதிரியல் பயிற்சி மருத்துவர்கள் அந்த நேர்வுகளில் 20.0% துல்லியத்துடன் முடித்தனர். செயற்கை நுண்ணறிவின்றி, அதே குழு 31.4% பெற்றிருந்தது: தவறான பரிந்துரை அவர்களைக் கீழே இழுத்தது.
- இரண்டு செயற்கை நுண்ணறிவுகளுடன், கதிரியல் பயிற்சி மருத்துவர்கள் 40.1%, 40.4% எட்டினர்.
- பிற துறைகளின் பயிற்சி மருத்துவர்களும் அதே அமைப்பைக் காட்டுகின்றனர்: ஒரு செயற்கை நுண்ணறிவுடன் **12.1%**இலிருந்து இரண்டுடன் சுமார் 31% வரை.
60 நேர்வுகள் முழுவதிலும், கதிரியல் பயிற்சி மருத்துவர்கள் ஒரு செயற்கை நுண்ணறிவுடன் 9.6 சதவீதப் புள்ளிகளும், இரண்டுடன் 16.3, 17.5 புள்ளிகளும் மேம்பட்டனர் — சுமார் 7 புள்ளிகள் அதிகம். படிக்கும் நேரமும் நம்பிக்கையும் குழுக்களிடையே வேறுபடவில்லை.
இலவச உணவு அல்ல
இரண்டாவது கருத்துக்கு ஒரு விலை உண்டு. கதிரியல் அல்லாத பயிற்சி மருத்துவர்களுக்கு, GPT-5.4 சரியாக இருந்தபோது, இரண்டாவது மாதிரியைச் சேர்ப்பது துல்லியத்தை 87.4%இலிருந்து சுமார் 75%ஆகக் குறைத்தது: மாறுபட்ட ஒரு செயற்கை நுண்ணறிவு, சரியான பதிலிலிருந்து அவர்களைப் பேசி மாற்றக்கூடும். ஒட்டுமொத்தமாக, அவர்களின் மேம்பாடு ஒன்று, இரண்டு செயற்கை நுண்ணறிவுகளுக்கு இடையே வேறுபடவில்லை. இரண்டு மாதிரிகளும் தவறியபோது, ஒரு ஆய்வுநோக்குப் பகுப்பாய்வு இரண்டாவதிலிருந்து குறிப்பிடத்தக்க பலன் எதையும் காணவில்லை.
இரண்டு பரிந்துரைகள் பிழையான செயற்கை நுண்ணறிவின் தாக்கத்தைக் “குறைக்கலாம்” என்றும், ஒட்டுமொத்த ஆதாயம் கதிரியல் பயிற்சி மருத்துவர்களுக்கு மட்டுமே என்றும் ஆசிரியர்கள் முடிவு செய்கின்றனர்.
நினைவில் கொள்ள வேண்டிய வரம்புகள்
- ஒவ்வொரு மாதிரிக்கும் ஒரே துல்லியத்தைத் தரும்படி 60 நேர்வுகள் தேர்ந்தெடுக்கப்பட்டன; எனவே அவை அன்றாட நடைமுறையைப் பிரதிபலிக்கவில்லை.
- இரண்டு மாதிரிகள் எவ்வளவு அடிக்கடி முரண்படுகின்றன என்பதைப் பொறுத்து விளைவு இருக்கலாம்; அது ஒரு ஜோடிக்கும் மற்றொன்றுக்கும் மாறுபடுகிறது.
- முறையான மாதிரி அளவுக் கணக்கீடு எதுவும் செய்யப்படவில்லை; பங்கேற்பாளர்களின் எண்ணிக்கை சாத்தியமான ஆட்சேர்ப்பை அடிப்படையாகக் கொண்டது.
- சீரற்ற ஒதுக்கீடே, மற்றொரு மொழி மாதிரியான DeepSeekஇடம் சமநிலையான பட்டியலைக் கேட்டு உருவாக்கப்பட்டது; அது மாற்றமின்றிப் பயன்படுத்தப்பட்டது.
ஆசிரியர்களின் கூற்றுப்படி, அடுத்ததாகத் தேர்ந்தெடுக்கப்படாத நோயாளிகளுடனும் கண்-தடமறிதலுடனும் ஆய்வுகள் வரும்; முரண்படும் இரண்டு இயந்திரங்களை மருத்துவர்கள் உண்மையில் எப்படி எடைபோடுகின்றனர் என்று பார்ப்பதற்காக.
