এআই ভুল করলে দ্বিতীয় একটি এআই তরুণ চিকিৎসকদের সাহায্য করে
এআই মডেল এখন একটি রেডিওগ্রাফ ও রোগীর ইতিহাস দেখে লিখিত যুক্তিসহ রোগনির্ণয় প্রস্তাব করতে পারে। এটি সাহায্য করে কি না, তা শুধু মডেলের ওপর নয়, চিকিৎসকেরা কীভাবে সাড়া দেন তার ওপরও নির্ভর করে — বিশেষ করে যখন পরামর্শটি ভুল। গবেষণাপত্রে উদ্ধৃত আগের গবেষণাগুলো দেখেছে, কম অভিজ্ঞ চিকিৎসকেরা এআই-এর সাহায্যে সবচেয়ে বেশি লাভবান হন, কিন্তু এর ভুলে বিপথে যাওয়ার সম্ভাবনাও তাঁদেরই সবচেয়ে বেশি।
নানচাং বিশ্ববিদ্যালয় ও হংকং বিজ্ঞান ও প্রযুক্তি বিশ্ববিদ্যালয়ের একটি দল সমষ্টিগত বুদ্ধিমত্তা থেকে নেওয়া একটি সরল ধারণা পরীক্ষা করেছে: চিকিৎসকদের একটির বদলে দুটি স্বাধীন এআই মতামত দেখানো।
তিন বাহুর একটি দৈবচয়িত পরীক্ষা
লিন উ (Lin Wu), ঝে শু (Zhe Xu), ফুচিং ঝৌ (Fuqing Zhou) ও তাঁদের সহকর্মীরা ২০২৬ সালের জুলাই থেকে সেপ্টেম্বরের মধ্যে চীনের তিনটি হাসপাতালে পরীক্ষাটি চালান, যা চীনা ক্লিনিক্যাল ট্রায়াল রেজিস্ট্রিতে নিবন্ধিত। তাঁরা তিন বছরের কম অভিজ্ঞতাসম্পন্ন ১৩২ জন রেসিডেন্ট চিকিৎসক নিয়োগ করেন, রেডিওলজি ও অন্যান্য বিশেষত্ব (ইন্টারনাল মেডিসিন, জেনারেল সার্জারি, জরুরি চিকিৎসা) — উভয় থেকেই, এবং দৈবচয়নের মাধ্যমে তাঁদের তিনটি দলে ভাগ করেন:
- দল A: শুধু GPT-5.4-এর পরামর্শ;
- দল B: GPT-5.4 আর Kimi-K2.6;
- দল C: GPT-5.4 আর Gemini-3.6 Flash।
অংশগ্রহণকারীরা জানতেন না তাঁরা কোন মডেল দেখছেন। নেটওয়ার্ক বিভ্রাট বা অসুস্থ বোধ করার কারণে নয়জন রেসিডেন্ট সরে যান, ফলে বিশ্লেষণে থাকেন ১২৩ জন।
সবাই একই ৬০টি বুক ও পেটের রেডিওগ্রাফ পড়েন। প্রতিটির ক্ষেত্রে তাঁরা প্রথমে নিজে রোগনির্ণয় দিয়ে তা লক করেন, তারপর এআই-এর পরামর্শ বা পরামর্শগুলো দেখেন, তারপর চূড়ান্ত উত্তর দেন। কেসগুলো ইচ্ছা করেই এমনভাবে বাছা হয়েছিল যাতে প্রতিটি মডেল ৬০টির মধ্যে ঠিক ৩৯টিতে (৬৫%) সঠিক হয় — আর সাধারণ মডেল GPT-5.4 ২১টিতে ভুল ছিল। তুলনার জন্য, এক থেকে পাঁচ বছরের অভিজ্ঞতাসম্পন্ন পাঁচজন রেডিওলজিস্ট এআই ছাড়া ৫৪.৩% পেয়েছিলেন।
ভুল এআই কী করে
সব অংশগ্রহণকারী মিলিয়ে, এআই-এর সাহায্যে নির্ভুলতা ৪৬.৩% থেকে বেড়ে ৬১.৫% হয়। আকর্ষণীয় অংশটি হলো সেই ২১টি রেডিওগ্রাফে কী ঘটেছিল, যেগুলোতে GPT-5.4 ভুল ছিল:
- একটি এআই-সহ রেডিওলজি রেসিডেন্টরা ওই কেসগুলোতে শেষ পর্যন্ত ২০.০% নির্ভুলতায় থামেন। এআই ছাড়া একই দল পেয়েছিল ৩১.৪%: ভুল পরামর্শ তাঁদের নিচে টেনে নামিয়েছে।
- দুটি এআই-সহ রেডিওলজি রেসিডেন্টরা পৌঁছান ৪০.১% ও ৪০.৪%-এ।
- অন্য বিশেষত্বের রেসিডেন্টরাও একই ধরন দেখান, একটি এআই-সহ ১২.১% থেকে দুটি-সহ প্রায় ৩১%।
সব ৬০টি কেস মিলিয়ে, রেডিওলজি রেসিডেন্টদের একটি এআই-সহ ৯.৬ শতাংশ বিন্দু উন্নতি হয়, আর দুটি-সহ ১৬.৩ ও ১৭.৫ বিন্দু — প্রায় ৭ বিন্দু বেশি। পড়ার সময় ও আত্মবিশ্বাসে দলগুলোর মধ্যে কোনো পার্থক্য ছিল না।
বিনা মূল্যে কিছু নয়
দ্বিতীয় মতামতের একটি মূল্য আছে। রেডিওলজির বাইরের রেসিডেন্টদের ক্ষেত্রে, GPT-5.4 যখন সঠিক ছিল, তখন দ্বিতীয় মডেল যোগ করায় নির্ভুলতা ৮৭.৪% থেকে কমে প্রায় ৭৫% হয়েছে: একটি ভিন্নমতের এআই তাঁদের সঠিক উত্তর থেকে সরিয়ে দিতে পারত। সব মিলিয়ে, একটি ও দুটি এআই-এর মধ্যে তাঁদের উন্নতিতে পার্থক্য ছিল না। আর যখন দুটি মডেলই ভুল ছিল, তখন একটি অনুসন্ধানমূলক বিশ্লেষণ দ্বিতীয়টি থেকে কোনো উল্লেখযোগ্য সুবিধা পায়নি।
লেখকদের সিদ্ধান্ত, দুটি পরামর্শ ভুল এআই-এর প্রভাব সীমিত “করতে পারে”, তবে সামগ্রিক লাভ কেবল রেডিওলজি রেসিডেন্টদের।
মনে রাখার মতো সীমাবদ্ধতা
- ৬০টি কেস বাছা হয়েছিল যাতে প্রতিটি মডেলের নির্ভুলতা সমান হয়, তাই এগুলো দৈনন্দিন চর্চার প্রতিফলন নয়।
- প্রভাবটি নির্ভর করতে পারে দুটি মডেল কত ঘন ঘন দ্বিমত পোষণ করে তার ওপর, যা এক জোড়া থেকে আরেক জোড়ায় ভিন্ন।
- নমুনার আকারের কোনো আনুষ্ঠানিক হিসাব করা হয়নি; অংশগ্রহণকারীর সংখ্যা ছিল বাস্তবসম্মত নিয়োগের ওপর ভিত্তি করে।
- দৈবচয়িত বণ্টন নিজেই তৈরি হয়েছিল আরেকটি ভাষা মডেল, DeepSeek, থেকে একটি ভারসাম্যপূর্ণ তালিকা চেয়ে নিয়ে, যা কোনো পরিবর্তন ছাড়াই ব্যবহার করা হয়েছে।
লেখকদের মতে, এরপর আসবে বাছাই-না-করা রোগী ও চোখের গতি-অনুসরণ (eye-tracking) নিয়ে গবেষণা, যাতে দেখা যায় চিকিৎসকেরা আসলে দুটি দ্বিমত পোষণকারী যন্ত্রকে কীভাবে ওজন করেন।
