এআই-এর বিষণ্নতা স্কোর নির্ভর করে এআই-এর ওপরই
বিষণ্নতা নির্ণয়ের কোনো রক্ত পরীক্ষা নেই। বড় ভাষা মডেল ক্লিনিক্যাল কথোপকথন থেকে অক্লান্ত, সস্তা ও পুনরাবৃত্তিযোগ্য মূল্যায়নের প্রতিশ্রুতি দেয়, আর প্রাথমিক মূল্যায়নগুলো উৎসাহজনক ছিল। মনোরোগবিদ্যা আগেও এমন প্রশ্নের মুখোমুখি হয়েছে: ১৯৭১ সালে একটি গবেষণায় দেখা যায়, একই ভিডিও-রেকর্ড করা সাক্ষাৎকার দেখার পরও মার্কিন ও ব্রিটিশ মনোরোগ বিশেষজ্ঞরা একমত হননি, আর এই ক্ষেত্রটি সুস্পষ্ট মানদণ্ড ও কাঠামোবদ্ধ সাক্ষাৎকার দিয়ে এর জবাব দিয়েছিল।
কিন্তু একটি ভাষা মডেল একগুচ্ছ বাছাইয়ের মধ্য দিয়েই কেবল “মূল্যায়নকারী” হয়ে ওঠে। কেউ মডেলটি বাছেন, অনুরোধের শব্দ ঠিক করেন — প্রশ্নাবলি হিসেবে, একজন মনোরোগ বিশেষজ্ঞের কণ্ঠে, নাকি রোগী নিজের সম্পর্কে উত্তর দিচ্ছেন এভাবে — উত্তরের জন্য সংখ্যা না অক্ষর বেছে নেন, ঠিক করেন মডেল কেবল রোগীর কথা পড়বে নাকি পুরো কথোপকথন, এবং তার আউটপুটকে একটি স্কোরে রূপান্তর করেন। মূল্যায়নে এই বিকল্পগুলো খুব কমই দেখানো হয়।
একটি মূল্যায়নকারী তৈরির ৮৮০টি উপায়
নিউ ইয়র্কের মাউন্ট সাইনাইয়ের Icahn School of Medicine-এর Baihan Lin ১১টি ওপেন মডেলকে (১০০ কোটি থেকে ২,১০০ কোটি প্যারামিটার) পাঁচ ধরনের শব্দচয়ন, কথোপকথনের দুটি দৃষ্টিকোণ, উত্তর পড়ার দুটি উপায় এবং স্কোর তৈরির চারটি উপায়ের সঙ্গে মিলিয়েছেন। এতে দাঁড়ায় ৮৮০টি মূল্যায়নকারী, যার প্রতিটি একই ১৮৯টি রেকর্ড করা সাক্ষাৎকারে প্রয়োগ করা হয়েছে; সাক্ষাৎকারগুলো নিয়েছিল একটি অ্যানিমেটেড ভার্চুয়াল সাক্ষাৎকারগ্রহীতা। প্রতিটি সাক্ষাৎকারের আগে অংশগ্রহণকারীরা PHQ-8 পূরণ করেছিলেন — আট প্রশ্নের একটি বিষণ্নতা প্রশ্নাবলি, যার স্কোর ০ থেকে ২৪; ১০ বা তার বেশি স্কোর হলো স্ক্রিনিংয়ের প্রচলিত সীমা। প্রায় ৩০% অংশগ্রহণকারী এই সীমা পেরিয়েছিলেন।
গবেষণাটি পূর্ব-নিবন্ধিত (প্রি-রেজিস্টার্ড) ছিল: প্রশ্নাবলির সঙ্গে কোনো তুলনার আগেই বিশ্লেষণের কোড স্থির (ফ্রিজ) করা হয়েছিল। তারপর এই নির্ধারিত প্রক্রিয়া একবার চালানো হয় ৮৬টি নতুন সাক্ষাৎকারে, যেগুলো নিয়েছিল একটি সম্পূর্ণ স্বয়ংক্রিয় ভার্চুয়াল সাক্ষাৎকারগ্রহীতা, স্বয়ংক্রিয় প্রতিলিপিসহ। সমস্ত প্রক্রিয়াকরণ একটি স্থানীয় ওয়ার্কস্টেশনেই হয়েছে।
রোগীর চেয়ে মূল্যায়নকারীর ওজন বেশি
- এক সাক্ষাৎকার, বিপরীত রায়। হালকা উপসর্গের এক অংশগ্রহণকারীকে (PHQ-8 স্কোর ৫, সীমার নিচে) ৮৮০টি মূল্যায়নকারীর অর্ধেক স্ক্রিনিংয়ে পজিটিভ বলে চিহ্নিত করেছে। কোনো অংশগ্রহণকারীই সর্বসম্মত রায় পাননি।
- নির্ভুল মূল্যায়নকারীরাও একমত নয়। ভালো পার্থক্যকরণ ক্ষমতাসম্পন্ন (AUC ০.৭০ বা তার বেশি) ৫৪০টি মূল্যায়নকারীর মধ্যে এলোমেলোভাবে বাছা দুটি ৪০% অংশগ্রহণকারীর স্ক্রিনিং সিদ্ধান্তে একমত হয়নি।
- ব্যক্তির চেয়ে মডেল বেশি গুরুত্বপূর্ণ। মডেল বাছাই স্কোরের তারতম্যের ৩০.০% ব্যাখ্যা করেছে; অংশগ্রহণকারীদের মধ্যকার স্থিতিশীল পার্থক্য ব্যাখ্যা করেছে ১০.৫% — ২.৮ গুণ কম।
ভুল জায়গায় শূন্য-বিন্দু থাকা ওজন-যন্ত্র
নির্ভুলতা, যেভাবে সাধারণত মাপা হয়, তা বলে একজন মূল্যায়নকারী মানুষকে কত ভালোভাবে ক্রমানুসারে সাজায়। সে কতজনকে চিহ্নিত করে, তা বলে না। মূল্যায়নকারীরা ০% থেকে ১০০% পর্যন্ত অংশগ্রহণকারীকে চিহ্নিত করেছে, যেখানে বাস্তবে হার ৩০%। এই অনুপাত নির্ধারণ করেছে প্রতিটি মূল্যায়নকারীর বেশি বা কম মূল্যায়ন করার গড় প্রবণতা (R² = ০.৯১)। লেখক একে তুলনা করেছেন এমন এক বাথরুম ওজন-যন্ত্রের সঙ্গে, যার শূন্য-বিন্দু ভুল জায়গায়: এটি মানুষকে ভালোভাবে ক্রমানুসারে সাজাতে পারে, কিন্তু এর বিচ্যুতিই ঠিক করে কে সীমারেখা পেরোবে। প্রায় একই নির্ভুলতার দুটি মডেল, Qwen2.5 7B ও Mistral 7B, প্রতি ১০০ জনে যথাক্রমে ২৪ ও ৮০ জনকে চিহ্নিত করত।
ছোটখাটো প্রযুক্তিগত খুঁটিনাটি এই রেখা সরিয়ে দিত। উত্তরের অক্ষর উল্টে দিলে — যাতে “A” মানে “একেবারেই না”-র বদলে “প্রায় প্রতিদিন” হয়, যা ক্লিনিক্যালি একটি অর্থহীন পরিবর্তন — চিহ্নিতদের অনুপাত মধ্যমায় ২১ পয়েন্ট, আর সর্বোচ্চ ৮৫ পয়েন্ট পর্যন্ত বদলে গেছে। একই মডেলকে সংকুচিত (কম্প্রেসড) ফাইল হিসেবে ভিন্ন সফটওয়্যারে চালালে মধ্যমায় ২১% সিদ্ধান্ত বদলে গেছে।
রেটিংগুলো বিষণ্নতার বাইরেও কিছু ধরছিল। এগুলো বিষণ্নতার মতোই ঘনিষ্ঠভাবে পোস্ট-ট্রমাটিক স্ট্রেসের উপসর্গ অনুসরণ করছিল, বেশি কথা বলা অংশগ্রহণকারীদের বেশি ঘন ঘন চিহ্নিত করা হয়েছে, এবং ১৬% মূল্যায়নকারী প্রশ্নাবলিতে পাওয়া নারী ও পুরুষের মধ্যকার ছোট পার্থক্যের দিকটাই উল্টে দিয়েছে।
ক্যালিব্রেশন সাহায্য করে, একটা সীমা পর্যন্ত
যেহেতু বিচ্যুতিই এত কিছু নিয়ন্ত্রণ করছিল, লেখক একটি সংশোধন চেষ্টা করেন: ৪০ জন স্থানীয়ভাবে লেবেল করা অংশগ্রহণকারী দিয়ে প্রতিটি মূল্যায়নকারীর সীমা নতুন করে ঠিক করা। নির্ভুলতা প্রায় ৬০% থেকে বেড়ে ৭৫% হয়, আর মতভেদ অর্ধেকে নামে, ৪০% থেকে ২০%। কিন্তু প্রত্যেক মূল্যায়নকারীকে সমান সংখ্যক মানুষ বাছতে বাধ্য করলেও তারা প্রায় প্রতি পাঁচবারে একবার ভিন্ন ভিন্ন মানুষ বেছেছে।
৮৬টি নতুন সাক্ষাৎকারে, পরীক্ষাযোগ্য ছয়টি পূর্ব-নিবন্ধিত পূর্বাভাসের পাঁচটি সত্য প্রমাণিত হয়েছে। লেখক স্পষ্ট সীমাবদ্ধতা তুলে ধরেন: কেবল ২,১০০ কোটি প্যারামিটার পর্যন্ত ওপেন মডেল, কারণ ডেটা ওয়ার্কস্টেশনের বাইরে যেতে পারত না; মানদণ্ড হিসেবে স্ব-প্রতিবেদিত প্রশ্নাবলি, রোগনির্ণয় নয়; একই প্রতিলিপি মূল্যায়ন করার জন্য কোনো চিকিৎসক নেই; এবং একটিমাত্র গবেষণাগারের ইংরেজি ভাষার সাক্ষাৎকার।
কোনো স্কোরে ভরসা করার আগে পাঁচটি যাচাই
গবেষণাপত্রটি শেষ হয় ব্যবহারিক পরামর্শ দিয়ে: একটিমাত্র সংখ্যার বদলে যুক্তিসংগত বিভিন্ন কনফিগারেশনে সিদ্ধান্তের পরিসর জানান; আগে থেকেই একটি নিরপেক্ষ কনফিগারেশন স্থির করুন; স্থানীয়ভাবে ক্যালিব্রেট করুন এবং অবশিষ্ট মতভেদ মাপুন; মূল্যায়নকারী আর কী কী ধরছে তা পরীক্ষা করুন; এবং মডেল, সফটওয়্যার, প্রতিলিপি বা শব্দচয়নের যেকোনো পরিবর্তনকে একটি নতুন যন্ত্র হিসেবে গণ্য করুন। লেখকের ভাষায়, যখন প্রশ্ন করার ধরন বদলালে বদলে যায় আমরা কাকে শনাক্ত করি, তখন যন্ত্রটি নিজেই ব্যাখ্যার অংশ হয়ে ওঠে।
