ALAMA ZA SONONA ZA AI HUTEGEMEA AI YENYEWE
Sonona haina kipimo cha damu cha kuitambua. Modeli kubwa za lugha zinaahidi tathmini zisizochoka, za bei nafuu na zinazoweza kurudiwa kutoka mazungumzo ya kitabibu, na tathmini za awali zimetia moyo. Saikiatria imewahi kukabili swali linalofanana: mwaka 1971, utafiti mmoja uligundua kuwa wataalamu wa magonjwa ya akili wa Marekani na Uingereza walitofautiana baada ya kutazama mahojiano yale yale yaliyorekodiwa kwa video, na fani hiyo ilijibu kwa vigezo vilivyo wazi na mahojiano yaliyopangiliwa.
Lakini modeli ya lugha huwa “mtathmini” tu kupitia mfululizo wa machaguo. Mtu huchagua modeli, huandika ombi — kama dodoso, kwa sauti ya daktari wa akili, au kama mgonjwa anayejibu kuhusu nafsi yake — huchagua tarakimu au herufi kwa majibu, huamua kama modeli isome maneno ya mgonjwa pekee au mazungumzo yote, na hugeuza matokeo yake kuwa alama. Tathmini mara chache huonyesha njia hizi mbadala.
Njia 880 za kuunda mtathmini mmoja
Baihan Lin, wa Shule ya Tiba ya Icahn katika Mount Sinai jijini New York, aliunganisha modeli 11 huria (kutoka vigezo bilioni 1 hadi 21) na miundo mitano ya maneno, mitazamo miwili ya mazungumzo, njia mbili za kusoma jibu na njia nne za kujenga alama. Hiyo inatoa watathmini 880, kila mmoja akitumiwa kwenye mahojiano 189 yale yale yaliyorekodiwa, yaliyoendeshwa na mhoji pepe wa katuni. Kabla ya kila mahojiano, washiriki walikuwa wamejaza PHQ-8, dodoso la sonona lenye vipengele vinane linalopimwa kutoka 0 hadi 24; alama ya 10 au zaidi ndicho kizingiti cha kawaida cha uchunguzi. Takriban 30% ya washiriki walivuka kizingiti hicho.
Utafiti ulisajiliwa mapema: msimbo wa uchambuzi ulifungwa kabla ya ulinganisho wowote na dodoso. Utaratibu huo uliofungwa kisha uliendeshwa mara moja kwenye mahojiano 86 mapya yaliyoongozwa na mhoji pepe anayejiendesha kikamilifu, yakiwa na nakala za maandishi za kiotomatiki. Uchakataji wote ulibaki kwenye kompyuta ya kazi ya eneo husika.
Mtathmini ana uzito kuliko mgonjwa
- Mahojiano moja, maamuzi yanayopingana. Mshiriki mwenye dalili hafifu (PHQ-8 ya 5, chini ya kizingiti) alitajwa kuwa chanya katika uchunguzi na nusu ya watathmini 880. Hakuna mshiriki aliyepata uamuzi wa kauli moja.
- Watathmini sahihi bado hutofautiana. Miongoni mwa watathmini 540 wenye uwezo mzuri wa kutofautisha (AUC ya 0.70 au zaidi), wawili waliochaguliwa kwa nasibu walitofautiana kuhusu uamuzi wa uchunguzi kwa 40% ya washiriki.
- Modeli ina uzito kuliko mtu. Uchaguzi wa modeli ulieleza 30.0% ya tofauti za alama; tofauti thabiti kati ya washiriki zilieleza 10.5% — mara 2.8 chini.
Mizani yenye sifuri iliyopotoka
Usahihi, kama unavyopimwa kwa kawaida, unaeleza jinsi mtathmini anavyowapanga watu kwa mpangilio. Hauelezi anawataja wangapi. Watathmini waliwataja kati ya 0% na 100% ya washiriki, ilhali kwa uhalisia walikuwa 30%. Kilichoamua sehemu hiyo ni mwelekeo wa wastani wa kila mtathmini kukadiria juu au chini (R² = 0.91). Mwandishi anaifananisha na mizani ya bafuni yenye sifuri iliyopotoka: inaweza kuwapanga watu vizuri, lakini upotofu wake ndio unaoamua nani avuke mstari. Modeli mbili zenye usahihi unaokaribia kufanana, Qwen2.5 7B na Mistral 7B, zingewataja watu 24 na 80 kati ya 100, mtawalia.
Masuala madogo ya kiufundi yalisogeza mstari huo. Kugeuza herufi za majibu — ili “A” imaanishe “karibu kila siku” badala ya “hata kidogo”, badiliko lisilo na maana kitabibu — kulisogeza sehemu ya waliotajwa kwa wastani wa kati (median) wa alama 21, na hadi 85. Kuendesha modeli ile ile kama faili iliyobanwa katika programu tofauti kulibadilisha wastani wa kati wa 21% ya maamuzi.
Tathmini pia zilinasa zaidi ya sonona. Zilifuatana na dalili za msongo wa baada ya kiwewe kwa karibu kama zilivyofuatana na sonona, washiriki waongeaji walitajwa mara nyingi zaidi, na 16% ya watathmini waligeuza mwelekeo wa tofauti ndogo kati ya wanawake na wanaume iliyoripotiwa na dodoso.
Urekebishaji husaidia, hadi kiwango fulani
Kwa kuwa upotofu ulikuwa na athari kubwa hivyo, mwandishi alijaribu marekebisho: kuweka upya kizingiti cha kila mtathmini kwa kutumia washiriki 40 waliowekewa lebo katika eneo husika. Usahihi ulipanda kutoka takriban 60% hadi 75%, na kutokubaliana kulipungua kwa nusu, kutoka 40% hadi 20%. Lakini hata kila mtathmini alipolazimishwa kuchagua idadi ile ile ya watu, bado walichagua watu tofauti takriban mara moja kati ya tano.
Katika mahojiano 86 mapya, utabiri mitano kati ya sita uliosajiliwa mapema ambao ungeweza kujaribiwa ulisimama. Mwandishi anaorodhesha mipaka iliyo wazi: modeli huria tu hadi vigezo bilioni 21, kwa sababu data haikuweza kutoka kwenye kompyuta ya kazi; dodoso la kujiripoti kama kigezo, si utambuzi wa kitabibu; hakuna matabibu waliotathmini nakala zile zile; na mahojiano ya lugha ya Kiingereza kutoka maabara moja tu.
Ukaguzi mitano kabla ya kuiamini alama
Makala inamalizia kwa ushauri wa vitendo: ripoti wigo wa maamuzi katika mipangilio yenye mantiki badala ya namba moja; weka mpangilio usioegemea upande wowote mapema; rekebisha katika eneo husika na upime kutokubaliana kunakobaki; jaribu ni nini kingine mtathmini anakinasa; na chukulia badiliko lolote la modeli, programu, unakili au maneno kama chombo kipya. Kama mwandishi anavyosema, kubadilisha jinsi tunavyouliza kunapobadilisha tunayemtambua, chombo kinakuwa sehemu ya maelezo.
