LLM-lərin Qiymətləndirmədə Qərəzləri: İnsan Faktoru Nə Dərəcədə Təsirlidir?
...
Süni intellekt
Oxumaq vaxt alır?
Məqalələri dinləyə bilərsizSüni intellektdə qiymətləndirmə qərəzləri necə yaranır
Böyük dil modelləri (LLM) insan tərəfindən yaradılmış məlumatlardan öyrəndikləri üçün qiymətləndirmə prosesində qərəzlərə yol verirlər. Bu qərəzlər cavabların keyfiyyətini qiymətləndirərkən fərqli nəticələrə səbəb olur və süni intellektin obyektivliyinə təsir göstərir.
Pozisiya və emosional tonun təsiri
LLM-lər cavabların yerləşdiyi mövqeyə görə fərqli qiymətlər verirlər. Məsələn, uzun cavablar qısa cavablardan üstün tutulur, çünki model uzunluğu daha çox səy və ekspertizaya işarə kimi qəbul edir. Eyni zamanda, emosional ton da qiymətləndirməyə təsir edir — müsbət və ya neytral tonlu cavablar daha yüksək bal alır, qorxu və qəzəb kimi mənfi tonlar isə cavabların qiymətini aşağı sala bilir.
Özünü üstün tutma və qərəzli yanaşmalar
Model öz yazdığı cavabları digər modellərin cavablarından üstün qiymətləndirir. Bundan əlavə, müəyyən ölkə, şirkət və şəxslərə qarşı qərəzlər mövcuddur. Qiymətləndirmədə kimlik məlumatlarının verilməsi və istinadların əlavə olunması da nəticələrə təsir edir; hətta saxta istinadlar belə cavabın qiymətini artıra bilir.
Qərəzlərin ölçülməsi və yeni qiymətləndiricilər
Analitiklər pozisiya qərəzini ölçmək üçün testlər aparıblar və bandwagon qərəzinin — yəni konsensusun təsirinin — 60% və 90% səviyyəsində oxşar olduğunu müəyyən ediblər. MiniCheck-FT5 modeli 770 milyon parametrə malikdir və GPT-4 səviyyəsində dəqiqlik təmin edir, qiymətləndirmə sürəti isə təxminən 200 millisekunddur, bu da GPT-4-dən 400 dəfə sürətlidir. 70 milyard parametrli Lynx modeli isə GPT-4-dən daha yaxşı nəticələr göstərir.
Ekspert rəyi və qərəzlərin azaldılması yolları
Soumil Jain bildirir ki, “LLM-lərə hakim kimi tam güvənmək olmaz, mən onları qiymətləndirmədə istifadə etməməyə üstünlük verirəm.” Eyni modeli həm cavab yaratmaq, həm də qiymətləndirmək üçün istifadə etmək qərəzi artır. Buna görə qiymətləndirmə sualları daraldılmalı və xüsusi hazırlanmış qiymətləndiricilərdən istifadə edilməlidir.
İnsan və texnologiyanın qarşılıqlı təsiri
Bu qərəzlər süni intellektin qərarlarında insan təsirinin hələ də əhəmiyyətli olduğunu göstərir. Qiymətləndirmədəki qərəzlər texnologiyanın obyektivliyinə şübhə yaradır və gələcəkdə daha şəffaf və ədalətli qiymətləndirmə mexanizmlərinin inkişaf etdirilməsinin vacibliyini vurğulayır.