LLM-lərin Qiymətləndirmədə Qərəzləri: İnsan Faktoru Nə Dərəcədə Təsirlidir?

Link kopyalandı

...

Bu gün, 15:30

Süni intellekt

Oxumaq vaxt alır?

Məqalələri dinləyə bilərsiz

Süni intellektdə qiymətləndirmə qərəzləri necə yaranır

Böyük dil modelləri (LLM) insan tərəfindən yaradılmış məlumatlardan öyrəndikləri üçün qiymətləndirmə prosesində qərəzlərə yol verirlər. Bu qərəzlər cavabların keyfiyyətini qiymətləndirərkən fərqli nəticələrə səbəb olur və süni intellektin obyektivliyinə təsir göstərir.

Pozisiya və emosional tonun təsiri

LLM-lər cavabların yerləşdiyi mövqeyə görə fərqli qiymətlər verirlər. Məsələn, uzun cavablar qısa cavablardan üstün tutulur, çünki model uzunluğu daha çox səy və ekspertizaya işarə kimi qəbul edir. Eyni zamanda, emosional ton da qiymətləndirməyə təsir edir — müsbət və ya neytral tonlu cavablar daha yüksək bal alır, qorxu və qəzəb kimi mənfi tonlar isə cavabların qiymətini aşağı sala bilir.

Özünü üstün tutma və qərəzli yanaşmalar

Model öz yazdığı cavabları digər modellərin cavablarından üstün qiymətləndirir. Bundan əlavə, müəyyən ölkə, şirkət və şəxslərə qarşı qərəzlər mövcuddur. Qiymətləndirmədə kimlik məlumatlarının verilməsi və istinadların əlavə olunması da nəticələrə təsir edir; hətta saxta istinadlar belə cavabın qiymətini artıra bilir.

Qərəzlərin ölçülməsi və yeni qiymətləndiricilər

Analitiklər pozisiya qərəzini ölçmək üçün testlər aparıblar və bandwagon qərəzinin — yəni konsensusun təsirinin — 60% və 90% səviyyəsində oxşar olduğunu müəyyən ediblər. MiniCheck-FT5 modeli 770 milyon parametrə malikdir və GPT-4 səviyyəsində dəqiqlik təmin edir, qiymətləndirmə sürəti isə təxminən 200 millisekunddur, bu da GPT-4-dən 400 dəfə sürətlidir. 70 milyard parametrli Lynx modeli isə GPT-4-dən daha yaxşı nəticələr göstərir.

Ekspert rəyi və qərəzlərin azaldılması yolları

Soumil Jain bildirir ki, “LLM-lərə hakim kimi tam güvənmək olmaz, mən onları qiymətləndirmədə istifadə etməməyə üstünlük verirəm.” Eyni modeli həm cavab yaratmaq, həm də qiymətləndirmək üçün istifadə etmək qərəzi artır. Buna görə qiymətləndirmə sualları daraldılmalı və xüsusi hazırlanmış qiymətləndiricilərdən istifadə edilməlidir.

İnsan və texnologiyanın qarşılıqlı təsiri

Bu qərəzlər süni intellektin qərarlarında insan təsirinin hələ də əhəmiyyətli olduğunu göstərir. Qiymətləndirmədəki qərəzlər texnologiyanın obyektivliyinə şübhə yaradır və gələcəkdə daha şəffaf və ədalətli qiymətləndirmə mexanizmlərinin inkişaf etdirilməsinin vacibliyini vurğulayır.

Link kopyalandı