SLM optimizasiyasında uzunluğa görə toplu işləmə sürəti necə artırılır?
...
Süni intellekt
Oxumaq vaxt alır?
Məqalələri dinləyə bilərsizUzunluğa görə toplu işləmə SLM optimizasiyasında yeni yanaşma
Süni intellekt modellərinin işləmə sürətini artırmaq və yaddaşdan səmərəli istifadə etmək hər zaman prioritet olub. M2 Macbook Air-də aparılan təcrübələr göstərir ki, uzunluğa görə toplu işləmə kiçik dil modellərində (SLM) böyük üstünlüklər yaradır.
Test mühiti və istifadə olunan model
Testlərdə Qwen2.5-0.5B-Instruct modeli float32 formatında Hugging Face Transformers vasitəsilə işlədilib. M2 Macbook Air-də 24GB RAM və 16 nüvəli Neural Engine istifadə olunub. Bu qurğu yaddaş ötürmə məhdudiyyətlərini aşmaq üçün ideal mühit təmin edir.
Tək-tək işləmə və toplu işləmə arasındakı fərq
Ənənəvi tək-tək işləmə zamanı hər bilet ayrı-ayrılıqda işlənir ki, bu da yaddaş ötürmə problemlərinə yol açır. Uzunluğa görə toplu işləmə isə yaddaş yükünü çoxlu ardıcıllıqlara bölür və onları uzunluğa görə sıralayır. Bu sıralama hər toplunun öz lokal maksimumuna uyğun yastıqlanmasını təmin edir və yastıqlama overhead-ni 7.6%-ə qədər azaldır.
Performans göstəriciləri
600 bilet üzərində aparılan testdə tək-tək işləmə 144.35 saniyə çəkərkən, uzunluğa görə toplu işləmə yalnız 79.60 saniyə vaxt tələb edib. Bu da toplu işləmənin 7.5 bilet/saniyə sürəti ilə tək-tək işləmənin 4.2 bilet/saniyə sürətindən təxminən iki dəfə sürətli olduğunu göstərir.
Texniki incəliklər və nəticələr
Yastıqlama sol tərəfdən edilir ki, son token həqiqi son token kimi qəbul olunsun. Model çıxışında yalnız son token üçün logitlər tələb olunur. Toplu işləmə və prefix keşinq birlikdə istifadə edilərkən diqqətli yanaşma tələb olunur. Ən önəmlisi isə toplu işləmə nəticələrinin tək-tək işləmə ilə tam uyğun gəlməsidir.
Nəticə
Uzunluğa görə toplu işləmə kiçik dil modellərində yaddaş ötürmə məhdudiyyətlərini aradan qaldıraraq, hesablama resurslarından daha səmərəli istifadə etməyə imkan verir. Bu yanaşma eyni model və eyni məlumat üzərində iki dəfə sürət artımı təmin edir, nəticələrin dəqiqliyi isə tam təmin olunur.
Bu optimizasiya texnologiya sahəsində sürət və yaddaş istifadəsini balanslaşdıraraq, daha effektiv süni intellekt tətbiqlərinin inkişafına imkan yaradır. Gələcəkdə uzunluğa görə toplu işləmə SLM modellərində daha geniş tətbiq edilərək, süni intellekt performansını yeni səviyyəyə qaldıra bilər.