LLM-lərdə KV Cache İdarəetməsində İnqilabi Yeniliklər Nə vəd edir?
...
Süni intellekt
Oxumaq vaxt alır?
Məqalələri dinləyə bilərsizLLM-lərdə KV Cache İdarəetməsinin Əhəmiyyəti
Müasir böyük dil modelləri (LLM) KV cache idarəetməsinə əsaslanır. Bu texnologiya modellərin sürətli və effektiv işləməsi üçün vacib olsa da, GPU yaddaşının çox istehlakına səbəb olur. Məsələn, Llama-3 8B modelində token başına KV cache ölçüsü təxminən 128 KiB təşkil edir, 100,000 token üçün isə təxminən 12.8 GiB yaddaş tələb olunur.
PagedAttention: Yaddaş Bloklarına Bölünmə və Paylaşım
PagedAttention yaddaş bölgüsünü təkmilləşdirərək KV cache-i 16 və ya 32 tokenlik bloklara ayırır. Bu bloklar yalnız lazım olduqda ayrılır və copy-on-write mexanizmi ilə paylaşılır. Beləliklə, daxili və xarici parçalanma aradan qaldırılır, yaddaş istifadəsi optimallaşır və GPU yaddaşından daha səmərəli istifadə olunur.
RadixAttention: Təkrar Prefikslərin İdarə Edilməsi
RadixAttention KV cache-i radix ağacında saxlayır və təkrar prefiksləri tapıb istifadə edir. Bu yanaşma hesablama təkrarlanmasını azaldır və Time to First Token (TTFT) gecikməsini minimuma endirir. Beləliklə, eyni prefikslərlə başlayan sorğular üçün əlavə hesablama aparılmır.
Fərqli Problemlərə Fərqli Həllər
PagedAttention yaddaş təyinatı strategiyasıdır və GPU yaddaşındakı parçalanmanı aradan qaldırır. RadixAttention isə keşi təkrar istifadə strategiyasıdır və artıq hesablanmış KV vəziyyətlərini yenidən istifadə etməklə hesablama yükünü azaldır. Hər iki metod LLM-lərin yaddaş və hesablama səmərəliliyini artırmaq üçün fərqli problemləri həll edir və birgə istifadə olunur.
vLLM və Təhlükəsizlik Yenilikləri
vLLM chain hashing üsulu ilə prefiks keşi həyata keçirir, RadixAttention isə radix ağacı istifadə edir. Cache salting texnikası isə çoxtenantlı mühitdə tenantlar arasında məlumat sızmasının qarşısını alır. Hierarxik KV keşi GPU, CPU və paylanmış yaddaşda idarə olunur. Cache-aware routing isə eyni prefiksli sorğuları eyni replikaya yönəldərək performansı artırır.
İnsanlara Təsiri və Gələcəyə Baxış
Bu texnologiyalar LLM-lərin daha az yaddaşla daha sürətli işləməsinə imkan verir. Nəticədə, süni intellekt tətbiqləri daha geniş istifadəçi kütləsinə çatır, xidmət keyfiyyəti yüksəlir və hesablama xərcləri azalır. Bu yeniliklər süni intellektin gündəlik həyatımıza daha dərindən inteqrasiyasını sürətləndirir.