LLM-lərdə KV Cache İdarəetməsində İnqilabi Yeniliklər Nə vəd edir?

Link kopyalandı

...

Bu gün, 18:00

Süni intellekt

Oxumaq vaxt alır?

Məqalələri dinləyə bilərsiz

LLM-lərdə KV Cache İdarəetməsinin Əhəmiyyəti

Müasir böyük dil modelləri (LLM) KV cache idarəetməsinə əsaslanır. Bu texnologiya modellərin sürətli və effektiv işləməsi üçün vacib olsa da, GPU yaddaşının çox istehlakına səbəb olur. Məsələn, Llama-3 8B modelində token başına KV cache ölçüsü təxminən 128 KiB təşkil edir, 100,000 token üçün isə təxminən 12.8 GiB yaddaş tələb olunur.

PagedAttention: Yaddaş Bloklarına Bölünmə və Paylaşım

PagedAttention yaddaş bölgüsünü təkmilləşdirərək KV cache-i 16 və ya 32 tokenlik bloklara ayırır. Bu bloklar yalnız lazım olduqda ayrılır və copy-on-write mexanizmi ilə paylaşılır. Beləliklə, daxili və xarici parçalanma aradan qaldırılır, yaddaş istifadəsi optimallaşır və GPU yaddaşından daha səmərəli istifadə olunur.

RadixAttention: Təkrar Prefikslərin İdarə Edilməsi

RadixAttention KV cache-i radix ağacında saxlayır və təkrar prefiksləri tapıb istifadə edir. Bu yanaşma hesablama təkrarlanmasını azaldır və Time to First Token (TTFT) gecikməsini minimuma endirir. Beləliklə, eyni prefikslərlə başlayan sorğular üçün əlavə hesablama aparılmır.

Fərqli Problemlərə Fərqli Həllər

PagedAttention yaddaş təyinatı strategiyasıdır və GPU yaddaşındakı parçalanmanı aradan qaldırır. RadixAttention isə keşi təkrar istifadə strategiyasıdır və artıq hesablanmış KV vəziyyətlərini yenidən istifadə etməklə hesablama yükünü azaldır. Hər iki metod LLM-lərin yaddaş və hesablama səmərəliliyini artırmaq üçün fərqli problemləri həll edir və birgə istifadə olunur.

vLLM və Təhlükəsizlik Yenilikləri

vLLM chain hashing üsulu ilə prefiks keşi həyata keçirir, RadixAttention isə radix ağacı istifadə edir. Cache salting texnikası isə çoxtenantlı mühitdə tenantlar arasında məlumat sızmasının qarşısını alır. Hierarxik KV keşi GPU, CPU və paylanmış yaddaşda idarə olunur. Cache-aware routing isə eyni prefiksli sorğuları eyni replikaya yönəldərək performansı artırır.

İnsanlara Təsiri və Gələcəyə Baxış

Bu texnologiyalar LLM-lərin daha az yaddaşla daha sürətli işləməsinə imkan verir. Nəticədə, süni intellekt tətbiqləri daha geniş istifadəçi kütləsinə çatır, xidmət keyfiyyəti yüksəlir və hesablama xərcləri azalır. Bu yeniliklər süni intellektin gündəlik həyatımıza daha dərindən inteqrasiyasını sürətləndirir.

Link kopyalandı