LLM tokenizeri necə işləyir?
Azərbaycan dili üçün nativ qurulmuş, tamamilə öz infrastrukturunuzda işləyən ilk böyük dil modeli. 587B, 99B və 39B ölçülərində.
LLM tokenizeri nədir və Azərbaycan dili üçün niyə vacibdir?
Tokenizer böyük dil modelinin (LLM) mətnlə işləməzdən əvvəl onu kiçik mənalı vahidlərə — tokenlərə — parçalayan əsas komponentdir. Bu vahidlər söz, heca, şəkilçi və ya hərf qrupu ola bilər. Modelin hər hansı bir dili nə qədər dərindən başa düşdüyü birbaşa tokenizerin həmin dilin fonetik, morfoloji və əlifba xüsusiyyətlərinə nə dərəcədə uyğunlaşdırılmasından asılıdır. Azərbaycan dili kimi aqqlütinativ quruluşa malik, zəngin şəkilçi sisteminə və ə, ş, ç, ğ, ı, ö, ü kimi özünəməxsus simvollara sahib dillər üçün nativ tokenizer olmadan model həm daha az dəqiq, həm də əhəmiyyətli dərəcədə daha az səmərəli işləyir. Ümumi tokenizerlər bu xüsusiyyətləri nəzərə almadığından eyni məzmunu çox daha çox tokenə parçalayır, bu isə həm hesablama xərclərini artırır, həm də mənalı çıxışın keyfiyyətini aşağı salır. Allmaz-ın Azərbaycan dili üçün xüsusi olaraq hazırlanmış nativ tokenizeri bu problemi kökündən həll edir. 651 milyondan çox seçilmiş Azərbaycan sözü əsasında qurulmuş bu tokenizer, söz kökü ilə şəkilçiləri düzgün ayırır, Azərbaycan əlifbasının bütün simvollarını ayrıca tanıyır və eyni mətni ümumi tokenizerlərə nisbətən 4,6 dəfə daha az tokenə çevirir. Nəticədə model daha az resursla daha çox məzmunu emal edir, cavabların dəqiqliyi artır və real Azərbaycan dili istifadəsi tam şəkildə əks olunur. Bu tokenizer 587B, 99B və 39B parametrli bütün model versiyalarında vahid şəkildə tətbiq olunur.
Nativ tokenizerin əsas üstünlükləri
Azərbaycan mətni üzərində 4,6 dəfə daha yüksək səmərəlilik — eyni məzmun ümumi tokenizerlərə nisbətən çox daha az tokenə çevrilir, bu da sürəti artırır və hesablama xərclərini azaldır
ə, ş, ç, ğ, ı, ö, ü kimi Azərbaycan əlifbası simvolları ayrıca tanınır — simvol səviyyəsindəki xətalar aradan qalxır, məna itkisi yaşanmır
Aqqlütinativ söz formalarını — şəkilçiləri, hal sonluqlarını, fel şəkillərini — düzgün parçalayır, buna görə model qrammatik formaları daha dəqiq başa düşür
651 milyondan çox seçilmiş Azərbaycan sözü üzərində öyrədilmiş modellə tam uyum — söz ehtiyatı real dil istifadəsini əks etdirir
11 fənn üzrə 38 139 yerli sualdan ibarət TUMLU meyarı ilə yoxlanılmış etibarlılıq — performans real Azərbaycan dili biliyi əsasında ölçülüb
Məlumatlar şəbəkənizdən heç vaxt çıxmır — model tam yerli infrastrukturda işləyir, məlumat təhlükəsizliyi tam təmin olunur
Tokenizerin əsas xüsusiyyətləri
Azərbaycan əlifbasına tam dəstək
ə, ş, ç, ğ, ı, ö, ü kimi Azərbaycan hərfləri ayrıca simvol kimi tanınır. Bu, mənanın düzgün qorunmasını və çıxışın oxunaqlılığını tam təmin edir.
Aqqlütinativ morfologiya dəstəyi
Azərbaycan dilindəki söz kökü ilə şəkilçi strukturu tokenizer tərəfindən düzgün ayrılır; buna görə model qrammatik formaları, hal şəkillərini və fel çəkilərini daha dəqiq başa düşür.
Yüksək sıxışdırma nisbəti
Azərbaycan mətni ümumi tokenizerlərə nisbətən 4,6 dəfə daha az tokenə çevrilir. Bu, həm emal sürətini artırır, həm də hesablama xərclərini əhəmiyyətli dərəcədə azaldır.
Böyük həcmli yerli korpus
Tokenizer 651 milyondan çox seçilmiş Azərbaycan sözü əsasında qurulub; söz ehtiyatı real dil istifadəsini tam şəkildə əks etdirir.
Çox ölçülü model dəstəyi
Eyni tokenizer 587B, 99B və 39B parametrli bütün model versiyalarında istifadə olunur — müxtəlif infrastruktur tələblərinə və büdcə imkanlarına uyğunlaşır.
Tokenizasiya prosesi addım-addım
Tez-tez verilən suallar
Niyə ümumi tokenizerlər Azərbaycan dili üçün kifayət etmir?
Ümumi tokenizerlər əsasən ingilis və bir sıra digər Avropa dilləri üçün optimallaşdırılıb. Azərbaycan dilinin aqqlütinativ quruluşu — zəngin şəkilçi sistemi, hal sonluqları, fel çəkiləri — və özünəməxsus əlifbası bu tokenizerlər tərəfindən düzgün işlənmir. Nəticədə eyni məzmun çox daha çox tokenə parçalanır, bu isə həm dəqiqliyi, həm də emal səmərəliliyini əhəmiyyətli dərəcədə aşağı salır.
4,6 dəfə səmərəlilik praktikada nə deməkdir?
Eyni Azərbaycan mətni nativ tokenizerlə ümumi tokenizerlərə nisbətən 4,6 dəfə daha az tokenə çevrilir. Bu o deməkdir ki, model eyni hesablama resursu ilə daha çox məzmunu emal edə bilir, cavab sürəti artır və infrastruktur xərcləri azalır.
TUMLU meyarı nədir və niyə əhəmiyyətlidir?
TUMLU 11 fərqli fənn üzrə 38 139 yerli Azərbaycan sualından ibarət müstəqil qiymətləndirmə meyarıdır. Bu meyar modelin real Azərbaycan dili biliyini, məntiqi düşüncəsini və fənlərarası anlayışını ölçür. TUMLU üzrə yoxlama modelin yalnız texniki deyil, həm də məzmun baxımından etibarlı olduğunu təsdiqləyir.
Məlumatlarım haraya göndərilir, bulud xidmətindən istifadə olunurmu?
Heç bir məlumat xaricə göndərilmir. Model tam yerli infrastrukturda — on-premise — işləyir. Məlumatlarınız şəbəkənizdən heç vaxt çıxmır, üçüncü tərəf bulud mühitinə ötürülmür.
Hansı model ölçüsünü seçməliyəm?
587B, 99B və 39B olmaqla üç ölçü mövcuddur. Seçim infrastruktur imkanlarınıza, gözlənilən yük həcminə və tətbiqin dəqiqlik tələblərinə görə müəyyənləşdirilir. Allmaz komandası mövcud resurslarınızı və iş tələblərinizi nəzərə alaraq sizin üçün ən uyğun variantı müəyyən etməyə kömək edə bilər.
Azərbaycan dili üçün qurulmuş modeli sınayın
Allmaz-ın Azərbaycan dilinə nativ LLM-i haqqında ətraflı məlumat almaq və ya demo tələb etmək üçün bizimlə əlaqə saxlayın — məlumatlarınız həmişə öz şəbəkənizdə qalır.
Demo tələb edin