Lüğət

LLM tokenizeri necə işləyir?

Azərbaycan dili üçün nativ qurulmuş, tamamilə öz infrastrukturunuzda işləyən ilk böyük dil modeli. 587B, 99B və 39B ölçülərində.

LLM tokenizeri nədir və Azərbaycan dili üçün niyə vacibdir?

Tokenizer böyük dil modelinin (LLM) mətnlə işləməzdən əvvəl onu kiçik mənalı vahidlərə — tokenlərə — parçalayan əsas komponentdir. Bu vahidlər söz, heca, şəkilçi və ya hərf qrupu ola bilər. Modelin hər hansı bir dili nə qədər dərindən başa düşdüyü birbaşa tokenizerin həmin dilin fonetik, morfoloji və əlifba xüsusiyyətlərinə nə dərəcədə uyğunlaşdırılmasından asılıdır. Azərbaycan dili kimi aqqlütinativ quruluşa malik, zəngin şəkilçi sisteminə və ə, ş, ç, ğ, ı, ö, ü kimi özünəməxsus simvollara sahib dillər üçün nativ tokenizer olmadan model həm daha az dəqiq, həm də əhəmiyyətli dərəcədə daha az səmərəli işləyir. Ümumi tokenizerlər bu xüsusiyyətləri nəzərə almadığından eyni məzmunu çox daha çox tokenə parçalayır, bu isə həm hesablama xərclərini artırır, həm də mənalı çıxışın keyfiyyətini aşağı salır. Allmaz-ın Azərbaycan dili üçün xüsusi olaraq hazırlanmış nativ tokenizeri bu problemi kökündən həll edir. 651 milyondan çox seçilmiş Azərbaycan sözü əsasında qurulmuş bu tokenizer, söz kökü ilə şəkilçiləri düzgün ayırır, Azərbaycan əlifbasının bütün simvollarını ayrıca tanıyır və eyni mətni ümumi tokenizerlərə nisbətən 4,6 dəfə daha az tokenə çevirir. Nəticədə model daha az resursla daha çox məzmunu emal edir, cavabların dəqiqliyi artır və real Azərbaycan dili istifadəsi tam şəkildə əks olunur. Bu tokenizer 587B, 99B və 39B parametrli bütün model versiyalarında vahid şəkildə tətbiq olunur.

İmkanlar

Nativ tokenizerin əsas üstünlükləri

Azərbaycan mətni üzərində 4,6 dəfə daha yüksək səmərəlilik — eyni məzmun ümumi tokenizerlərə nisbətən çox daha az tokenə çevrilir, bu da sürəti artırır və hesablama xərclərini azaldır

ə, ş, ç, ğ, ı, ö, ü kimi Azərbaycan əlifbası simvolları ayrıca tanınır — simvol səviyyəsindəki xətalar aradan qalxır, məna itkisi yaşanmır

Aqqlütinativ söz formalarını — şəkilçiləri, hal sonluqlarını, fel şəkillərini — düzgün parçalayır, buna görə model qrammatik formaları daha dəqiq başa düşür

651 milyondan çox seçilmiş Azərbaycan sözü üzərində öyrədilmiş modellə tam uyum — söz ehtiyatı real dil istifadəsini əks etdirir

11 fənn üzrə 38 139 yerli sualdan ibarət TUMLU meyarı ilə yoxlanılmış etibarlılıq — performans real Azərbaycan dili biliyi əsasında ölçülüb

Məlumatlar şəbəkənizdən heç vaxt çıxmır — model tam yerli infrastrukturda işləyir, məlumat təhlükəsizliyi tam təmin olunur

Tokenizerin əsas xüsusiyyətləri

Azərbaycan əlifbasına tam dəstək

ə, ş, ç, ğ, ı, ö, ü kimi Azərbaycan hərfləri ayrıca simvol kimi tanınır. Bu, mənanın düzgün qorunmasını və çıxışın oxunaqlılığını tam təmin edir.

Aqqlütinativ morfologiya dəstəyi

Azərbaycan dilindəki söz kökü ilə şəkilçi strukturu tokenizer tərəfindən düzgün ayrılır; buna görə model qrammatik formaları, hal şəkillərini və fel çəkilərini daha dəqiq başa düşür.

Yüksək sıxışdırma nisbəti

Azərbaycan mətni ümumi tokenizerlərə nisbətən 4,6 dəfə daha az tokenə çevrilir. Bu, həm emal sürətini artırır, həm də hesablama xərclərini əhəmiyyətli dərəcədə azaldır.

Böyük həcmli yerli korpus

Tokenizer 651 milyondan çox seçilmiş Azərbaycan sözü əsasında qurulub; söz ehtiyatı real dil istifadəsini tam şəkildə əks etdirir.

Çox ölçülü model dəstəyi

Eyni tokenizer 587B, 99B və 39B parametrli bütün model versiyalarında istifadə olunur — müxtəlif infrastruktur tələblərinə və büdcə imkanlarına uyğunlaşır.

Tokenizasiya prosesi addım-addım

1Giriş mətni oxunur və Azərbaycan əlifbasına uyğun olaraq simvol səviyyəsində normallaşdırılır — xüsusi hərflər düzgün tanınır.
2Mətn söz köklərinə və şəkilçilərinə ayrılır; aqqlütinativ quruluş tam nəzərə alınır.
3Hər parça öyrədilmiş lüğətdəki uyğun tokenə çevrilir; nadir formalar alt-token kombinasiyasına bölünür, məna itkisi minimuma endirilir.
4Token ardıcıllığı rəqəmsal identifikatorlara çevrilir və modelin giriş qatına ötürülür.
5Model cavab yaradır; çıxış tokenləri yenidən tam oxunaqlı Azərbaycan mətninə çevrilir.

Tez-tez verilən suallar

Niyə ümumi tokenizerlər Azərbaycan dili üçün kifayət etmir?

Ümumi tokenizerlər əsasən ingilis və bir sıra digər Avropa dilləri üçün optimallaşdırılıb. Azərbaycan dilinin aqqlütinativ quruluşu — zəngin şəkilçi sistemi, hal sonluqları, fel çəkiləri — və özünəməxsus əlifbası bu tokenizerlər tərəfindən düzgün işlənmir. Nəticədə eyni məzmun çox daha çox tokenə parçalanır, bu isə həm dəqiqliyi, həm də emal səmərəliliyini əhəmiyyətli dərəcədə aşağı salır.

4,6 dəfə səmərəlilik praktikada nə deməkdir?

Eyni Azərbaycan mətni nativ tokenizerlə ümumi tokenizerlərə nisbətən 4,6 dəfə daha az tokenə çevrilir. Bu o deməkdir ki, model eyni hesablama resursu ilə daha çox məzmunu emal edə bilir, cavab sürəti artır və infrastruktur xərcləri azalır.

TUMLU meyarı nədir və niyə əhəmiyyətlidir?

TUMLU 11 fərqli fənn üzrə 38 139 yerli Azərbaycan sualından ibarət müstəqil qiymətləndirmə meyarıdır. Bu meyar modelin real Azərbaycan dili biliyini, məntiqi düşüncəsini və fənlərarası anlayışını ölçür. TUMLU üzrə yoxlama modelin yalnız texniki deyil, həm də məzmun baxımından etibarlı olduğunu təsdiqləyir.

Məlumatlarım haraya göndərilir, bulud xidmətindən istifadə olunurmu?

Heç bir məlumat xaricə göndərilmir. Model tam yerli infrastrukturda — on-premise — işləyir. Məlumatlarınız şəbəkənizdən heç vaxt çıxmır, üçüncü tərəf bulud mühitinə ötürülmür.

Hansı model ölçüsünü seçməliyəm?

587B, 99B və 39B olmaqla üç ölçü mövcuddur. Seçim infrastruktur imkanlarınıza, gözlənilən yük həcminə və tətbiqin dəqiqlik tələblərinə görə müəyyənləşdirilir. Allmaz komandası mövcud resurslarınızı və iş tələblərinizi nəzərə alaraq sizin üçün ən uyğun variantı müəyyən etməyə kömək edə bilər.

Azərbaycan dili üçün qurulmuş modeli sınayın

Allmaz-ın Azərbaycan dilinə nativ LLM-i haqqında ətraflı məlumat almaq və ya demo tələb etmək üçün bizimlə əlaqə saxlayın — məlumatlarınız həmişə öz şəbəkənizdə qalır.

Demo tələb edin