Böyük dil modeli (LLM) nədir?
Azərbaycan dili üçün nativ qurulmuş, tamamilə öz infrastrukturunuzda işləyən ilk böyük dil modeli. 587B, 99B və 39B ölçülərində.
Azərbaycan dili üçün böyük dil modeli (LLM) nədir?
Böyük dil modeli (LLM — Large Language Model), çox miqdarda mətn üzərində öyrədilmiş süni intellekt modelidir: mətn yaradır, sualları cavablandırır, xülasə çıxarır və dilin incəliklərini dərindən anlayır. Dünyada mövcud olan əksər LLM-lər ingilis dili üçün optimallaşdırılmışdır; Azərbaycan dili kimi aqqlütinativ quruluşa malik, zəngin şəkilçi sisteminə sahib dillər isə bu modellərdə lazımi səviyyədə təmsil olunmur. Nəticədə həmin modellər Azərbaycan mətni üzərində işləyərkən ciddi dəqiqlik itkisi yaşayır, çünki standart tokenizer-lər ə hərfini və söz kökü-şəkilçi əlaqələrini düzgün parçalaya bilmir.
Niyə Azərbaycan dili üçün xüsusi LLM lazımdır?
Azərbaycan dilinin ə hərfi və aqqlütinativ morfologiyası nativ tokenizer vasitəsilə düzgün işlənir — söz kökü ilə şəkilçilər arasındakı əlaqə itirilmir, dil dəqiqliyi qorunur.
Model Azərbaycan mətni üzərində ümumi modellərlə müqayisədə 4,6 dəfə daha səmərəli işləyir — bu, daha sürətli cavab vaxtı və aşağı infrastruktur xərcləri deməkdir.
651 milyondan çox seçilmiş Azərbaycan sözündən ibarət kurasiya edilmiş korpus üzərində öyrədilmiş model, dilin leksik və qrammatik zənginliyini dərindən mənimsəmişdir.
Məlumatlar heç vaxt şəbəkənizi tərk etmir — tam yerli yerləşdirmə ilə korporativ və şəxsi məlumatların məxfiliyi qeyd-şərtsiz təmin edilir.
587B, 99B və 39B parametr ölçüləri müxtəlif iş yükləri, aparat resursları və performans tələbləri üçün çevik seçim imkanı yaradır.
38 139 nativ sualdan ibarət TUMLU benchmark-ı üzərində 11 fənn üzrə aparılmış müstəqil doğrulama modelin real Azərbaycan dili tapşırıqlarındakı etibarlılığını sübut edir.
Əsas xüsusiyyətlər
Nativ Azərbaycan tokenizer-i
Xüsusi tokenizer ə hərfini və Azərbaycan dilinin aqqlütinativ söz quruluşunu düzgün parçalayır; söz kökü ilə şəkilçilər arasındakı əlaqə qorunur, beləliklə model dili daha yüksək dəqiqliklə anlayır.
Tam yerli (on-premise) yerləşdirmə
Model sizin öz infrastrukturunuzda işləyir. Heç bir sorğu, cavab və ya korporativ məlumat xarici serverə göndərilmir; məxfilik və uyğunluq tələbləri tam ödənilir.
Üç parametr ölçüsü
587B, 99B və 39B variantları ilə mövcud aparat resurslarınıza və performans tələblərinizə ən uyğun ölçünü seçə bilərsiniz — kiçik iş yüklərindən tutmuş ən tələbkar ssenarilərə qədər.
Geniş öyrətmə korpusu
651 milyondan çox seçilmiş Azərbaycan sözündən ibarət kurasiya edilmiş korpus modelin dərin dil biliyinin əsasını təşkil edir; leksik müxtəliflik və qrammatik dəqiqlik bu korpus sayəsində təmin edilir.
TUMLU benchmark doğrulaması
Model 38 139 nativ sualı əhatə edən, 11 fənni əhatə edən TUMLU benchmark-ı üzərində müstəqil şəkildə sınaqdan keçirilmişdir; nəticələr modelin real dünya tapşırıqlarındakı keyfiyyətini obyektiv şəkildə təsdiqləyir.
Yüksək hesablama səmərəliliyi
Azərbaycan mətni üzərində ümumi modellərlə müqayisədə 4,6 dəfə daha səmərəli işləmə qabiliyyəti hesablama xərclərini əhəmiyyətli dərəcədə azaldır və cavab sürətini artırır.
LLM necə işləyir?
Tez-tez verilən suallar
Bu model ümumi təyinatlı modellərdən nə ilə fərqlənir?
Əksər ümumi modellər ingilis dili üçün optimallaşdırılmışdır və Azərbaycan dilini məhdud, qeyri-dəqiq şəkildə dəstəkləyir. Bu model isə Azərbaycan dili üçün nativ olaraq qurulmuş, xüsusi tokenizer ilə təchiz edilmiş və 651 milyondan çox seçilmiş Azərbaycan sözündən ibarət korpus üzərində öyrədilmişdir. Nəticədə dil dəqiqliyi, morfologiya anlayışı və hesablama səmərəliliyi baxımından əhəmiyyətli üstünlük əldə edilir.
Məlumatlarımın təhlükəsizliyi necə təmin edilir?
Model tamamilə sizin öz infrastrukturunuzda işləyir. Heç bir sorğu, cavab, istifadəçi məlumatı və ya korporativ sənəd xarici serverə göndərilmir. Bu arxitektura həm məxfilik tələblərini, həm də müvafiq tənzimləyici uyğunluq öhdəliklərini ödəməyə imkan verir.
Hansı parametr ölçüsünü seçməliyəm?
Seçim mövcud aparat resurslarınıza və performans tələblərinizə bağlıdır. 39B yüngül iş yükləri və resurs məhdudiyyəti olan mühitlər üçün, 99B orta miqyaslı korporativ tətbiqlər üçün, 587B isə ən yüksək dəqiqlik və mürəkkəb tapşırıqlar tələb edən ssenarilər üçün tövsiyə edilir.
TUMLU benchmark nədir və nə üçün vacibdir?
TUMLU, 38 139 nativ Azərbaycan sualından ibarət, 11 fənni əhatə edən müstəqil qiymətləndirmə çərçivəsidir. Bu benchmark modelin yalnız texniki parametrlərini deyil, real Azərbaycan dili tapşırıqlarındakı faktiki keyfiyyətini ölçür; nəticələr modelin etibarlılığını obyektiv şəkildə təsdiqləyir.
4,6 dəfə səmərəlilik praktiki olaraq nə deməkdir?
Bu, modelin eyni həcmli Azərbaycan mətnini işləmək üçün ümumi modellərlə müqayisədə daha az hesablama resursu — prosessor vaxtı, yaddaş və enerji — sərf etdiyini bildirir. Praktiki nəticə olaraq daha sürətli cavab vaxtı, daha aşağı server xərcləri və eyni infrastrukturla daha çox paralel sorğunun idarə edilməsi mümkün olur.
Azərbaycan dili üçün qurulmuş LLM-i sınayın
Allmaz-ın Azərbaycan dilinə nativ LLM-i haqqında ətraflı məlumat almaq və ya demo tələb etmək üçün bizimlə əlaqə saxlayın — məlumatlarınız həmişə sizin şəbəkənizdə qalır.
Demo tələb edin