NLP-ресурсы

DOLLMA — Корпус азербайджанского языка

DOLLMA — корпус для азербайджанского языка объёмом 651M words. Область: general · news · legal. Лицензия: CC-BY-SA. В реестре NLP-ресурсов азербайджанского языка Allmaz.

Описание

Primary LLM pretraining corpus

Тип
corpus
Объём
651M words
Область
general · news · legal
Лицензия
CC-BY-SA
Источник
HuggingFace / allmalab
Слой
2