KHAZRI
  • Ana səhifə
  • Modellər
  • Datasets
  • Bloq
  • FAQ
  • Əlaqə
Bizimlə əlaqə

DATASETS / KHAZRI CORPUS

Azərbaycan dili üçün açıq mətn korpusu

Khazri Corpus — 570-dən çox kitab və rəsmi hüquqi mətnlərdən hazırlanmış, təmizlənmiş Azərbaycan dili korpusu. NLP tədqiqatları və dil modellərinin hazırlanması üçün.

SOFTYU GROUP · AZERBAIJANI / AZ

Khazri Corpus

Korpus haqqında

Bədii, elmi, siyasi və hüquqi üslubları bir araya gətirən Khazri Corpus açıq əlçatan mənbələrdən toplanıb. Mətnlər səs-küydən təmizlənərək cümlə və qısa abzaslar şəklində təqdim edilir. Korpus Khazri 3 modelinin təlimində istifadə olunub.

Hugging Face-də bax
təxmini sətir
~840K
mənbə kitab
570+
mövzu bölməsi
5
mətn sahəsi
text

Korpusun tərkibi

Khazri Corpus — Korpusun tərkibi
BölməMəzmun və mənbəFormatSətir sayı
bediiBədii ədəbiyyat və nəsr · 300+ kitabParquet696.848
elmiElmi və akademik mətnlər · 200+ kitabParquet79.157
siyasetSiyasi mətnlər · 70+ kitabParquet46.462
vergiAzərbaycan Respublikasının Vergi MəcəlləsiParquet2.178
mulk-mecelle/Azərbaycan Respublikasının Mülki MəcəlləsiJSONL7.701
Sadalanan bölmələrin cəmi832.346

Ümumi həcm təxminən 840 min sətirdir; sadalanan beş bölmənin cəmi 832 346-dır. “default” konfiqurasiyası ayrıca mövzu bölməsi kimi sayılmır.

PYTHON / HUGGING FACE

Korpusla işə başlayın

Hugging Face datasets kitabxanası ilə bir bölməni yükləyin və ya dörd Parquet bölməsini birləşdirin.

pip install datasets
from datasets import load_dataset, concatenate_datasets

bedii = load_dataset("softyugroup/khazri-corpus", "bedii", split="train")
print(bedii[0]["text"])

subsets = ["bedii", "elmi", "siyaset", "vergi"]
corpus = concatenate_datasets([
    load_dataset("softyugroup/khazri-corpus", name, split="train")
    for name in subsets
])

Bu kod dörd Parquet bölməsini birləşdirir (824 645 sətir). Mülki Məcəllə ayrıca mulk-mecelle/ qovluğunda JSONL kimi verilir; load_dataset üçün ayrıca konfiqurasiya deyil.

JSONL fayllarına bax

Sadə data formatı

Hər sətirdə yalnız bir text (string) sahəsi var: təmizlənmiş Azərbaycan dili cümləsi və ya qısa abzas. Kitab metadataları və sənəd sərhədləri daxil deyil.

{"text": "Bu adı Qərbi Azərbaycanda yaşamış orta və yaşlı nəsil həmişə böyük ehtiramla xatırlayır."}

İstifadə sahələri

  • Azərbaycan dili modellərinin ilkin və davamlı təlimi
  • Azərbaycan dili üçün tokenizatorların hazırlanması
  • Fine-tuning və mövzu sahəsinə uyğunlaşdırma
  • Linqvistik tədqiqatlar və NLP qiymətləndirmələri

Mənbələr və məhdudiyyətlər

  • Mətnlər açıq əlçatan kitablardan və rəsmi hüquqi mənbələrdən toplanıb; şəxsi istifadəçi məlumatı toplanmayıb.
  • Mətnlər müəlliflərin və dövrlərinin baxışlarını, üslubunu və mümkün qərəzlərini əks etdirə bilər.
  • Müəllif, kitab adı, il və sənəd sərhədləri kimi metadata daxil deyil.

Lisenziya

CC BY-NC-ND 4.0

Korpus CC BY-NC-ND 4.0 lisenziyası ilə yayımlanır. Müəllifə istinadla qeyri-kommersiya paylaşımı nəzərdə tutulur; dəyişdirilmiş versiyaların yayılmasına icazə verilmir. İstifadə zamanı tam lisenziya şərtlərinə baxın.

İstinad

@misc{khazri_corpus,
  title        = {Khazri Corpus: A Clean Azerbaijani Text Corpus},
  author       = {SoftYu Group},
  howpublished = {\url{https://huggingface.co/datasets/softyugroup/khazri-corpus}},
  note         = {Hugging Face dataset}
}
KHAZRI

Azərbaycan dilində yerli, müasir və daha müstəqil süni intellekt infrastrukturu qururuq.

Kəşf et

  • Modellər
  • Datasets
  • Bloq
  • FAQ
  • Əlaqə

Əlaqə

  • +994 77 308 76 77
  • contact@khazri.dev
  • Hugging Face

© 2026 Khazri. Bütün hüquqlar qorunur.

Khazri modeli Softyu-ya məxsusdur.