Khazri Corpus — 570-dən çox kitab və rəsmi hüquqi mətnlərdən hazırlanmış, təmizlənmiş Azərbaycan dili korpusu. NLP tədqiqatları və dil modellərinin hazırlanması üçün.
SOFTYU GROUP · AZERBAIJANI / AZ
Khazri Corpus
Korpus haqqında
Bədii, elmi, siyasi və hüquqi üslubları bir araya gətirən Khazri Corpus açıq əlçatan mənbələrdən toplanıb. Mətnlər səs-küydən təmizlənərək cümlə və qısa abzaslar şəklində təqdim edilir. Korpus Khazri 3 modelinin təlimində istifadə olunub.
Ümumi həcm təxminən 840 min sətirdir; sadalanan beş bölmənin cəmi 832 346-dır. “default” konfiqurasiyası ayrıca mövzu bölməsi kimi sayılmır.
PYTHON / HUGGING FACE
Korpusla işə başlayın
Hugging Face datasets kitabxanası ilə bir bölməni yükləyin və ya dörd Parquet bölməsini birləşdirin.
pip install datasets
from datasets import load_dataset, concatenate_datasets
bedii = load_dataset("softyugroup/khazri-corpus", "bedii", split="train")
print(bedii[0]["text"])
subsets = ["bedii", "elmi", "siyaset", "vergi"]
corpus = concatenate_datasets([
load_dataset("softyugroup/khazri-corpus", name, split="train")
for name in subsets
])
Bu kod dörd Parquet bölməsini birləşdirir (824 645 sətir). Mülki Məcəllə ayrıca mulk-mecelle/ qovluğunda JSONL kimi verilir; load_dataset üçün ayrıca konfiqurasiya deyil.
Hər sətirdə yalnız bir text (string) sahəsi var: təmizlənmiş Azərbaycan dili cümləsi və ya qısa abzas. Kitab metadataları və sənəd sərhədləri daxil deyil.
{"text": "Bu adı Qərbi Azərbaycanda yaşamış orta və yaşlı nəsil həmişə böyük ehtiramla xatırlayır."}
İstifadə sahələri
Azərbaycan dili modellərinin ilkin və davamlı təlimi
Azərbaycan dili üçün tokenizatorların hazırlanması
Fine-tuning və mövzu sahəsinə uyğunlaşdırma
Linqvistik tədqiqatlar və NLP qiymətləndirmələri
Mənbələr və məhdudiyyətlər
Mətnlər açıq əlçatan kitablardan və rəsmi hüquqi mənbələrdən toplanıb; şəxsi istifadəçi məlumatı toplanmayıb.
Mətnlər müəlliflərin və dövrlərinin baxışlarını, üslubunu və mümkün qərəzlərini əks etdirə bilər.
Müəllif, kitab adı, il və sənəd sərhədləri kimi metadata daxil deyil.
Korpus CC BY-NC-ND 4.0 lisenziyası ilə yayımlanır. Müəllifə istinadla qeyri-kommersiya paylaşımı nəzərdə tutulur; dəyişdirilmiş versiyaların yayılmasına icazə verilmir. İstifadə zamanı tam lisenziya şərtlərinə baxın.
İstinad
@misc{khazri_corpus,
title = {Khazri Corpus: A Clean Azerbaijani Text Corpus},
author = {SoftYu Group},
howpublished = {\url{https://huggingface.co/datasets/softyugroup/khazri-corpus}},
note = {Hugging Face dataset}
}