Khazri Corpus — очищенные тексты на азербайджанском языке из более чем 570 книг и официальных правовых документов для исследований NLP и разработки языковых моделей.
SOFTYU GROUP · AZERBAIJANI / AZ
Khazri Corpus
О корпусе
Khazri Corpus объединяет художественные, научные, политические и правовые тексты из открыто доступных источников. Очищенные тексты представлены предложениями и короткими абзацами. Корпус использовался для обучения Khazri 3.
Корпус содержит приблизительно 840 тыс. строк; сумма пяти разделов — 832 346 строк. Конфигурация «default» не учитывается как отдельный тематический раздел.
PYTHON / HUGGING FACE
Начните работу с корпусом
Загрузите раздел с помощью библиотеки Hugging Face datasets или объедините четыре раздела Parquet.
pip install datasets
from datasets import load_dataset, concatenate_datasets
bedii = load_dataset("softyugroup/khazri-corpus", "bedii", split="train")
print(bedii[0]["text"])
subsets = ["bedii", "elmi", "siyaset", "vergi"]
corpus = concatenate_datasets([
load_dataset("softyugroup/khazri-corpus", name, split="train")
for name in subsets
])
Код объединяет четыре раздела Parquet (824 645 строк). Гражданский кодекс представлен отдельным JSONL-файлом в mulk-mecelle/, а не именованной конфигурацией load_dataset.
Каждая строка содержит одно поле text (string): очищенное предложение или короткий абзац на азербайджанском языке. Метаданные книг и границы документов отсутствуют.
{"text": "Bu adı Qərbi Azərbaycanda yaşamış orta və yaşlı nəsil həmişə böyük ehtiramla xatırlayır."}
Применение
Предварительное и продолженное обучение азербайджанских языковых моделей
Обучение токенизаторов для азербайджанского языка
Дообучение и адаптация к предметной области
Лингвистические исследования и оценки NLP
Источники и ограничения
Открыто доступные книги и официальные правовые тексты; личные данные пользователей не собирались.
Тексты могут отражать взгляды, стиль и предубеждения авторов и эпох.
Автор, название книги, год и границы документов не включены.
Корпус опубликован по лицензии CC BY-NC-ND 4.0: некоммерческое распространение с указанием авторства; распространение изменённых версий не допускается. При использовании корпуса ознакомьтесь с полными условиями лицензии.
Цитирование
@misc{khazri_corpus,
title = {Khazri Corpus: A Clean Azerbaijani Text Corpus},
author = {SoftYu Group},
howpublished = {\url{https://huggingface.co/datasets/softyugroup/khazri-corpus}},
note = {Hugging Face dataset}
}