KHAZRI
  • Главная
  • Модели
  • Datasets
  • Блог
  • FAQ
  • Контакты
Связаться с нами

DATASETS / KHAZRI CORPUS

Открытый корпус азербайджанских текстов

Khazri Corpus — очищенные тексты на азербайджанском языке из более чем 570 книг и официальных правовых документов для исследований NLP и разработки языковых моделей.

SOFTYU GROUP · AZERBAIJANI / AZ

Khazri Corpus

О корпусе

Khazri Corpus объединяет художественные, научные, политические и правовые тексты из открыто доступных источников. Очищенные тексты представлены предложениями и короткими абзацами. Корпус использовался для обучения Khazri 3.

Открыть на Hugging Face
примерное число строк
~840K
книг-источников
570+
тематических разделов
5
текстовое поле
text

Состав корпуса

Khazri Corpus — Состав корпуса
РазделСодержание и источникФорматСтроки
bediiХудожественная литература и проза · 300+ книгParquet696 848
elmiНаучные и академические тексты · 200+ книгParquet79 157
siyasetПолитические тексты · 70+ книгParquet46 462
vergiНалоговый кодекс Азербайджанской РеспубликиParquet2 178
mulk-mecelle/Гражданский кодекс Азербайджанской РеспубликиJSONL7 701
Сумма перечисленных разделов832 346

Корпус содержит приблизительно 840 тыс. строк; сумма пяти разделов — 832 346 строк. Конфигурация «default» не учитывается как отдельный тематический раздел.

PYTHON / HUGGING FACE

Начните работу с корпусом

Загрузите раздел с помощью библиотеки Hugging Face datasets или объедините четыре раздела Parquet.

pip install datasets
from datasets import load_dataset, concatenate_datasets

bedii = load_dataset("softyugroup/khazri-corpus", "bedii", split="train")
print(bedii[0]["text"])

subsets = ["bedii", "elmi", "siyaset", "vergi"]
corpus = concatenate_datasets([
    load_dataset("softyugroup/khazri-corpus", name, split="train")
    for name in subsets
])

Код объединяет четыре раздела Parquet (824 645 строк). Гражданский кодекс представлен отдельным JSONL-файлом в mulk-mecelle/, а не именованной конфигурацией load_dataset.

Посмотреть JSONL-файлы

Простой формат данных

Каждая строка содержит одно поле text (string): очищенное предложение или короткий абзац на азербайджанском языке. Метаданные книг и границы документов отсутствуют.

{"text": "Bu adı Qərbi Azərbaycanda yaşamış orta və yaşlı nəsil həmişə böyük ehtiramla xatırlayır."}

Применение

  • Предварительное и продолженное обучение азербайджанских языковых моделей
  • Обучение токенизаторов для азербайджанского языка
  • Дообучение и адаптация к предметной области
  • Лингвистические исследования и оценки NLP

Источники и ограничения

  • Открыто доступные книги и официальные правовые тексты; личные данные пользователей не собирались.
  • Тексты могут отражать взгляды, стиль и предубеждения авторов и эпох.
  • Автор, название книги, год и границы документов не включены.

Лицензия

CC BY-NC-ND 4.0

Корпус опубликован по лицензии CC BY-NC-ND 4.0: некоммерческое распространение с указанием авторства; распространение изменённых версий не допускается. При использовании корпуса ознакомьтесь с полными условиями лицензии.

Цитирование

@misc{khazri_corpus,
  title        = {Khazri Corpus: A Clean Azerbaijani Text Corpus},
  author       = {SoftYu Group},
  howpublished = {\url{https://huggingface.co/datasets/softyugroup/khazri-corpus}},
  note         = {Hugging Face dataset}
}
KHAZRI

Создаём локальную, современную и более независимую ИИ-инфраструктуру для азербайджанского языка.

Разделы

  • Модели
  • Datasets
  • Блог
  • FAQ
  • Контакты

Контакты

  • +994 77 308 76 77
  • contact@khazri.dev
  • Hugging Face

© 2026 Khazri. Все права защищены.

Модель Khazri принадлежит Softyu.