Башкирский язык получил открытый языковой корпус — Bashkorttele
Ко Дню языков народов России Фонд сохранения и развития башкирского языка опубликовал серию открытых датасетов на Hugging Face — под свободной лицензией, без бюрократии, доступных всем: от крупных лабораторий, обучающих многоязычные модели, до школьных учителей и студентов республики.
Что вошло в корпус:
78 часов аудиокниг — эпосы, кубаиры, проза, поэзия, народные сказки
53 часа теле- и радиопередач
5 разговорников: башкирский / русский / казахский / алтайский / якутский / арабский / китайский (9 857 параллельных фраз)
Как это сделано. С помощью агентных технологий на базе LLM построен воспроизводимый конвейер: он самостоятельно классифицирует исходные материалы, распознаёт текст, восстанавливает вёрстку, чинит кодировки и переносы, проводит морфологический аудит и публикует готовый датасет. В основе — многолетний труд по формализации башкирской орфографии (Bashspell Айгиза Кунафина) и грамматические ресурсы Института истории, языка и литературы УФИЦ РАН. Найденные исправления уже приняты в публичные репозитории apertium и bashspell на GitHub.
Зачем это нужно. Современные модели говорят на малоресурсных языках, но из-за нехватки данных башкирский текст незаметно «съезжает» в татарскую или казахскую морфологию. Качественный корпус — это основа для голосовых помощников, автоматического перевода, субтитров, клавиатур и образовательных сервисов на башкирском.
Оцифровка сохраняет текст. Машиночитаемый корпус сохраняет язык — в форме, на которой будут говорить технологии следующего десятилетия.
Благодарим авторов и издателей, давших согласие на публикацию датасетов .
За подробностями — на сайт.









































