Қазақ тілінде оқиды
NIXA collects, cleans, and documents Kazakh language data: pretrain corpora, instruct sets, parallel texts. Some releases are open; some stay private and are built for a specific task.
Kazakh is spoken by 17M+ people and almost invisible in benchmarks. We close that gap with data, not slogans.
Data instead of promises
We are a small independent group. We do one thing seriously: bring Kazakh into a state fit for training modern language models.
Проблема казахского в NLP не в отсутствии текста, а в его качестве. Веб-краулы забиты дублями, рекламой, машинным переводом с русского и смешанной кириллицей-латиницей. Модель, обученная на таком, говорит криво и уверенно.
Поэтому мы работаем на уровне пайплайна: сбор из проверяемых источников, дедупликация, фильтрация по длине и языку, ручная выборочная проверка, документация каждого поля. Каждый релиз идёт с описанием источника и лицензии, чтобы его можно было использовать в исследовании без юридических сюрпризов.
Открытые наборы лежат на HuggingFace и Kaggle: пользуйтесь, ссылайтесь, критикуйте. Часть коллекций мы держим закрытыми: разговорная речь, доменные тексты, размеченные под конкретные задачи выборки. Их мы выдаём по договорённости и собираем эксклюзивные наборы под запрос заказчика.
Язык живёт там, где на нём можно считать, а не только говорить.
Лицензии релизов: ODC-BY 1.0 и CC BY 4.0. Атрибуция обязательна, коммерческое использование разрешено.
Datasets
Click a row: the dataset card opens here with a data preview. Private sets show the schema, not the content.
В этой категории пока пусто. Мы выкладываем новый набор примерно раз в месяц.
Предложить датасетВсего в индексе: 0
Заказать эксклюзивный наборГде встречаются наши данные
Публичные проекты сторонних авторов, в которых использованы или упомянуты наборы NIXA.
Авторство этих работ принадлежит их авторам, NIXA к ним отношения не имеет и заслуг себе не приписывает. Здесь они перечислены только как публичные примеры того, куда попадают наши данные.
Galam beta
Казахскоязычная языковая модель, которую мы обучаем на собственных корпусах. Сейчас это ранняя бета: отвечает неровно, путает падежи в длинных цепочках, иногда выдумывает факты. Мы не прячем это, а показываем, потому что обратная связь ускоряет работу сильнее, чем ещё один месяц молчания.
chat.nixa.meVolunteering and orders
One form, two paths. We reply by email within 48 hours — usually faster.
Нам нужны носители языка, лингвисты, аннотаторы и инженеры данных. Опыт в ML не обязателен: чувство языка и аккуратность важнее. Работа проектная, объём вы выбираете сами.
Собираем наборы под задачу: домен, объём, формат, схема полей, разметка. Доступ к закрытым коллекциям обсуждается отдельно. Опишите задачу, вернёмся со сроком и оценкой.
within 48 hours
Пн–Пт, часовой пояс Казахстана (UTC+5)
Для сотрудничества и доступа к данным пишите сразу на ОБЕ почты — это в разы повысит шансы на быстрый ответ.