Новый
2025 / 2026

2566 Создание большой языковой модели с полным циклом обучения
Заявка создана
05.05.2026
На доработке
07.05.2026
Исправлено
07.05.2026
Контроль ПО
08.05.2026
Отправлен на комиссию
08.05.2026
На доработке
12.05.2026
Одобрен
Паспорт проекта
Аннотация
В условиях стремительной интеграции больших языковых моделей (БЯМ) в различные сферы деятельности, обеспечение технологического суверенитета становится критической задачей национального масштаба. Настоящая работа посвящена разработке независимого конвейера создания компактной БЯМ (менее 1 млрд параметров) на базе архитектуры Qwen. Ключевой особенностью подхода является отказ от использования предварительно обученных весов и методов прямой дистилляции знаний, что обеспечивает полную автономность...
Отрасль
Кибернетика
Теги
ML
LLM
Кибернетика
Цель
Проект ставит перед собой цель – воспроизвести обучение Qwen до 1B с метриками (MMLU-Pro, IFEval, LiveCodeBench) близкими к исходной модели (минимум 60% от метрик Qwen).
Ожидаемые результаты
- Собран датасет для обучения LLM
- Разработана методика эффективного сбора данных с целью воспроизведения БЯМ Qwen
- Обучена собственная БЯМ которая воспроизводит метрики Qwen (минимум 60% от исходных).
Форма и способы промежуточного контроля
Работа по спринтам с циклом 2 недели. Доклады о выполненной работе с демонстрацией результатов на регулярных встречах
Форма представления результатов
Отчет о выполнении проекта и групповая презентация результатов проекта перед комиссией. Программный код и демонстрация работы написанного программного модуля.
Ресурсное обеспечение
Собственные ресурсы преподавателя (карты NVIDIA 5090-B200)
Ресурсы ДКИ
Суперкомпьютер НИУ ВШЭ
Имеющийся задел
Собран список открытых датасетов
Произведен примерный рассвет стоимости и времени обучения модели Qwen 3.5 0.8B
Заказчик
МИЭМ / ДКИ