Как Yandex дообучает AliceAI-80B-A3B с нуля: конкретика
Команда Yandex объявила о втором обновлении процесса пост-тренировки модели AliceAI-80B-A3B. Модель относится к классу LLM (больших языковых моделей) с архитектурой смеси экспертов: 80 миллиардов параметров, из которых активны только 3 миллиарда.
Главное
- Yandex перезапускает пост-тренировку модели AliceAI-80B-A3B с нуля
- Архитектура смеси экспертов: 80B параметров, 3B активных
- Цель — улучшение следования инструкциям и качества ответов
- Итеративный перезапуск снижает риск накопления ошибок
- Модель эффективна: низкие вычислительные затраты при высоком качестве
Команда Yandex объявила о втором обновлении процесса пост-тренировки модели AliceAI-80B-A3B. Модель относится к классу LLM (больших языковых моделей) с архитектурой смеси экспертов: 80 миллиардов параметров, из которых активны только 3 миллиарда. Это позволяет снизить вычислительные затраты при сохранении качества. Пост-тренировка — этап, на котором модель обучают следовать инструкциям, — запущена с нуля, что означает пересмотр предыдущих настроек и новый цикл обучения.
Второе обновление подчёркивает итеративный подход: команда не просто корректирует веса, а перезапускает процесс, чтобы избежать накопления ошибок. Такой метод требует значительных вычислительных ресурсов, но позволяет лучше адаптировать модель под конкретные задачи. Для пользователей это означает потенциальное улучшение качества ответов и более точное следование инструкциям.
Особенность AliceAI-80B-A3B — эффективность: при 3 миллиардах активных параметров модель может работать на более скромном оборудовании, чем полные 80 миллиардов. Это важно для практического применения. Пока нет деталей о сроках завершения и итоговых метриках, но сам факт перезапуска пост-тренировки говорит о стремлении к высокому качеству.
Перезапуск с нуля — редкий шаг. Обычно пост-тренировку продолжают с предыдущей точки, но здесь выбран более радикальный путь. Это может быть связано с изменением набора данных или архитектурных решений. В любом случае, такой подход требует тщательной валидации, чтобы избежать деградации модели. После завершения цикла модель, вероятно, станет доступна в продуктах компании.