Как Yandex дообучает AliceAI-80B-A3B с нуля: конкретика

Команда Yandex объявила о втором обновлении процесса пост-тренировки модели AliceAI-80B-A3B. Модель относится к классу LLM (больших языковых моделей) с архитектурой смеси экспертов: 80 миллиардов параметров, из которых активны только 3 миллиарда.

Как Yandex дообучает AliceAI-80B-A3B с нуля: конкретика
Как Yandex дообучает AliceAI-80B-A3B с нуля: конкретика

Главное

  • Yandex перезапускает пост-тренировку модели AliceAI-80B-A3B с нуля
  • Архитектура смеси экспертов: 80B параметров, 3B активных
  • Цель — улучшение следования инструкциям и качества ответов
  • Итеративный перезапуск снижает риск накопления ошибок
  • Модель эффективна: низкие вычислительные затраты при высоком качестве

Команда Yandex объявила о втором обновлении процесса пост-тренировки модели AliceAI-80B-A3B. Модель относится к классу LLM (больших языковых моделей) с архитектурой смеси экспертов: 80 миллиардов параметров, из которых активны только 3 миллиарда. Это позволяет снизить вычислительные затраты при сохранении качества. Пост-тренировка — этап, на котором модель обучают следовать инструкциям, — запущена с нуля, что означает пересмотр предыдущих настроек и новый цикл обучения.

Второе обновление подчёркивает итеративный подход: команда не просто корректирует веса, а перезапускает процесс, чтобы избежать накопления ошибок. Такой метод требует значительных вычислительных ресурсов, но позволяет лучше адаптировать модель под конкретные задачи. Для пользователей это означает потенциальное улучшение качества ответов и более точное следование инструкциям.

Особенность AliceAI-80B-A3B — эффективность: при 3 миллиардах активных параметров модель может работать на более скромном оборудовании, чем полные 80 миллиардов. Это важно для практического применения. Пока нет деталей о сроках завершения и итоговых метриках, но сам факт перезапуска пост-тренировки говорит о стремлении к высокому качеству.

Перезапуск с нуля — редкий шаг. Обычно пост-тренировку продолжают с предыдущей точки, но здесь выбран более радикальный путь. Это может быть связано с изменением набора данных или архитектурных решений. В любом случае, такой подход требует тщательной валидации, чтобы избежать деградации модели. После завершения цикла модель, вероятно, станет доступна в продуктах компании.