Архитектура и стабильность обучения Alice AI Foundation 80B A3B

Доклады вне привычной рамки

Доклад принят в программу конференции

Целевая аудитория

ML-инженеры и исследователи, которые сами занимаются предобучением больших языковых моделей.

Тезисы

Расскажу, как мы с нуля обучили AliceAI-Foundation-80B-A3B-Base — MoE-модель на 80 млрд параметров, из которых около 3 млрд активируются для каждого токена. Покажу устройство её архитектуры: сочетание Kimi Delta Attention с полным attention и блочный вариант Attention Residuals, который позволяет слоям обращаться к представлениям предыдущих блоков.

Отдельно расскажу, как мы связали резкий скачок loss с ростом активаций MoE и стабилизировали обучение с помощью Z-Loss. В завершение разберу распределённую реализацию Muon, в которой пересылки данных выполняются параллельно с ортогонализацией, что примерно вдвое ускоряет шаг оптимизатора.

Руководитель команды исследования архитектуры YandexGPT

Видео