Архитектура и стабильность обучения Alice AI Foundation 80B A3B
Доклад принят в программу конференции
Целевая аудитория
Тезисы
Расскажу, как мы с нуля обучили AliceAI-Foundation-80B-A3B-Base — MoE-модель на 80 млрд параметров, из которых около 3 млрд активируются для каждого токена. Покажу устройство её архитектуры: сочетание Kimi Delta Attention с полным attention и блочный вариант Attention Residuals, который позволяет слоям обращаться к представлениям предыдущих блоков.
Отдельно расскажу, как мы связали резкий скачок loss с ростом активаций MoE и стабилизировали обучение с помощью Z-Loss. В завершение разберу распределённую реализацию Muon, в которой пересылки данных выполняются параллельно с ортогонализацией, что примерно вдвое ускоряет шаг оптимизатора.
Руководитель команды исследования архитектуры YandexGPT