Когда сотрудник перестаёт быть похож на себя: ETL-архитектура поведенческой ML-системы
Программный комитет ещё не принял решения по этому докладу
Целевая аудитория
Тезисы
Для высоконагруженной системы потеря одного носителя критических знаний может стать не кадровым, а инженерным риском: замедлить разработку и согласования, усложнить сопровождение и снизить качество решений. При этом операционные показатели часто фиксируют проблему поздно - ключевой специалист до последнего может оставаться результативнее среднего. В докладе разберём систему, которая ищет не «типичного увольняющегося сотрудника», а устойчивое изменение поведения конкретного человека относительно его собственной истории. Роль, должность и подразделение остаются контекстом, но основной ориентир - персональная норма. На выходе система формирует ранний алерт и показывает факторы, изменившие прогноз - это основание проверить контекст, а не диагноз и не автоматическое кадровое решение. Текущий контур объединяет 9 групп корпоративных источников: проектную активность, метаданные взаимодействий, календарь встреч, кадровые и финансовые события, оргструктуру, рынок и макроэкономику, карьерную историю и профиль сотрудника. На данных 7 212 сотрудников сформировано около 1,9 млн записей и 20 ГБ истории за 4х-летний. Центральная ETL-витрина -«человек-неделя»: все события приводятся к общей временной оси, а каждый признак проверяется на доступность в момент прогноза. Решение построено на воспроизводимых ETL-процессах и сравнительно лёгковесных табличных CatBoost-моделях - без LLM и сложных нейросетевых контуров. Основная сложность находится не в тяжести алгоритма, а в корректной истории, персональных динамических признаках и маршрутизации режимов данных. Такая архитектура позволяет подключать новые поведенческие источники и расширять анализируемую аудиторию без изменения базовой цепочки «событие - период - признак - модель - алерт». Это архитектурная возможность масштабирования; предельная нагрузка системы отдельно не измерялась. Измеримый таргет - уход сотрудника через 21–63 дня после недели наблюдения. На отложенном будущем периоде с марта по август 2025 года precision для класса увольнений составляет 78,6%, recall - 52,2%, F1 - 62,8%; для выбранных ключевых ролей взвешенный F1 - 79,4%. Рабочий порог сознательно ограничивает число ложных сигналов: из 89 алертов 70 соответствовали фактическим уходам, а из 134 уходов 70 были найдены заранее. Участники HighLoad++ получат не каталог из 1114 признаков, а переносимый способ построения поведенческого контура: какие данные нужны для старта, как синхронизировать разнородные события, как сравнивать нетипичный объект с самим собой, не допустить утечки будущего, использовать лёгкие модели при разной полноте данных и связать качество классификатора с реальной ценой алерта. Подход применим и за пределами HR - в задачах раннего выявления изменений поведения пользователей, клиентов, устройств и других объектов с собственной историей.
Руководитель разработки по ИИ и главный аналитик направления, отвечаю на вопросы от формирования требований и разработки архитектуры до вывода готовых решений в прод.
Более 9 лет работаю с данными во всех видах, модели и методологии расчётов, разработанные моей командой до сих пор используются для анализа и прогноза внешней торговли в Минэкономразвития России. Сейчас мы с командой работаем в HR Tech, Rag-системы, НЛП-классификаторы и кластеризаторы, рекомендательная система