150 млн событий и 10 мс на инференс: строим data-intensive систему без вендорных иллюзий
Программный комитет ещё не принял решения по этому докладу
Целевая аудитория
Тезисы
Как пропустить 150 миллионов транзакций в сутки через 7 ML-моделей и отдать ответ за 50 миллисекунд? В тепличных условиях это звучит как задача для стандартного Feature Store и REST API. В суровом энтерпрайзе с таким подходом вы ляжете на первой же модели.
В этом докладе мы обсудим: 1. Смерть классического транспорта: почему нам пришлось отказаться от HTTP/gRPC в пользу кастомного протокола поверх постоянных TCP-сессий.
Убийство JSON: как переход на бинарную SBE-сериализацию сжал трафик в 8 раз, но заставил нас вручную бороться с аллокациями памяти
Flink State под лупой: как мы сжали стейт с 4 ТБ до 500 ГБ, отказавшись от предрасчета агрегатов в пользу сырых транзакций и "горячего" расчета в Tarantool за 5 мс.
Почему мы выпилили нативные таймеры Flink: как актуализация 60 млн клиентов создала паразитный фон в 30 000 RPS
Доклад будет полезен тем, кто хочет понять реальную цену микросекундных оптимизаций и посмотреть на работу высоконагруженных ML-пайплайнов
Эксперт в области highload разработки (8+ лет) и потоковой обработки данных (6+ лет), работает с high load моделями более 4-х лет.
В ВТБ руководит управлением платформенных решений и развития моделирования. В подчинении более 180 человек: архитекторы, MLOps, стандартные команды разработки (аналитики, разработчики, тестировщики) и руководители.
Видео
Другие доклады секции
Архитектура и масштабируемость