150 млн событий и 10 мс на инференс: строим data-intensive систему без вендорных иллюзий

Архитектура и масштабируемость

Программный комитет ещё не принял решения по этому докладу

Целевая аудитория

Data Engineers, ML Engineers, Backend/Highload-разработчики, Системные архитекторы и Tech Leads, которые строят real-time системы, работают со строгими SLA на latency и упираются в ограничения популярных фреймворков.

Тезисы

Как пропустить 150 миллионов транзакций в сутки через 7 ML-моделей и отдать ответ за 50 миллисекунд? В тепличных условиях это звучит как задача для стандартного Feature Store и REST API. В суровом энтерпрайзе с таким подходом вы ляжете на первой же модели.

В этом докладе мы обсудим: 1. Смерть классического транспорта: почему нам пришлось отказаться от HTTP/gRPC в пользу кастомного протокола поверх постоянных TCP-сессий.

  1. Убийство JSON: как переход на бинарную SBE-сериализацию сжал трафик в 8 раз, но заставил нас вручную бороться с аллокациями памяти

  2. Flink State под лупой: как мы сжали стейт с 4 ТБ до 500 ГБ, отказавшись от предрасчета агрегатов в пользу сырых транзакций и "горячего" расчета в Tarantool за 5 мс.

  3. Почему мы выпилили нативные таймеры Flink: как актуализация 60 млн клиентов создала паразитный фон в 30 000 RPS

Доклад будет полезен тем, кто хочет понять реальную цену микросекундных оптимизаций и посмотреть на работу высоконагруженных ML-пайплайнов

Эксперт в области highload разработки (8+ лет) и потоковой обработки данных (6+ лет), работает с high load моделями более 4-х лет.

В ВТБ руководит управлением платформенных решений и развития моделирования. В подчинении более 180 человек: архитекторы, MLOps, стандартные команды разработки (аналитики, разработчики, тестировщики) и руководители.

Видео

Другие доклады секции

Архитектура и масштабируемость