Как подготовить интернет к обучению LLM: архитектура пайплайна на сотнях миллиардов документов

GenAI и большие языковые модели (LLM)

Программный комитет ещё не принял решения по этому докладу

Целевая аудитория

ML, AI Researchers, ML Ops, архитекторы, DevOps

Тезисы

Как строить pipeline на сотни миллиардов сырых HTML-страниц без бесконечного GPU-кластера. Погрузимся в архитектуру распределённой обработки веба: extraction основного контента, LID, document-level filtering, дедупликацию и каскадную маршрутизацию сложных страниц. Покажем, как сочетать CPU-first алгоритмы, лёгкие классификаторы и GPU-fallback, а также какие инженерные компромиссы возникают между throughput, стоимостью обработки и качеством итоговых данных.

Максим Кочетков

ПАО Сбербанк

- 5+ лет опыта в ML
- Создавал решения от classic ML до мультиагентных harness
- Лидировал ML-направление сервиса генерации синтетических данных SyntData (продукта из реестра российского ПО, отмеченного патентами и премией DataAwards 2025)
- Создал и внедрил методики оценки качества синтетических данных

Видео

Другие доклады секции

GenAI и большие языковые модели (LLM)