Как подготовить интернет к обучению LLM: архитектура пайплайна на сотнях миллиардов документов
Программный комитет ещё не принял решения по этому докладу
Целевая аудитория
Тезисы
Как строить pipeline на сотни миллиардов сырых HTML-страниц без бесконечного GPU-кластера. Погрузимся в архитектуру распределённой обработки веба: extraction основного контента, LID, document-level filtering, дедупликацию и каскадную маршрутизацию сложных страниц. Покажем, как сочетать CPU-first алгоритмы, лёгкие классификаторы и GPU-fallback, а также какие инженерные компромиссы возникают между throughput, стоимостью обработки и качеством итоговых данных.
- 5+ лет опыта в ML
- Создавал решения от classic ML до мультиагентных harness
- Лидировал ML-направление сервиса генерации синтетических данных SyntData (продукта из реестра российского ПО, отмеченного патентами и премией DataAwards 2025)
- Создал и внедрил методики оценки качества синтетических данных
Видео
Другие доклады секции
GenAI и большие языковые модели (LLM)