Фабрика pretrain-данных: как превратить веб, документы, аудио и видео в обучающий корпус

GenAI и большие языковые модели (LLM)

Программный комитет ещё не принял решения по этому докладу

Целевая аудитория

ML, AI Researchers, ML Ops, архитекторы, DevOps

Тезисы

Сырой веб — это не датасет, а смесь полезного текста, шаблонов, навигации, SEO-контента, дубликатов и ошибок extraction. В докладе разберём устройствость промышленной фабрики pretrain-данных: от обработки raw HTML до нормализованного корпуса, готового к токенизации и обучению LLM. Основной фокус — на архитектуре data flow, контроле качества между стадиями, масштабировании stateless-обработчиков и построении воспроизводимого pipeline, в котором можно измерить вклад каждого фильтра в качество и объём итоговой выборки.

Максим Кочетков

ПАО Сбербанк

- 5+ лет опыта в ML
- Создавал решения от classic ML до мультиагентных harness
- Лидировал ML-направление сервиса генерации синтетических данных SyntData (продукта из реестра российского ПО, отмеченного патентами и премией DataAwards 2025)
- Создал и внедрил методики оценки качества синтетических данных

Видео

Другие доклады секции

GenAI и большие языковые модели (LLM)