Фабрика pretrain-данных: как превратить веб, документы, аудио и видео в обучающий корпус
Программный комитет ещё не принял решения по этому докладу
Целевая аудитория
Тезисы
Сырой веб — это не датасет, а смесь полезного текста, шаблонов, навигации, SEO-контента, дубликатов и ошибок extraction. В докладе разберём устройствость промышленной фабрики pretrain-данных: от обработки raw HTML до нормализованного корпуса, готового к токенизации и обучению LLM. Основной фокус — на архитектуре data flow, контроле качества между стадиями, масштабировании stateless-обработчиков и построении воспроизводимого pipeline, в котором можно измерить вклад каждого фильтра в качество и объём итоговой выборки.
- 5+ лет опыта в ML
- Создавал решения от classic ML до мультиагентных harness
- Лидировал ML-направление сервиса генерации синтетических данных SyntData (продукта из реестра российского ПО, отмеченного патентами и премией DataAwards 2025)
- Создал и внедрил методики оценки качества синтетических данных
Видео
Другие доклады секции
GenAI и большие языковые модели (LLM)