Как накормить фундаментальную модель: extraction, filtering и quality gates на масштабе интернета

GenAI и большие языковые модели (LLM)

Программный комитет ещё не принял решения по этому докладу

Целевая аудитория

ML, AI Researchers, ML Ops, архитекторы, DevOps

Тезисы

Основная проблема подготовки данных для LLM — не просто извлечь текст из HTML, а понять, корректно ли он извлечён и насколько он ценен для обучающей корпуса. В докладе разберём каскад quality gates: эвристики по raw HTML, признаки результата extraction, классификаторы полезности текста и fallback на более тяжёлые модели для неоднозначных страниц. Обсудим, какие сигналы позволяют отделить контент от boilerplate, оценить обучающую ценность документа и сократить долю дорогой обработки без заметной потери качества корпуса.

Максим Кочетков

ПАО Сбербанк

- 5+ лет опыта в ML
- Создавал решения от classic ML до мультиагентных harness
- Лидировал ML-направление сервиса генерации синтетических данных SyntData (продукта из реестра российского ПО, отмеченного патентами и премией DataAwards 2025)
- Создал и внедрил методики оценки качества синтетических данных

Видео

Другие доклады секции

GenAI и большие языковые модели (LLM)