Как накормить фундаментальную модель: extraction, filtering и quality gates на масштабе интернета
Программный комитет ещё не принял решения по этому докладу
Целевая аудитория
Тезисы
Основная проблема подготовки данных для LLM — не просто извлечь текст из HTML, а понять, корректно ли он извлечён и насколько он ценен для обучающей корпуса. В докладе разберём каскад quality gates: эвристики по raw HTML, признаки результата extraction, классификаторы полезности текста и fallback на более тяжёлые модели для неоднозначных страниц. Обсудим, какие сигналы позволяют отделить контент от boilerplate, оценить обучающую ценность документа и сократить долю дорогой обработки без заметной потери качества корпуса.
- 5+ лет опыта в ML
- Создавал решения от classic ML до мультиагентных harness
- Лидировал ML-направление сервиса генерации синтетических данных SyntData (продукта из реестра российского ПО, отмеченного патентами и премией DataAwards 2025)
- Создал и внедрил методики оценки качества синтетических данных
Видео
Другие доклады секции
GenAI и большие языковые модели (LLM)