Анатомия надёжности LLM: white-box мониторинг активаций для предотвращения галлюцинаций
Программный комитет ещё не принял решения по этому докладу
Целевая аудитория
Тезисы
В докладе мы разберем, как перенести точку контроля внутрь модели, используя подходы механистической интерпретируемости. Мы рассмотрим концепцию J-space (Global Workspace от Anthropic) как основу для архитектурного паттерна Uncertainty Gate. Вы узнаете, как с помощью J-lens и анализа геометрии скрытых активаций извлекать содержимое J-space и использовать его для предиктивной оценки риска галлюцинации.
Chief Data Scientist at Ozon Банк.
Руководит направлением, которое занимается задачами машинного обучения в банке. Ранее разрабатывал сервисы машинного обучения для крупных международных компаний в должности Senior ML Engineer.
Видео
Другие доклады секции
GenAI и большие языковые модели (LLM)