Анатомия надёжности LLM: white-box мониторинг активаций для предотвращения галлюцинаций

GenAI и большие языковые модели (LLM)

Программный комитет ещё не принял решения по этому докладу

Целевая аудитория

ML-инженеры, архитекторы AI-систем, Senior/Lead Data Scientists, MLOps-инженеры и технические лиды продуктовых команд

Тезисы

В докладе мы разберем, как перенести точку контроля внутрь модели, используя подходы механистической интерпретируемости. Мы рассмотрим концепцию J-space (Global Workspace от Anthropic) как основу для архитектурного паттерна Uncertainty Gate. Вы узнаете, как с помощью J-lens и анализа геометрии скрытых активаций извлекать содержимое J-space и использовать его для предиктивной оценки риска галлюцинации.

Chief Data Scientist at Ozon Банк.

Руководит направлением, которое занимается задачами машинного обучения в банке. Ранее разрабатывал сервисы машинного обучения для крупных международных компаний в должности Senior ML Engineer.

Видео

Другие доклады секции

GenAI и большие языковые модели (LLM)