Harness важнее модели: как собрать GraphRAG на одной GPU и, главное, зачем?

GenAI и большие языковые модели (LLM)

Python
Разработка библиотек, включая open source библиотеки
Алгоритмы и их сравнение
ML
Метрики
Базы знаний / wiki

Программный комитет ещё не принял решения по этому докладу

Целевая аудитория

1. Разработчики и архитекторы, внедряющие LLM в продукты. 2. Data- и ML-инженеры, сопровождающие RAG-пайплайны. 3. Тимлиды и CTO, считающие стоимость AI-автоматизации. 4. Все, кто по соображениям безопасности, экономики или по требованиям 152-ФЗ вынужден поднимать on-premise разговорный ИИ на собственных GPU.

Тезисы

Большинство бизнес-сценариев ИИ-автоматизации не требуют гигантских фронтирных моделей - они просто не окупаются. При проектировании RAG и агентных систем harness (обвязка, архитектура применения модели) важнее самой модели: грамотно построенная RAG-система с моделью на 7B стабильно обыгрывает свежие GPT и Claude, работающие "в лоб" без хорошего RAG, особенно на специальных или закрытых доменах, не попавших в трейнсет этих самых GPT.

Но что такое "хорошо" и что такое "плохо" применительно к обвязке для RAG? Простой поиск по текстовым чанкам для контекста LLM - это плохо! На "грязных" реальных корпусах он теряет полноту и ломает поиск именно там, где нужна многошаговая аналитика. "Я такого не хочу даже вставить в книжку", а в рабочую систему - тем более.

А вот про "хорошо" я расскажу на примере нашего вкусного RAGU - открытого модульного движка GraphRAG для реального бизнеса, а не для GPU-rich компаний с кластерами на тысячи терафлопс. RAGU опирается на многошаговый harness, превращающий сырые документы в граф знаний последовательно и с самопроверкой. Мы обсудим границы применимости RAGU и его результаты на публичных бенчмарках в сравнении с LightRAG, HippoRAG 2 и другими вариантами harness, а также прикладные вопросы: какие ручки крутить, как выбирать стратегию поиска под свой домен и почему отсутствие «коробочного» дефолтного пайплайна - это сознательное архитектурное решение, а не баг.

Любит свою семью и машинное обучение, преподает в НГУ, делает нейросети, ходит в горы.

В настоящий момент работает старшим преподавателем и научным сотрудником Новосибирского государственного университета. Вместе со своими учениками является сооснователем стартапа «Сибирские нейросети».

С 2006 до 2013 года преподавал и занимался научными исследованиями в Донецком национальном техническом университете, затем перешёл в IT-индустрию и работал на различных должностях — от инженера-разработчика до специалиста по машинному обучению — в ряде компаний и университетов, таких как 2ГИС, Huawei, Global Logic, Data Monsters, МФТИ (DeepPavlov).

Видео

Другие доклады секции

GenAI и большие языковые модели (LLM)