Как работает RAG Studio

Платформа строит ассистентов, отвечающих по вашей базе знаний (RAG), и — главное — честно измеряет их качество до того, как они попадут к пользователям. Ниже рабочий цикл по шагам: что делается и что получается на выходе.

← к списку проектов
  1. 1. Данные

    Загружаем базу знаний (документы, JSONL-записи) и контрольные вопросы. Лучший источник вопросов — реальные диалоги пользователей; импорт создаёт черновики, каждый из которых одобряет или правит человек. Вопросы автоматически делятся на рабочий срез (dev) и запечатанный (test).

    Результат: Корпус знаний + выверенный набор контрольных вопросов с эталонными ответами.

  2. 2. База знаний → индекс

    Документы режутся на фрагменты и индексируются для поиска (эмбеддинги + текстовый поиск). Каждая сборка версионируется и хранит свою фактическую стоимость; прошлые версии не мутируются — любой старый результат воспроизводим.

    Результат: Версии поискового индекса с провенансом и стоимостью сборки.

  3. 3. Эталоны

    К контрольным вопросам готовятся эталонные ответы. LLM может предложить черновик, но статус «подтверждён» ставит только человек. Эталоны никогда не попадают в поисковый индекс — это защищено на уровне схемы данных, иначе система «подглядывала» бы в ответы и цифры были бы завышены.

    Результат: Подтверждённый ground truth для честного измерения качества.

  4. 4. Конфигурация

    Собираем варианты RAG-конвейера: модели (генератор, эмбеддинги, судья), параметры поиска, промпты. Готовые пресеты — от быстрого до максимального качества. Каждое сохранение — новая версия со стабильным отпечатком: всегда видно, чем именно отличались сравниваемые варианты.

    Результат: Версионированные конфигурации-кандидаты.

  5. 5. Эксперименты

    Сначала базовая линия — прогон одной конфигурации по dev-вопросам с независимым LLM-судьёй. Затем улучшения: A/B-сравнения и автоматический подбор параметров (перебор или адаптивная стратегия). До запуска — смета стоимости; платные действия требуют явного подтверждения.

    Результат: Метрики качества (0–1) с доверительными интервалами, стоимость и скорость каждого варианта. Если разница статистически не доказана, платформа честно говорит «неразличимо», а не объявляет ложного победителя.

  6. 6. Анализ и выбор

    Результаты, сравнение экспериментов, графики качество/стоимость/скорость, карта параметров, срезы по языкам. Для выбора модели — дуэли: пара конфигураций оценивается двумя судьями разных семейств, победитель объявляется только при их согласии (защита от предвзятости судьи).

    Результат: Обоснованный выбор конфигурации-победителя + журнал решений в сводке.

  7. 7. Финальная оценка

    Выбранный победитель один раз прогоняется по запечатанному test-срезу — вопросам, которые не участвовали в подборе. Платформа запрещает оптимизацию на test: повторное использование обесценило бы оценку.

    Результат: Итоговая честная цифра качества — её можно показывать заказчику и сравнивать с SLA.

  8. 8. Публикация как API

    Победитель публикуется деплойментом: замороженная пара «конфигурация + версия индекса» с API-ключом и OpenAI-совместимым фасадом — подключается к любому клиенту, где работает ChatGPT-совместимый API. Известно, из какого эксперимента родился деплоймент и сколько стоит каждый ответ.

    Результат: Рабочий API-эндпоинт с провенансом и учётом стоимости запросов.

Методологические гарантии

Зачем всё это: цифра качества, полученная с нарушениями методологии, всегда завышена — и ломается на реальных пользователях. Платформа закрепляет дисциплину кодом:

Что получает бизнес