Платформа строит ассистентов, отвечающих по вашей базе знаний (RAG), и — главное — честно измеряет их качество до того, как они попадут к пользователям. Ниже рабочий цикл по шагам: что делается и что получается на выходе.
← к списку проектовЗагружаем базу знаний (документы, JSONL-записи) и контрольные вопросы. Лучший источник вопросов — реальные диалоги пользователей; импорт создаёт черновики, каждый из которых одобряет или правит человек. Вопросы автоматически делятся на рабочий срез (dev) и запечатанный (test).
Результат: Корпус знаний + выверенный набор контрольных вопросов с эталонными ответами.
Документы режутся на фрагменты и индексируются для поиска (эмбеддинги + текстовый поиск). Каждая сборка версионируется и хранит свою фактическую стоимость; прошлые версии не мутируются — любой старый результат воспроизводим.
Результат: Версии поискового индекса с провенансом и стоимостью сборки.
К контрольным вопросам готовятся эталонные ответы. LLM может предложить черновик, но статус «подтверждён» ставит только человек. Эталоны никогда не попадают в поисковый индекс — это защищено на уровне схемы данных, иначе система «подглядывала» бы в ответы и цифры были бы завышены.
Результат: Подтверждённый ground truth для честного измерения качества.
Собираем варианты RAG-конвейера: модели (генератор, эмбеддинги, судья), параметры поиска, промпты. Готовые пресеты — от быстрого до максимального качества. Каждое сохранение — новая версия со стабильным отпечатком: всегда видно, чем именно отличались сравниваемые варианты.
Результат: Версионированные конфигурации-кандидаты.
Сначала базовая линия — прогон одной конфигурации по dev-вопросам с независимым LLM-судьёй. Затем улучшения: A/B-сравнения и автоматический подбор параметров (перебор или адаптивная стратегия). До запуска — смета стоимости; платные действия требуют явного подтверждения.
Результат: Метрики качества (0–1) с доверительными интервалами, стоимость и скорость каждого варианта. Если разница статистически не доказана, платформа честно говорит «неразличимо», а не объявляет ложного победителя.
Результаты, сравнение экспериментов, графики качество/стоимость/скорость, карта параметров, срезы по языкам. Для выбора модели — дуэли: пара конфигураций оценивается двумя судьями разных семейств, победитель объявляется только при их согласии (защита от предвзятости судьи).
Результат: Обоснованный выбор конфигурации-победителя + журнал решений в сводке.
Выбранный победитель один раз прогоняется по запечатанному test-срезу — вопросам, которые не участвовали в подборе. Платформа запрещает оптимизацию на test: повторное использование обесценило бы оценку.
Результат: Итоговая честная цифра качества — её можно показывать заказчику и сравнивать с SLA.
Победитель публикуется деплойментом: замороженная пара «конфигурация + версия индекса» с API-ключом и OpenAI-совместимым фасадом — подключается к любому клиенту, где работает ChatGPT-совместимый API. Известно, из какого эксперимента родился деплоймент и сколько стоит каждый ответ.
Результат: Рабочий API-эндпоинт с провенансом и учётом стоимости запросов.
Зачем всё это: цифра качества, полученная с нарушениями методологии, всегда завышена — и ломается на реальных пользователях. Платформа закрепляет дисциплину кодом: