botruntime
Эксплуатация

Evals в консоли

Как смотреть историю hosted evals, находить регрессии и читать результаты отдельных проверок.

Экран Evals показывает историю проверок качества выбранного окружения. Запустите набор через brt eval или brt eval run, затем откройте в консоли Бот → Монитор → Evals.

Экран доступен всем участникам воркспейса с правом чтения бота. Данные другого воркспейса или бота в список не подмешиваются.

Production и Development

В общем топбаре консоли находится переключатель окружений. Он действует на весь проект, а не только на Evals. Production показывает данные production-бота, Development — данные отдельного runtime, который создаёт brt dev. На странице Evals это означает отдельную историю запусков: случайно принять dev-проверку за production-проверку нельзя.

При этом в консоли все окружения входят в один проект. Повторный brt dev переиспользует runtime из agent.local.json; его ID и накопленные hosted evals не меняются. Связь с проектом задаётся при создании и не может быть заменена ссылкой на другой Production.

Связь не отменяет срок хранения. Hosted eval run доступен 30 дней; истёкшие записи уже удалены фоновой очисткой и после связывания не восстановятся.

Если несколько разработчиков или checkout создали отдельные runtime для одного бота, переключатель показывает их как несколько Development-окружений. У каждого собственная история запусков; результаты не объединяются и не переносятся между runtime.

История запусков

В списке находятся запуски наборов. Для каждого видны:

  • ID запуска и ID манифеста;
  • способ запуска: вручную или по расписанию;
  • время создания;
  • состояние выполнения: в очереди, выполняется, завершён или завершился с ошибкой.

Список можно ограничить по состоянию. Кнопка «Загрузить ещё» продолжает текущую выдачу, не начиная её заново. Активный запуск обновляется автоматически до перехода в конечное состояние.

Состояние «Завершён» означает, что платформа выполнила набор до конца. Это не вердикт о качестве: завершённый запуск может содержать непройденные проверки. Ориентируйтесь на долю успешных и число регрессий внутри запуска.

Инспектор запуска

Выберите запуск, чтобы открыть сводку:

ПолеКак читать
ПрошлоЧисло успешных проверок относительно всего набора.
Доля успешныхДоля завершённых проверок с положительным вердиктом.
РегрессииЧисло непройденных проверок.
Время запускаВремя между началом и завершением набора.

Ниже показаны ID манифеста и workflow, способ запуска, время создания, старта и завершения, а также срок доступности. Если сам запуск оборвался, экран показывает категорию ошибки. Для упавшей entry используйте сохранённые conversation ID и trace ID: подробный runtime exception доступен в инспекторе диалога и через brt traces trace=<traceId> --verbose.

Карта набора помогает быстро оценить его состояние: зелёные сегменты прошли, красные не прошли, активные ещё выполняются. Непройденные проверки раскрываются первыми, затем идут незавершённые и успешные.

Результаты проверки

Раскройте проверку, чтобы увидеть её тип (capability или regression), tags, общую длительность и результаты assertions. Для каждого assertion доступны:

  • вердикт или отметка о пропуске;
  • номер хода;
  • тип условия;
  • численная оценка, если проверка её возвращает;
  • время ответа бота и время оценивания.

Такой разрез отделяет медленный ответ бота от медленной проверки и показывает, какое именно условие испортило итоговый результат.

Что экран намеренно не показывает

Hosted eval store сохраняет только операционные метаданные. Консоль не получает реплики пользователя и бота, prompts, ответы модели, evidence, tool payloads и сырые ошибки evaluator или workflow.

Сейчас экран также не сравнивает запуск с baseline автоматически и не строит переход от assertion к trace. Для более глубокого разбора используйте безопасные ID и временные метки вместе с мониторингом и трейсами выбранного бота.

Каждый hosted eval run доступен 30 дней. Точный срок доступности показан в инспекторе запуска; после него фоновая очистка удаляет запись.

Запуск и автоматизация

Hosted eval suite
brt eval
brt eval run regression --tag smoke
brt eval run regression --repeat 10 --min-pass-rate 0.9 --json

CLI подходит для запуска, CI-порогов и машинного JSON. Консоль — для чтения истории и разбора конкретного запуска. Полный набор флагов и команд истории см. в разделе Hosted evals справочника CLI.

Дальше

On this page