Evals в консоли
Как смотреть историю hosted evals, находить регрессии и читать результаты отдельных проверок.
Экран Evals показывает историю проверок качества выбранного окружения. Запустите
набор через brt eval или brt eval run, затем откройте в консоли
Бот → Монитор → Evals.
Экран доступен всем участникам воркспейса с правом чтения бота. Данные другого воркспейса или бота в список не подмешиваются.
Production и Development
В общем топбаре консоли находится переключатель окружений. Он действует на весь
проект, а не только на Evals. Production показывает данные production-бота,
Development — данные отдельного runtime, который создаёт brt dev. На
странице Evals это означает отдельную историю запусков: случайно принять
dev-проверку за production-проверку нельзя.
При этом в консоли все окружения входят в один проект. Повторный brt dev
переиспользует runtime из agent.local.json; его ID и накопленные hosted evals
не меняются. Связь с проектом задаётся при создании и не может быть заменена
ссылкой на другой Production.
Связь не отменяет срок хранения. Hosted eval run доступен 30 дней; истёкшие записи уже удалены фоновой очисткой и после связывания не восстановятся.
Если несколько разработчиков или checkout создали отдельные runtime для одного бота, переключатель показывает их как несколько Development-окружений. У каждого собственная история запусков; результаты не объединяются и не переносятся между runtime.
История запусков
В списке находятся запуски наборов. Для каждого видны:
- ID запуска и ID манифеста;
- способ запуска: вручную или по расписанию;
- время создания;
- состояние выполнения: в очереди, выполняется, завершён или завершился с ошибкой.
Список можно ограничить по состоянию. Кнопка «Загрузить ещё» продолжает текущую выдачу, не начиная её заново. Активный запуск обновляется автоматически до перехода в конечное состояние.
Состояние «Завершён» означает, что платформа выполнила набор до конца. Это не вердикт о качестве: завершённый запуск может содержать непройденные проверки. Ориентируйтесь на долю успешных и число регрессий внутри запуска.
Инспектор запуска
Выберите запуск, чтобы открыть сводку:
| Поле | Как читать |
|---|---|
| Прошло | Число успешных проверок относительно всего набора. |
| Доля успешных | Доля завершённых проверок с положительным вердиктом. |
| Регрессии | Число непройденных проверок. |
| Время запуска | Время между началом и завершением набора. |
Ниже показаны ID манифеста и workflow, способ запуска, время создания, старта и
завершения, а также срок доступности. Если сам запуск оборвался, экран показывает
категорию ошибки. Для упавшей entry используйте сохранённые conversation ID и
trace ID: подробный runtime exception доступен в инспекторе диалога и через
brt traces trace=<traceId> --verbose.
Карта набора помогает быстро оценить его состояние: зелёные сегменты прошли, красные не прошли, активные ещё выполняются. Непройденные проверки раскрываются первыми, затем идут незавершённые и успешные.
Результаты проверки
Раскройте проверку, чтобы увидеть её тип (capability или regression), tags,
общую длительность и результаты assertions. Для каждого assertion доступны:
- вердикт или отметка о пропуске;
- номер хода;
- тип условия;
- численная оценка, если проверка её возвращает;
- время ответа бота и время оценивания.
Такой разрез отделяет медленный ответ бота от медленной проверки и показывает, какое именно условие испортило итоговый результат.
Что экран намеренно не показывает
Hosted eval store сохраняет только операционные метаданные. Консоль не получает реплики пользователя и бота, prompts, ответы модели, evidence, tool payloads и сырые ошибки evaluator или workflow.
Сейчас экран также не сравнивает запуск с baseline автоматически и не строит переход от assertion к trace. Для более глубокого разбора используйте безопасные ID и временные метки вместе с мониторингом и трейсами выбранного бота.
Каждый hosted eval run доступен 30 дней. Точный срок доступности показан в инспекторе запуска; после него фоновая очистка удаляет запись.
Запуск и автоматизация
brt eval
brt eval run regression --tag smoke
brt eval run regression --repeat 10 --min-pass-rate 0.9 --jsonCLI подходит для запуска, CI-порогов и машинного JSON. Консоль — для чтения истории и разбора конкретного запуска. Полный набор флагов и команд истории см. в разделе Hosted evals справочника CLI.