agent-observability-eval-pipeline
Agent Observability Eval Pipeline — официальный навык Datadog Labs для последовательного перехода от production-трейсов инструментированного ml_app к оценке качества агента. Это оркестрация шести фаз, а не новый аналитический алгоритм: навык объединяет отдельные операции классификации сессий, анализа первопричин, создания evaluators, подготовки dataset, запуска эксперимента и разбора результатов. Между фазами предусмотрена контрольная точка, поэтому пользователь видит, какой объект уже создан, где лежит результат и может остановить процесс или скорректировать параметры до следующего шага. В начале проверяется контур выполнения. Нужен ml_app с недавними trace/span-данными, чтобы анализировать фактическое поведение приложения, а не пустой или вымышленный набор. Определяется backend: при наличии Datadog LLM Observability MCP используется MCP-режим, иначе проверяется доступность pup CLI. Для дальнейших операций требуются Datadog API key и Application key или App key; значения ключей не должны выводиться в отчёт. Также подготавливается output directory и его каталог state, где сохраняются промежуточные результаты фаз. Имя проекта может быть передано явно или выведено из конфигурации приложения, а создание проекта выполняется лениво SDK при включении LLM Observability. Фаза классификации собирает traces и spans указанного ml_app за выбранное окно и помогает увидеть типовые успешные и проблемные сценарии. Фаза root-cause analysis группирует сбои и формулирует причины, которые можно использовать при проектировании проверок. Фаза evaluator bootstrap создаёт основу для LLM- или функциональных оценок. После неё можно остановиться, если нужен только набор evaluators. В полном проходе следующая фаза отбирает примеры из production, создаёт или публикует dataset и сохраняет запись результата. Затем формируется experiment с task и evaluators, перед запуском проводится отдельная проверка сгенерированного кода, после чего эксперимент выполняется. Финальная фаза анализирует метрики, сравнения и рекомендации. Параметры позволяют начать с указанной фазы через start-at или остановиться после нужной через stop-after. Для evaluators предусмотрены режимы offline-evaluators, online-evaluators и data-only; они взаимоисключающие, а offline является режимом по умолчанию. Можно выбрать формат сгенерированного артефакта, ограничить число trace и задать timeframe. Контрольные точки имеют команды continue, stop и redo: stop завершает проход с сохранённым состоянием, redo повторяет текущую фазу, а continue переводит процесс дальше после проверки результата. Пайплайн предназначен для уже инструментированного приложения, а не для подключения telemetry с нуля. Без traces за выбранный период precheck останавливает работу; это сигнал расширить timeframe или проверить ml_app. Наличие trace само по себе не доказывает качество ответа: классификация, evaluator и эксперимент отвечают на разные вопросы и должны оставаться различимыми. Публикация dataset и запуск эксперимента могут создавать внешние Datadog-объекты, поэтому границу stop-after следует выбирать до мутационной фазы, если нужна только read-only диагностика. Полученные рекомендации следует трактовать как результат конкретного набора traces, evaluators и timeframe, а не как универсальную оценку всех запросов приложения.
Для чего подходит
- Классификация production traces
- Bootstrap evaluators и datasets
- Запуск и анализ agent experiments
Установка
Сначала прочитайте SKILL.md и scripts в исходном репозитории. Затем выполните команду в каталоге проекта:
npx skills add https://github.com/datadog-labs/agent-skills/tree/main/agent-observability/agent-observability-eval-pipeline