agent-observability-eval-bootstrap
Agent Observability Eval Bootstrap — официальный навык Datadog Labs для подготовки evaluators по production LLM traces. Его назначение — помочь разобраться, какие измеримые свойства ответа или работы AI-агента стоит проверять, а затем оформить эти проверки в пригодный для ревью результат. Навык работает с ml_app и опциональным RCA-отчётом или гипотезой отказа. Если передан только ml_app, используется cold start: навык исследует доступные traces, профиль приложения и повторяющиеся сигналы качества. Если есть RCA с таксономией отказов или failure hypothesis, он использует этот материал как исходные цели оценки, не начиная открытое исследование заново. По умолчанию выбран publish-режим. Сначала навык определяет доступный backend, проверяет покрытие существующими Datadog evaluators, затем получает успешные spans, группирует их по traces и изучает содержимое representative spans. Для agent- и multi-step-приложений он может сопоставлять иерархию agent, tool, retrieval и llm spans, чтобы понять, зависит ли verdict от одного span или от всей trace. Отдельно проверяется наличие session_id и его связь с несколькими trace_id: только такой сигнал оправдывает предложения для session scope. При анализе учитываются generic quality signals, domain-specific intents, сущности в результатах, формы аргументов инструментов, правила persona и наблюдаемые failure modes; источник не разрешает выдумывать domain-specific evaluator без следа в sampled traces. Предложенная suite проходит обязательную точку подтверждения: пользователь может оставить, удалить или переименовать evaluators. Навык классифицирует их как span-, trace- или session-scoped и показывает evidence, target span, критерий pass/fail, шаблонные переменные и, для publish, параметры integration provider, model, sampling percentage и filter. После подтверждения online LLM-judge evaluators записываются в Datadog только как disabled drafts; автоматической публикации и автоматического включения нет. Ничего не начинает оценивать production spans, пока draft отдельно не включён в UI. Это важное ограничение для безопасного rollout. Кроме publish доступны sdk_code для Python-файла с Datadog Evals SDK и offline экспериментов, data_only для самостоятельной JSON-спецификации и emit_dataset для выгрузки DatasetRecordRaw[] из production traces. SDK-режим использует BaseEvaluator и LLMJudge, а также может опираться на JSON-, length-, string- и regex-проверки. В prompt-шаблонах применяются input_data, output_data, expected_output и metadata для offline-контекста; online-режим работает с полным span JSON и соответствующими span-, trace- или session-путями. Ограничение навыка состоит в том, что качество предложения зависит от доступности и репрезентативности traces, конфигурации backend и подтверждённого контекста приложения; сам навык не заменяет пользовательскую проверку suite и не является security-аудитом.
Для чего подходит
- Генерация evaluators из LLM traces
- Подготовка online LLM-judge конфигурации
- Создание evaluation suite без автоматического включения
Установка
Сначала прочитайте SKILL.md и scripts в исходном репозитории. Затем выполните команду в каталоге проекта:
npx skills add https://github.com/datadog-labs/agent-skills/tree/main/agent-observability/agent-observability-eval-bootstrap