behavioral-evals
Behavioral Evals — навык для тестов, которые проверяют решение AI-агента, а не только выполнение функции. Источник относит к таким решениям выбор инструмента, поведение после изменения промпта и устойчивость к регрессиям steerability. Поэтому карточка полезна там, где обычного integration-теста недостаточно: приложение может вернуть технически корректный результат, но агент выбрать неподходящий инструмент, неверно интерпретировать инструкцию или изменить поведение после небольшого изменения prompt. Сначала workflow предлагает определить, требуется ли вообще behavioral-проверка. Если изменение промпта или инструмента не должно менять решение агента, источник направляет задачу в обычные integration-тесты. Если решение нужно зафиксировать, следующий вопрос — насколько сценарий связан с пользовательским интерфейсом. Для UI- и interaction-heavy сценариев используется appEvalTest и AppRig; для остальных — evalTest и TestRig. Такое разветвление отделяет проверку взаимодействия с приложением от проверки логики решения и не заставляет каждый сценарий проходить через один и тот же harness. При создании нового eval источник рекомендует политику USUALLY_PASSES. Она подходит для кандидата, который ещё нужно проверить и стабилизировать. После подтверждения регрессии тест переводится в ALWAYS_PASSES, чтобы зафиксировать ожидаемое поведение. Эта разница важна для каталога: новый сценарий не следует сразу трактовать как вечный контракт, а исправленный или промотированный тест должен явно защищать уже проверенную логику. Для исправления существующего failure и для promotion источник выделяет отдельные guides fixing.md и promoting.md. Практическая настройка начинается с workspace, который нужно заполнить через объект files. Он позволяет смоделировать реалистичный набор файлов, например небольшой Node.js-проект с package.json, чтобы агент принимал решение в контексте, близком к рабочему. Проверка решений выполняется через breakpoint в AppRig или через проверку индекса tool logs, прочитанных методом rig.readToolLogs(). Для UI-сценария источник отдельно упоминает rig.setBreakpoint(); для обычного eval полезно подтвердить по логам, какой tool был выбран и в каком порядке проходил сценарий. Перед опорой на CI навык рекомендует запускать отдельные тесты локально через Vitest и убедиться в их стабильности. Скилл не утверждает, что один успешный прогон доказывает качество агента: нужно выбрать правильный harness, задать реалистичные файлы и проверить именно решение, которое должно остаться неизменным. Подробные стратегии assertions, Mock MCPs, исправление падений и критерии promotion вынесены в references/creating.md, references/fixing.md и references/promoting.md; сама карточка не заменяет эти руководства и не является тестом бизнес-функциональности приложения.
Для чего подходит
- Проверка decision logic агента
- Диагностика prompt steering
- Регрессионные behavioral-тесты
Установка
Сначала прочитайте SKILL.md и scripts в исходном репозитории. Затем выполните команду в каталоге проекта:
npx skills add https://github.com/google-gemini/gemini-cli/tree/main/.gemini/skills/behavioral-evals