agent-platform-deploy
Agent Platform Model Garden Deploy предназначен для активного развертывания open-моделей или собственных весов в endpoints Agent Platform. Он также описывает проверку того, что конкретная модель deployable, наблюдение за незавершенной операцией, последующее undeploy и очистку endpoint. Важная граница scope: публичные Vertex AI deployments, простая проверка списка уже работающих endpoints и запуск оценок моделей вынесены в другие workflow. Поэтому карточка помогает выбрать правильный маршрут, а не объявляет любую задачу вокруг модели задачей deployment. До команд с изменением облачной инфраструктуры skill вводит три уровня безопасности. Read-only операции list, describe и list-deployment-config выполняются без подтверждения и нужны для сбора фактов. Deploy и undeploy считаются изменяющими, но обратимыми действиями: перед ними нужно явно подтвердить предлагаемую команду; для undeploy сначала проверяется, что endpoint и развернутая модель действительно существуют. Delete относится к необратимому удалению: требуется отдельное текстовое подтверждение пользователя, а при 404 или пустом результате описания действие прекращается. Эти правила предотвращают запуск дорогостоящей или разрушительной команды только на основании предположения о текущем состоянии проекта. Подготовка начинается с точных project и region. Источник требует проверить аутентификацию gcloud, выбрать проект и не подменять реальные значения переменными-заглушками. Для discovery используется Model Garden catalog, а list-deployment-config показывает доступные machine types и accelerators для конкретного идентификатора модели. Если в ответе нужно назвать конкретную версию, workflow запрещает выбирать её из памяти: сначала уточняется use case и ограничения по качеству, задержке, стоимости, hardware, квоте и лицензии, затем живой каталог отфильтровывается и точный model ID проверяется отдельной командой. Для Gemini publisher endpoints и fine-tuned Gemini LoRA действует дополнительная проверка региона. Навык требует живой generateContent probe именно для запрошенной модели и региона: HTTP 200 подтверждает доступность, 404 означает, что нельзя молча переключаться на другой регион, а permission, quota или другая ошибка не доказывает ни доступность, ни недоступность. Для open-weights моделей из Model Garden этот региональный probe пропускается: каталог считается глобальным, а фактическими ограничениями остаются поддерживаемое оборудование и квота проекта. Перед deploy нужно обратиться к официальному prediction pricing Agent Platform и оценить list price по machine type, accelerator type и количеству. Оценка не является обещанием фактического счета: скидки и reservations могут изменить bill. Команду рекомендуется запускать асинхронно и затем проверять operation status; после завершения нужно отдельно подтвердить endpoint, а при завершении работы пройти undeploy и cleanup по tier-правилам. Skill не является аудитом безопасности, не гарантирует квоту, стоимость или успешность будущего deployment и не заменяет проверку реального проекта.
Для чего подходит
- Развёртывание моделей Model Garden
- Проверка статуса serving endpoint
- Очистка endpoint и cloud-ресурсов
Установка
Сначала прочитайте SKILL.md и scripts в исходном репозитории. Затем выполните команду в каталоге проекта:
npx skills add https://github.com/google/skills/tree/main/skills/cloud/agent-platform-deploy