agent-platform-inference
Agent Platform GenAI Inference — справочный навык для подключения к Google Cloud Agent Platform и выполнения inference с генеративными моделями. Он разделяет три сценария: first-party модели Google, включая Gemini; third-party OpenMaaS-модели, например Llama, DeepSeek и Qwen; и custom endpoints с числовым ресурсом projects/.../endpoints/<id>. Материал предназначен для подготовки вызовов через GenAI SDK, OpenAI SDK или legacy Agent Platform SDK, настройки base URL и global или regional endpoint, а также диагностики типичных ошибок API. Он не предназначен для развёртывания моделей на endpoints или проведения model evaluations. До запуска команд описан отдельный этап подготовки среды. Для Google Cloud нужны вход через gcloud auth login и Application Default Credentials, а также включённый aiplatform.googleapis.com. Python-примеры используют vertexai, google-genai и openai; сначала предлагается проверить, доступны ли эти библиотеки, и устанавливать requirements только если импорт действительно не проходит. Скрипты запускаются обычным python3, без создания виртуального окружения, поскольку пустая среда может скрыть уже доступные зависимости и привести к лишней установке. Встроенная проверка verify_all.sh обозначена как необязательная проверка end-to-end. Выбор клиента зависит от семейства модели. Для Gemini предпочтителен Google GenAI SDK, хотя допустим OpenAI SDK для совместимости и legacy SDK для существующих проектов. Для OpenMaaS рекомендован OpenAI SDK через совместимый endpoint; также описаны варианты GenAI SDK и legacy SDK. Перед генерацией кода нужно подтвердить семейство модели и SDK: если семейство неизвестно, источник предлагает сначала уточнить его, а не угадывать. Идентификаторы моделей и их доступность нельзя считать вечными примерами из текста — документация Google должна быть проверена перед конкретным вызовом. Для управляемой Gemini-модели, включая Gemini LoRA-адаптер, регион проверяется отдельно и только для названной модели. Источник требует живой минимальный generateContent-запрос к указанному региональному endpoint. Ответ 200 означает доступность в регионе; 404 означает, что следует остановиться и не менять регион молча; любой другой ответ, включая permission denied, quota или transient failure, не доказывает ни доступность, ни отсутствие модели. Для OpenMaaS описан global openapi endpoint как основной вариант, но конкретный ID и способ подключения всё равно нужно сверять с актуальным Model Garden. Навык отдельно разбирает custom endpoints: tuned Gemini, самостоятельно размещённые OSS LLM и legacy custom, classification или embedding endpoints. Для них важны точный ресурс endpoint и соответствующий host; вызов общего publisher endpoint не является универсальной заменой. В разделе диагностики 429 связывается с Dynamic Shared Quota и требует строгого exponential backoff и retry; ошибка 400 указывает на неверный формат, параметр или Model ID; 404 требует проверки включения модели, региона и endpoint. Для некоторых Gemini-вызовов слишком маленький maxOutputTokens может привести к пустому тексту, поэтому параметр не следует без причины занижать. Это operational reference, а не гарантия доступа, квоты или неизменности API. Нужны действующие учётные данные, включённый сервис, проверенный регион, корректный Model ID и согласованный SDK. Для inference с расходом квоты правила навыка требуют интерактивного подтверждения параметров: модели, SDK и prompt.
Для чего подходит
- Вызов Gemini и OpenMaaS-моделей
- Настройка GenAI и OpenAI SDK
- Диагностика 429, 400 и 404 ошибок
Установка
Сначала прочитайте SKILL.md и scripts в исходном репозитории. Затем выполните команду в каталоге проекта:
npx skills add https://github.com/google/skills/tree/main/skills/cloud/agent-platform-inference