gemini-api
gemini-api — навык Google для работы с Gemini API в Gemini Enterprise Agent Platform, которую прежние материалы могут называть Vertex AI. Он предназначен для enterprise-сценариев, где нужно использовать Google Cloud или Agent Platform и единый Google Gen AI SDK. Для запуска требуется активная Google Cloud-аутентификация и включённый Agent Platform API; это не инструкция по безнастроечному локальному вызову модели. Возможности, перечисленные в исходном навыке, включают обычную генерацию текста для чата, completion и summarization, multimodal understanding изображений, аудио, видео и документов, function calling, structured output с JSON по схеме, context caching и embeddings для semantic search. Для потоковых приложений предусмотрен Live Realtime API с двунаправленной передачей данных и низкой задержкой для voice и video. Batch Prediction предназначен для больших асинхронных наборов данных. В отдельных workflow также рассматриваются генерация и редактирование изображений, видео, object detection, safety-фильтры, content caching, thinking/reasoning и настройка моделей. Ключевое практическое правило — использовать Gen AI SDK: google-genai для Python, @google/genai для JavaScript и TypeScript, google.golang.org/genai для Go, com.google.genai:google-genai для Java и Google.GenAI для C#. Исходник отдельно запрещает начинать новые решения с legacy SDK google-cloud-aiplatform, @google-cloud/vertexai и google-generativeai. Это важно при миграции существующего проекта: сначала нужно отделить старый клиент от целевого API, затем перенести аутентификацию, конфигурацию и вызовы на соответствующий пакет. Для Application Default Credentials навык показывает переменные GOOGLE_CLOUD_PROJECT, GOOGLE_CLOUD_LOCATION и GOOGLE_GENAI_USE_ENTERPRISE=true. По умолчанию предлагается location=global с автоматической маршрутизацией, а при явном запросе региона нужно указать его в GOOGLE_CLOUD_LOCATION и свериться с официальным перечнем поддерживаемых регионов. В Express Mode используется GOOGLE_API_KEY вместе с GOOGLE_GENAI_USE_ENTERPRISE=true. Клиент можно инициализировать без жёстко зашитых параметров, чтобы он получил значения из окружения; секреты нельзя помещать в исходный код. Такой навык подходит для корпоративного чата по документам, мультимодального разбора, извлечения структурированного JSON, вызова внутренних функций, семантического поиска через embeddings, генерации медиа, realtime voice/video и пакетной обработки данных. Для каждого сценария он связывает задачу с отдельным workflow: text and multimodal, embeddings, structured output and tools, media generation, Live API или advanced features. Официальная документация Agent Platform и REST API в исходнике обозначены как source of truth, поэтому детали API и актуальный список моделей нужно сверять там перед production-релизом. Ограничения следует принять заранее. Нужны действующие права Google Cloud, включённый API и корректно выбранный режим аутентификации; без этого примеры SDK не доказывают работоспособность интеграции. Названия и стабильность моделей нельзя считать вечными: исходник различает новые и legacy-линейки и советует для production консультироваться с актуальными стабильными версиями. Подробные инструкции по мультимодальности, embeddings, tools, media, Live API, safety и tuning вынесены в references исходного репозитория. Карточка описывает подтверждённый маршрут и границы навыка, но не заменяет проверку текущей официальной документации, квот, регионов и политик безопасности конкретного проекта.
Для чего подходит
- Интеграция Gemini API в enterprise-приложение
- Обработка изображений, аудио, видео и документов
- Function calling, structured output и Live API
Установка
Сначала прочитайте SKILL.md и scripts в исходном репозитории. Затем выполните команду в каталоге проекта:
npx skills add https://github.com/google/skills/tree/main/skills/cloud/gemini-api