gemini-api-dev
gemini-api-dev — официальный workflow из репозитория Google Gemini Skills для разработки приложений на hosted-моделях Gemini и Gemma. Он охватывает мультимодальный ввод и вывод, включая текст, изображения, аудио и видео, вызов функций, структурированные ответы, выбор модели и обращение к актуальной документации. Навык рассчитан на прикладной код вокруг Gemini API: сначала определяется нужная возможность, затем сверяются доступные модели и выбирается SDK для конкретного языка. В исходнике отдельно перечислены поддерживаемые библиотеки для Python, JavaScript и TypeScript, Java и Go, поэтому инструкция не сводится к одному языку или одной форме примера. В критических правилах источника есть перечень текущих моделей Gemini 3.6 Flash, Gemini 3.5 Flash-Lite, Gemini 3.1 Pro Preview, моделей для генерации и редактирования изображений, Gemini 2.5 Pro, Gemini 2.5 Flash и семейств Gemma 4. Для ряда моделей указаны размеры контекстного окна; в частности, для текстовых и агентных вариантов из списка приводится значение до 1M токенов, а для image-preview вариантов отдельно указаны лимиты текстового и визуального контекста. Эти данные нужно воспринимать как снимок исходного skill, а не как бессрочную гарантию доступности: перед реализацией следует проверить текущую страницу моделей, регион, квоты, лимиты и статус preview-возможности. Базовый сценарий запуска показан для каждого из четырёх SDK. В Python используется пакет google-genai и client.models.generate_content; в JavaScript и TypeScript — @google/genai и объект GoogleGenAI; для Go указан пакет google.golang.org/genai; для Java — com.google.genai:google-genai. Общая идея одинакова: создать клиент, выбрать идентификатор модели, передать содержимое и обработать текст ответа. Источник также направляет к официальным страницам установки и к версии Java-зависимости, поэтому конкретную команду и номер версии нельзя бездумно переносить из старого примера — их нужно перепроверять в документации поставщика. Навык помогает не только написать первый вызов. Он задаёт маршрут для мультимодальных запросов, function calling и structured outputs, а также напоминает сначала определить модель и проверяемые API-возможности. Для документационного lookup предпочитается специальный search_docs MCP, если он установлен; тогда результаты этого инструмента считаются единственным источником API-деталей в рамках workflow. Если MCP нет, fallback направляет к официальному индексу Gemini API llms.txt и связанным страницам text generation, function calling, structured output, image generation, image understanding и миграции SDK. Это полезно для изменений интерфейса: вместо воспроизведения запомненной сигнатуры нужно сначала найти текущую страницу документации. Важная граница проходит между обычной генерацией контента и Gemini Live API. Текущий skill может помочь с текстом, изображением, аудио и видео в контексте поддерживаемых Gemini API-вызовов, но двусторонний realtime-стриминг не входит в его основной workflow. Для WebSocket-сценариев, voice activity detection, native audio, управления сессией, function calling в live-режиме и ephemeral tokens источник предлагает отдельный gemini-live-api-dev skill. Такое разделение не обещает, что одинаковые методы или ограничения применимы к двум API. Ограничения следует учитывать до публикации приложения. Наличие модели в списке skill не подтверждает текущую доступность в каждом аккаунте, регионе или SDK; preview-идентификаторы, версии библиотек и deprecated-пути требуют отдельной проверки. Источник прямо предупреждает о legacy-пакетах google-generativeai и @google/generative-ai и направляет к новым библиотекам, но сам навык не мигрирует существующий проект автоматически и не проверяет секреты, биллинг, безопасность или нагрузку. После примера остаются обычные инженерные задачи: обработка ошибок, валидация структурированного ответа, контроль стоимости, тесты, ограничения контекста и проверка фактического поведения выбранной модели. Практический результат gemini-api-dev — понятный стартовый маршрут для приложения: определить тип входа и требуемую capability, выбрать подтверждённую модель, установить соответствующий официальный SDK, сверить свежую документацию, реализовать минимальный вызов и отдельно проверить границы результата. Навык полезен для интеграции Gemini и Gemma, но не подменяет актуальную Model documentation и не даёт оснований переносить названия моделей, лимиты или API-сигнатуры в production без повторной проверки.
Для чего подходит
- Интеграция Gemini API через SDK
- Multimodal и structured-output сценарии
- Function calling и выбор модели
Установка
Сначала прочитайте SKILL.md и scripts в исходном репозитории. Затем выполните команду в каталоге проекта:
npx skills add https://github.com/google-gemini/gemini-skills/tree/main/skills/gemini-api-dev