gke-cluster-creation
Навык gke-cluster-creation из официального репозитория Google предназначен для планирования создания кластеров Google Kubernetes Engine, их provisioning и проверки готовности к production. Его область ограничена самим кластером: выбором режима, параметров, сети, защитных настроек, запуском операции и последующей проверкой. Он не заменяет навык для onboarding приложений и не описывает конфигурацию deployment приложения после того, как кластер уже создан. В источнике предусмотрены готовые направления для Autopilot, Standard Regional, GPU/AI Inference и AI Hypercompute, поэтому карточка полезна как рабочая карта выбора инфраструктурного сценария, а не как общий справочник по Kubernetes. Рабочий процесс начинается с выяснения контекста. Перед действием нужно увидеть существующие кластеры через list_clusters, а если проект неизвестен — получить project_id из конфигурации gcloud. Для нового кластера нужны проект, регион или зона, имя кластера и тип окружения. Если существенных входных данных нет, источник предписывает запросить их у пользователя до создания. Затем выбирается режим и объясняется компромисс между стоимостью, доступностью и уровнем ручного управления. Следующий шаг — настройка сети: можно использовать автоматически созданную подсеть или заранее подготовленную сеть. До изменения инфраструктуры нужно показать и проверить целевую конфигурацию, а только после подтверждения вызвать create_cluster через MCP или gcloud. Создание отслеживается через get_operation, а итог проверяется get_cluster с readMask="*", чтобы убедиться, что применились именно согласованные параметры. Autopilot назван в источнике golden path и является режимом по умолчанию для новых production-кластеров, если нет конкретного требования, которое он не покрывает. В Autopilot узлами управляет Google, а тарификация описана как оплата выделенных ресурсов pod. Пользователь может задавать ComputeClasses для настройки размещения, а GPU и TPU поддерживаются через соответствующие классы. Standard оставляет управление узлами пользователю, тарифицируется на уровне виртуальных машин и подходит для случаев, где нужны настройка ядра, особая операционная система или привилегированные workload. Для Standard Regional источник указывает распределение узлов по зонам региона; это вариант для высокой доступности и собственного контроля над node pool, но он требует более явной настройки машин, дисков и автомасштабирования. Для production-настройки источник рекомендует уменьшать поверхность атаки: использовать private nodes, private control plane и ограниченные master-authorized networks. VPC-native networking через alias IP позволяет применять правила, связанные с pod. Workload Identity нужен для выдачи workload доступа к сервисам Google Cloud без статических ключей сервисных аккаунтов. Shielded GKE Nodes, secure boot и строгие RBAC-ограничения относятся к базовым защитным мерам. Эти пункты являются параметрами проектируемого кластера, а не обещанием, что любой существующий кластер автоматически соответствует требованиям безопасности; после создания настройки нужно проверить через get_cluster. В части эксплуатационной экономики skill рекомендует включать Cluster Autoscaler и Horizontal или Vertical Pod Autoscaler, подбирать типы машин и число узлов по нагрузке и рассматривать Spot VM для отказоустойчивых batch-задач или inference. Spot не следует трактовать как универсальный production-вариант: сам источник связывает его с fault-tolerant workload. Для надёжности production-окружения предложены региональные кластеры с репликацией control plane между зонами, Pod Disruption Budgets для устойчивости приложений к обслуживанию узлов и release channel REGULAR или STABLE для более безопасных автоматических обновлений. В карточке отдельно полезно различать четыре шаблона. Golden Path Autopilot описан как production-конфигурация с private nodes, ограничением публичного доступа, release channel и включёнными защитными возможностями. Autopilot Dev/Test допускает более быстрый и дешёвый старт с каналом RAPID, но источник прямо предупреждает, что такой вариант не применяет production security hardening и предназначен для разработки или тестирования. Standard Regional подходит, когда Autopilot не удовлетворяет требованиям к ядру, ОС или node management; шаблон включает регион, несколько узлов, balanced-диски, autoscaling, private nodes, Workload Identity и release channel. GPU Inference и AI Workloads могут использовать Autopilot с ComputeClass либо Standard node pool с NVIDIA L4; для варианта g2-standard-4 требуется доступная квота. Практически этот skill стоит применять перед созданием нового GKE-кластера, при сравнении Autopilot и Standard, при подготовке regional production-окружения, при проектировании приватной сети и Workload Identity, а также для GPU-инференса, когда сначала нужно проверить quota и способ размещения ускорителя. Ограничения нужно фиксировать до запуска: без project_id, location, cluster_name и типа окружения нельзя безопасно сформировать запрос; отсутствие подтверждения конфигурации не является разрешением на create_cluster; Autopilot не следует выбирать вопреки требованиям к кастомному ядру или привилегированным workload; Dev/Test шаблон нельзя выдавать за hardened production; наличие шаблона не означает, что приложение уже развернуто. Так карточка отражает подтверждённый workflow Google и помогает отделить планирование кластера от последующего onboarding приложений.
Для чего подходит
- Выбор режима и шаблона GKE-кластера
- Планирование provisioning Autopilot или Standard Regional
- Проверка production readiness GPU и AI-кластеров
Установка
Сначала прочитайте SKILL.md и scripts в исходном репозитории. Затем выполните команду в каталоге проекта:
npx skills add https://github.com/google/skills/tree/main/skills/cloud/gke-cluster-creation