hf-cloud-sagemaker-deployment-planner
Навык Hugging Face предназначен для начального планирования размещения модели в Amazon SageMaker AI. Он используется, когда нужно deploy, host, serve или expose модель в AWS, и служит входной точкой перед специализированными навыками развёртывания. Его задача — не сразу создать endpoint, а собрать минимальные вводные, выбрать подходящий путь и передать работу следующему этапу. В контексте нужно определить идентификатор модели Hugging Face, расположение артефактов в S3 или имя модели, а также понять тип нагрузки: генерация текста, embedding, reranker, классификатор, NER или другой вариант. Дополнительно навык предлагает выяснить примерную частоту запросов, требования к задержке и чувствительность к стоимости. Регион берётся из отдельного context-discovery шага, поэтому его не требуется придумывать или запрашивать без необходимости. После discovery навык сравнивает несколько путей. Real-time endpoint подходит для устойчивого трафика и интерактивной задержки. Real-time с масштабированием до нуля полезен для редких или тестовых вызовов, если клиент умеет пережить длинное пробуждение и повторить запрос. Serverless inference рассчитан на прерывистую нагрузку и допустимые cold starts, но не является хорошим выбором для крупных LLM с жёстким SLA из-за ограничений памяти и времени запуска. Async inference предназначен для длительных вычислений, больших payload и очереди с результатом через S3; для вызова InvokeEndpoint нужно учитывать предел синхронного запроса в 60 секунд. Batch transform закрывает офлайн-скоринг датасета, а Bedrock Custom Model Import — поддерживаемые семейства, которым нужен Bedrock-совместимый API без дополнительной custom inference logic. Для LLM real-time является исходной рекомендацией, пока трафик не окажется редким или само вычисление не станет долгим. Для embedding-отправки навык отдельно предостерегает от автоматического выбора GPU: небольшие модели до 1B параметров при умеренном трафике часто разумнее проверять на CPU. Для генерации изображений, видео и других операций, которые длятся больше 30 секунд и приходят всплесками, приоритетом становится async-путь с очередью и scale-to-zero между партиями. В репозитории есть скриптовые пути для real-time, real-time scale-to-zero и async; serverless, batch и Bedrock import требуют передачи к соответствующему специалисту, а не имитации отсутствующего скрипта. До рекомендации типа инстанса источник требует проверить квоты SageMaker в нужном регионе. Для GPU-квот значение по умолчанию во многих аккаунтах равно нулю, поэтому неподтверждённый тип может закончить deploy ошибкой ResourceLimitExceeded. В примере проверки используется AWS Service Quotas с фильтром по квотам endpoint usage и положительным Value. Для распространённого уровня 24 GB рассматриваются ml.g5.* на A10G и ml.g6.* на L4: g6 новее и обычно дешевле по часу, тогда как g5 может дать более высокую пропускную способность благодаря памяти. Если модели не хватает 24 GB, источник отдельно указывает ml.g6e.* с 48 GB. Эти варианты нельзя обещать без проверки фактической квоты аккаунта. Результатом навыка должна быть короткая ясная рекомендация с выбранным путём, альтернативой и причиной выбора, после чего требуется дождаться подтверждения пользователя перед созданием оплачиваемой инфраструктуры. Навык не генерирует plan.yaml или другой план-файл без явного запроса: план остаётся в разговоре. Ограничения также важны: неизвестные параметры образа, SDK или квоты нужно проверять через специализированные навыки, а не угадывать; отказ в quota-check фиксируется как ограничение, но сам по себе не блокирует дальнейшее объяснение реального лимита при deploy.
Для чего подходит
- Планирование SageMaker deployment
- Выбор способа model serving
- Подготовка endpoint для inference
Установка
Сначала прочитайте SKILL.md и scripts в исходном репозитории. Затем выполните команду в каталоге проекта:
npx skills add https://github.com/huggingface/skills/tree/main/skills/hf-cloud-sagemaker-deployment-planner