huggingface-local-models
Этот навык помогает подобрать и запустить языковую модель локально через llama.cpp, используя совместимые с ним файлы GGUF и Hugging Face Hub. В исходном SKILL.md перечислены CPU, Mac Metal, CUDA и ROCm как варианты аппаратного выполнения, а основной сценарий строится вокруг llama-cli или llama-server. Навык полезен, когда нужно не просто найти репозиторий модели, а сопоставить его с конкретным локальным рантаймом, выбрать существующий файл квантизации и получить воспроизводимую команду запуска. Рекомендуемый порядок начинается с поиска на Hub с фильтром apps=llama.cpp. Затем следует открыть страницу репозитория в режиме локального приложения, использовать показанный там фрагмент запуска и рекомендацию по кванту, а точное имя GGUF-файла подтвердить через API дерева файлов Hugging Face с рекурсивным просмотром. Если репозиторий предоставляет нестандартное имя файла, навык предлагает перейти от короткой формы -hf к явной паре --hf-repo и --hf-file. Если готового GGUF нет, веса Transformers можно скачать и конвертировать в GGUF, после чего отдельно выполнить квантизацию. Конвертация таким образом остаётся запасным путём, а не первым шагом. Для установки llama.cpp исходник предлагает пакетный вариант через Homebrew или winget либо сборку из официального репозитория llama.cpp. Для закрытых или gated-репозиториев сначала нужна аутентификация hf auth login. После запуска локального сервера можно проверить OpenAI-совместимый endpoint через curl; наличие процесса само по себе не подтверждает, что выбранные модель и файл действительно загрузились, поэтому важен короткий smoke test с запросом к /v1/chat/completions. Выбор кванта связывается с рекомендацией конкретной страницы Hub и доступной памятью. В качестве обычной отправной точки указан Q4_K_M; для кода и технических задач при достаточной памяти предлагаются Q5_K_M или Q6_K. При более жёстком ограничении памяти рассматриваются Q3_K_M, Q4_K_S и репозиторные варианты IQ или UD-*. Метки из репозитория нужно сохранять как есть, а файлы mmproj-*.gguf не следует путать с основным checkpoint: это projector-веса. Поэтому навык не обещает одинаковое качество на любом железе: квантизация — компромисс между размером, скоростью и качеством, который нужно сверять с задачей и ресурсами. Граница применения понятна: навык описывает поиск Hub, точный выбор GGUF, команды llama.cpp и локальную OpenAI-совместимую подачу, но не заменяет проверку лицензии каждой модели, измерение качества на собственном наборе запросов или полноценное планирование production-инфраструктуры. Для обычного локального эксперимента достаточно найти совместимый репозиторий, подтвердить имя файла, выбрать квант по памяти и выполнить smoke test сервера; дополнительные инструкции по обнаружению Hub, квантизации и аппаратным режимам следует подключать только когда этого требует конкретная модель.
Для чего подходит
- Выбор GGUF-модели для локального запуска
- Настройка llama.cpp на доступном ускорителе
- Проверка требований модели к памяти
Установка
Сначала прочитайте SKILL.md и scripts в исходном репозитории. Затем выполните команду в каталоге проекта:
npx skills add https://github.com/huggingface/skills/tree/main/skills/huggingface-local-models