huggingface-best
Навык HuggingFace Best Model Finder помогает выбрать модель под конкретную задачу и ограничения устройства. Его workflow рассчитан на запросы вроде «какая модель лучше для coding, math, RAG, OCR, speech или multimodal-задачи», а также на вопросы о том, что поместится в памяти Mac с unified memory, GPU с заданным VRAM или CPU. Если устройство не названо, навык не придумывает ограничение и пропускает фильтрацию по размеру, ранжируя варианты по benchmark-результатам. Сначала из запроса извлекаются task и device. Для Apple Silicon учитывается объём unified memory, для дискретной видеокарты — VRAM, а при CPU-only или cloud-сценарии ограничение интерпретируется отдельно. В исходном документе приведена грубая оценка бюджета параметров: для fp16 максимум примерно равен памяти в GB, делённой на 2, а для Q4 — памяти, умноженной на 2. Поэтому 16 GB соответствуют ориентиру 8B для fp16 и 32B для Q4, а 24 GB VRAM — примерно 12B и 48B. Это эвристика для предварительного отбора, не обещание фактического запуска: реальное потребление зависит от runtime, batch, context и других буферов. После разбора задачи skill предлагает получить список официальных benchmark datasets Hugging Face через API datasets с фильтром official и выбрать релевантные наборы по id, tags и description. Затем для каждого выбранного набора запрашиваются верхние строки leaderboard, где сохраняются rank, modelId, value и verified. Документ не ограничивает выбор двумя или тремя benchmark: если несколько наборов действительно покрывают задачу, их можно использовать вместе. Важно сохранить связь model → benchmark и не подменять отсутствие оценки вымышленным числом. Для кандидатов запрашивается metadata модели через Hugging Face REST API или hf-cli. Из ответа извлекаются safetensors.total для оценки размера параметров, license из model-card tags и другие доступные сведения. Если safetensors отсутствует, skill допускает запасной разбор размера из имени модели, например 7B, 8B, 13B, 70B или 72B. Такой fallback должен быть явно отмечен как менее надёжный, потому что имя не всегда полностью описывает фактические веса или конфигурацию. Фильтрация зависит от наличия устройства. Модели выше fp16-бюджета удаляются из локального списка, варианты, которые помещаются только с Q4, получают отдельную отметку, а модель, немного превышающая бюджет и хорошо стоящая в рейтинге, сохраняется с пометкой needs Q4, а не исчезает молча. При отсутствии устройства размерный фильтр пропускается. Далее результаты сортируются по benchmark score, и в выдаче оставляются примерно 5–8 лучших моделей. Proprietary-модели вроде GPT-4, Claude или Gemini допускаются, если они присутствуют на leaderboard, но должны быть помечены API only / not self-hostable; при явном запросе только open/local моделей их нужно исключить. Формат результата — сравнительная таблица с номером, ссылкой на страницу модели Hugging Face, параметрами, колонками benchmark, лицензией и значением On device. Для отсутствующей оценки используется «—», верхний выбор можно отметить звездой, а состояния устройства ограничены понятными значениями Yes (fp16), Q4 only, Too large и API only. После таблицы skill предлагает спросить, хочет ли пользователь запустить рекомендованную модель. Для локального запуска нужно уточнить устройство, если его не было в запросе; для HF Jobs источник указывает официальный guide Hugging Face Jobs. Ошибки не скрываются: если leaderboard не найден, он пропускается с пометкой leaderboard unavailable; если у модели нет hub_repo_details, используется запасной размер из имени. При отсутствии benchmark применяется curated fallback table или поиск по Hub с фильтром задачи, но результат тогда нужно описать как основанный на популярности, а не на benchmark score. Если все leaderboard-запросы не сработали, skill не должен выдавать популярность за объективное первое место. Ограничения карточки существенны: она организует поиск и сравнение по доступным данным Hugging Face, но не запускает inference, не проверяет фактический расход памяти, не подтверждает качество модели вне выбранных benchmark и не заменяет проверку лицензии, latency, безопасности и стоимости в реальном окружении.
Для чего подходит
- Выбор модели под конкретную задачу
- Сравнение моделей по benchmark-результатам
- Фильтрация моделей по памяти устройства
Установка
Сначала прочитайте SKILL.md и scripts в исходном репозитории. Затем выполните команду в каталоге проекта:
npx skills add https://github.com/huggingface/skills/tree/main/skills/huggingface-best