huggingface-community-evals
Этот навык предназначен для локальной оценки моделей из Hugging Face Hub. Его задача — помочь выбрать способ запуска проверки, подготовить небольшой воспроизводимый прогон и затем масштабировать его только после успешного smoke-теста. В описании навыка прямо предусмотрены два основных инструмента: inspect-ai и lighteval. inspect-ai подходит, когда нужен явный контроль над задачей оценки и потоком выполнения; lighteval удобен для задач, которые естественно задаются строкой benchmark-задачи, особенно для сценариев в стиле Open LLM Leaderboard. Для inspect-ai предусмотрены два пути. Скрипт inspect_eval_uv.py запускает оценку через inference providers и подходит, когда модель уже поддерживается провайдерами Hugging Face и не требуется прямой контроль над GPU. Скрипт inspect_vllm_uv.py предназначен для локального GPU-запуска: по умолчанию можно использовать vLLM, а при несовместимости архитектуры переключиться на Hugging Face Transformers через backend hf. Для lighteval используется lighteval_vllm_uv.py; он поддерживает vLLM и вариант с accelerate как совместимый запасной путь. В примерах навыка указаны реальные формы параметров — модель, задача и ограничение числа примеров, например --limit 20 или --max-samples 20. Выбор backend зависит от цели и оборудования. vLLM рекомендуется для пропускной способности на поддерживаемых архитектурах. Transformers и accelerate нужны как fallback, когда vLLM не подходит. Для первого запуска навык советует ограничить объём: для inspect-ai использовать небольшой --limit, а для lighteval — --max-samples 10. Такой порядок позволяет сначала проверить загрузку модели, формат шаблона чата, задачу и доступный backend, а не тратить ресурсы на полный прогон при ошибке конфигурации. Практический маршрут начинается с запуска через uv, выбора inspect-ai или lighteval, затем backend и задачи из доступного набора. В качестве примеров приведены mmlu, gsm8k, hellaswag, arc_challenge, truthfulqa, winogrande и humaneval; для lighteval задачи записываются в формате suite|task|num_fewshot и могут объединяться через запятую. Для локального GPU полезно заранее проверить доступность nvidia-smi. Если GPU недоступен, остаётся более лёгкий provider-backed сценарий inspect-ai либо отдельный удалённый workflow Hugging Face Jobs. Граница этого навыка существенна: он описывает локальное выполнение и выбор backend, но не ведёт удалённые Jobs, не публикует model card или model-index, не импортирует Artificial Analysis, не создаёт .eval_results и не автоматизирует PR community-evals. Для закрытых или gated-моделей нужен HF_TOKEN; секрет не является частью конфигурации самого навыка. Рекомендации по размеру модели также приблизительные: модели меньше 3B легче запускать на скромном оборудовании, диапазон 3B–13B требует более сильного GPU, а большие модели могут потребовать высокую память или передачу задачи в отдельный удалённый workflow.
Для чего подходит
- Сравнение Hub-моделей на локальном GPU
- Выбор между vLLM, Transformers и accelerate
- Smoke-проверка задач и inference backend
Установка
Сначала прочитайте SKILL.md и scripts в исходном репозитории. Затем выполните команду в каталоге проекта:
npx skills add https://github.com/huggingface/skills/tree/main/skills/huggingface-community-evals