huggingface-datasets
Этот навык предназначен для исследовательского чтения датасетов Hugging Face через Dataset Viewer API. Он помогает получить метаданные, увидеть первые строки, пройти по данным страницами, найти текстовые совпадения, применить фильтр и обнаружить parquet-файлы, не скачивая весь набор данных только ради первичного осмотра. Основной адрес API в инструкции — https://datasets-server.huggingface.co, стандартный метод — GET, а параметры запроса должны быть URL-encoded. Рабочий процесс начинается с необязательной проверки доступности набора через endpoint /is-valid. Затем нужно определить config и split через /splits, посмотреть образец через /first-rows и, если требуется, читать строки через /rows. Для пагинации offset начинается с нуля, а length для строковых endpoint обычно не должен превышать 100. Ответы могут содержать num_rows_total, num_rows_per_page и partial; эти поля нужны, чтобы понять, была ли выборка полной, и корректно продолжить чтение, а не принять одну страницу за весь датасет. Для поиска по строковым колонкам предусмотрен /search с query, offset и length. Для условий по значениям используется /filter с параметрами where и, при необходимости, orderby. Эти операции остаются read-only и подходят для разведки структуры, проверки примеров или отбора небольшого фрагмента для дальнейшего анализа. Отдельные endpoint /size и /statistics дают сводные размеры и статистику, /parquet перечисляет доступные parquet shards, а /croissant возвращает Croissant metadata, если она опубликована для конкретного набора. Инструкция фиксирует порядок разрешения параметров: сначала нужно знать namespace/repo, затем фактические config и split, после чего подставлять их в URL и кодировать специальные символы. Нельзя механически повторять пример для imdb или считать, что у любого датасета одинаковые имена конфигураций. Если ответ помечен partial, дальнейшая пагинация должна опираться на фактические поля ответа. Так можно отдельно проверить количество строк, доступные splits и ограничения Dataset Viewer до принятия решения о загрузке. Для gated или private datasets API требует Authorization: Bearer с HF_TOKEN. Токен не является заменой прав доступа, а наличие URL не означает, что набор доступен без аутентификации. При работе с traces источник рекомендует исходно выбирать private repository: JSONL-трассы Claude Code, Codex или Pi Agent могут содержать prompts, пути файлов, результаты команд, секреты и персональные данные. Перед публикацией таких данных нужно отдельно оценить конфиденциальность, а не отправлять локальный каталог сессий по умолчанию. В репозитории описаны и дополнительные потоки создания/загрузки parquet через Hub UI или CLI, но это уже изменяющая операция и требует явного write-доступа. Для неё предложены @huggingface/hub либо hf-команды и последующая проверка /parquet. Сам навык не гарантирует качество разметки, лицензионную пригодность, воспроизводимость обучения или отсутствие персональных данных. Он даёт аккуратный read-only способ исследовать публичные и авторизованные данные; итоговые выборки, фильтры, лицензии и стоимость дальнейшего хранения нужно проверять отдельно. Практический сценарий выглядит так: проверить доступность, получить список config/split, посмотреть первые строки, запросить нужные страницы с offset и length, затем сравнить num_rows_total с полученным объёмом и при необходимости запросить size, statistics или parquet. Такой порядок подходит для выбора набора данных под ML-задачу и подготовки небольшого доказуемого среза, но не заменяет полноценный data-quality аудит и не превращает preview в локальную копию всего датасета.
Для чего подходит
- Исследование структуры Hugging Face Dataset
- Поиск и фильтрация строк через Dataset Viewer API
- Выбор набора данных для ML-задачи
Установка
Сначала прочитайте SKILL.md и scripts в исходном репозитории. Затем выполните команду в каталоге проекта:
npx skills add https://github.com/huggingface/skills/tree/main/skills/huggingface-datasets