together-fine-tuning
Together Fine-Tuning — официальный workflow для случая, когда модель нужно адаптировать под собственные данные или нужное поведение, а не просто вызвать готовую модель, измерить её ответы или разместить уже обученный результат. Источник перечисляет несколько режимов: LoRA и full fine-tuning, DPO-настройку предпочтений, VLM fine-tuning, настройку function-calling, reasoning tuning и пути загрузки BYOM через Together AI. Это позволяет сначала сопоставить задачу с типом обучения, а затем выбрать соответствующий сценарий, вместо того чтобы пытаться провести все виды tuning одной универсальной командой. Навык особенно уместен для обучения на собственных instruction- или conversational-данных, улучшения надёжности вызова функций на supervised-примерах, обучения на предпочтениях вместо одних демонстраций, а также для мультимодальных или reasoning-ориентированных моделей. Отдельно описан сценарий, в котором дообученный результат позже передаётся в dedicated endpoint. Если задача не требует обучения, источник направляет к together-chat-completions для обычного inference. Для измерения модели до или после tuning предназначен together-evaluations, для размещения результата — together-dedicated-model-inference, а raw-инфраструктура относится к together-gpu-clusters. Для стандартного LoRA или full fine-tuning источник предлагает начать со скрипта scripts/finetune_workflow.py и прочитать references/data-formats.md. Для DPO используется scripts/dpo_workflow.py, для function-calling — scripts/function_calling_finetune.py, для reasoning — scripts/reasoning_finetune.py, для VLM — scripts/vlm_finetune.py. Поддерживаемые модели и варианты deployment вынесены в отдельные references/supported-models.md и references/deployment.md. Такое разбиение важно: методический скрипт должен соответствовать реальному режиму обучения и его формату данных. Рабочая последовательность состоит из пяти проверяемых шагов. Сначала выбирается метод под требуемое изменение поведения. Затем формат датасета проверяется до расходования ресурсов на обучение. После этого данные загружаются, а возвращённый file ID сохраняется для дальнейшего задания. Job создаётся с явными параметрами конкретного метода; после запуска нужно наблюдать состояние, события, checkpoints и метрики по шагам, прежде чем передавать результат в deployment. Источник отдельно подчёркивает, что успешный fine-tuning сам по себе не означает успешное serving. Практическое ограничение связано со средой и стоимостью: Python-скрипты рассчитаны на Together v2 SDK версии 2.0 или новее. Источник рекомендует предпочитать LoRA, если нет конкретной причины оплачивать full fine-tuning, держать проверку формата рядом с upload и использовать методический скрипт вместо перегруженного generic workflow. Пути к датасету, model ID и suffix следует параметризовать, а не оставлять навсегда привязанными к демонстрационному примеру. Карточка описывает порядок работы и навигацию по источнику; она не заменяет проверку поддерживаемой модели, параметров API, качества данных, лимитов и отдельной готовности deployment.
Для чего подходит
- Подготовка LoRA и full fine-tuning
- Настройка DPO и VLM training
- Адаптация function-calling и reasoning моделей
Установка
Сначала прочитайте SKILL.md и scripts в исходном репозитории. Затем выполните команду в каталоге проекта:
npx skills add https://github.com/togethercomputer/skills/tree/main/skills/together-fine-tuning