together-evaluations
Together AI Evaluations — официальный навык для управляемой оценки ответов языковых моделей через LLM-as-a-judge. Он нужен в тех случаях, когда требуется не разовый ручной промпт, а повторяемая evaluation-задача с заранее определённым набором данных, явной judge-моделью и результатом, который можно получить после асинхронного выполнения. В описании навыка выделены три базовых типа работы. Classify присваивает каждому ответу одну из заданных меток. Такой режим подходит, когда результат должен быть дискретной категорией: например, нужно разложить ответы по классам качества, безопасности, соответствия политике или успешности задания. Score выставляет числовую оценку, поэтому его можно применять к задачам, где критерии допускают шкалу и последующее сравнение значений. Compare сопоставляет два уже подготовленных варианта ответа и предназначен для A/B-проверок, выбора лучшего результата и сравнения моделей или вариантов промпта с учётом контроля смещения. Навык также допускает сценарии, в которых judge или target находятся у внешнего провайдера, но сама evaluation-операция всё равно выполняется через Together AI. Практический поток начинается с определения типа операции и схемы датасета до написания кода. Затем датасет загружается как eval-файл, сохраняется возвращённый идентификатор, явно задаются judge- и target-модели, после чего задача опрашивается до завершения и при необходимости скачивается файл результатов. Для работы предусмотрены Python- и TypeScript-скрипты `run_evaluation.py` и `run_evaluation.ts`; точные формы запросов, форматы колонок, Jinja2-шаблоны, заранее сгенерированные ответы и изображения описаны в отдельном API reference. Для vision-оценок навык требует колонку `image_data_urls`, а judge и модель должны поддерживать изображения. Для сравнения оба ответа желательно заранее иметь в датасете: это делает сопоставление воспроизводимым и исключает скрытую генерацию одной из сторон. Конфигурацию judge следует задавать явно, потому что скрытые значения по умолчанию затрудняют интерпретацию benchmark. В текущем workflow ожидается Together v2 SDK версии 2.0 или новее; при старой версии требуется обновление SDK. Локальная проверка файла может ошибочно отклонить evaluation-датасет, поэтому в примерах для загрузки используется `check=False`. Навык не предназначен для обычного единичного inference, массовой offline-генерации, fine-tuning или dedicated endpoint: для этих задач указаны отдельные навыки. Он также не заменяет ручное определение критериев: схема данных и выбор judge остаются частью контракта оценки. После запуска нужно дождаться асинхронного статуса, забрать отчёт и сохранить per-row JSONL, если нужен детальный разбор. Таким образом, карточка полезна для benchmark, проверки качества и безопасности, A/B-экспериментов и автоматизации оценок, но её применение ограничено workflow Together AI Evaluations, совместимым SDK и корректно подготовленным датасетом.
Для чего подходит
- Бенчмаркинг ответов языковых моделей
- Сравнение A/B вариантов через judge-модель
- Получение и разбор evaluation-отчётов
Установка
Сначала прочитайте SKILL.md и scripts в исходном репозитории. Затем выполните команду в каталоге проекта:
npx skills add https://github.com/togethercomputer/skills/tree/main/skills/together-evaluations