together-batch-inference
Навык Together Batch Inference предназначен для больших автономных inference-задач, где задержка не является главным требованием. Исходное описание связывает его с Batch API Together AI и перечисляет сценарии массовой классификации, генерации синтетических данных, преобразования датасетов, крупного суммирования и обогащения. Такой режим подходит, когда есть много независимых запросов, допустим JSONL-файл, результат может появиться через минуты или часы, а стоимость важнее немедленного ответа. В описании skill заявлен потенциал Batch API до 50% меньшей стоимости, но конкретная экономия зависит от условий провайдера и самого запуска; карточка не превращает это заявление в гарантию для каждой задачи. Основной workflow начинается с JSONL: каждая строка должна содержать стабильный custom_id и body запроса. Затем файл загружается с purpose=batch-api, создаётся batch с input_file_id и целевым endpoint, задача опрашивается до terminal-состояния, после чего скачиваются файлы успешных результатов и ошибок. Финальный шаг — сопоставить ответы и ошибки с исходными строками по custom_id. Поэтому идентификатор следует делать постоянным и осмысленным: он нужен не только для запуска, но и для безопасной reconciliation при частичном успехе или повторной обработке. Ошибочный файл нужно проверять вместе с output-файлом, а не считать завершённую batch-задачу автоматически полностью успешной. Выбор batch режима имеет явное ограничение: запросы должны быть независимыми. Если вычисление каждого следующего ответа зависит от общего состояния диалога, промежуточного результата или последовательного шага, этот skill, вероятно, не подходит. Для real-time запросов и tool calling исходник направляет к together-chat-completions, для управляемой оценки моделей — к together-evaluations, для retrieval-векторов — к together-embeddings. Таким образом, карточка описывает маршрутизацию по типу нагрузки, а не универсальную замену интерактивному API. Для Python workflow нужен Together v2 SDK версии 2.0 или новее; при старой версии исходник предлагает обновить пакет до together>=2.0.0. В API следует использовать input_file_id, а не устаревшие параметры файлов. Метод client.batches.create() возвращает wrapper, из которого batch-объект берётся через response.job, тогда как client.batches.retrieve() возвращает сам batch-объект. Для классификации и labeling-работ skill рекомендует малое значение max_tokens, например 4, temperature: 0 и системную инструкцию, ограниченную единственной меткой: это уменьшает лишний вывод и стоимость, но не отменяет проверку качества. С точки зрения эксплуатации небольшие batch под 1 000 запросов обычно выполняются за минуты, тогда как 24-часовое completion window обозначено как максимальное окно, а не обещание типичной длительности. Операционная последовательность должна учитывать загрузку файла, идентификатор job, polling, terminal status, отдельный error file и сверку custom_id. Официальная документация, указанная в исходнике, — страницы Together AI про Batch Inference и Batch API. Skill даёт конкретный offline-процесс и правила сверки; он не подтверждает качество ответов, наличие квоты, фактическую цену конкретного аккаунта или успешность будущего запуска без реального API-запроса.
Для чего подходит
- Массовая классификация и суммаризация
- Подготовка JSONL для Batch API
- Polling jobs и выгрузка результатов
Установка
Сначала прочитайте SKILL.md и scripts в исходном репозитории. Затем выполните команду в каталоге проекта:
npx skills add https://github.com/togethercomputer/skills/tree/main/skills/together-batch-inference