together-embeddings
Навык together-embeddings предназначен для той части AI-пайплайна, где нужно превратить текстовые данные и запросы в плотные векторные представления, выполнить семантический поиск, собрать retrieval- или RAG-контур и, при необходимости, повысить точность отбора кандидатов отдельным этапом reranking. Его назначение — подготовка и улучшение поиска перед генерацией финального ответа, а не написание самого ответа языковой моделью. Такой границей удобно разделять две разные задачи: embedding описывает объект в векторном пространстве для последующего сравнения, а генеративная модель отвечает уже после того, как система нашла подходящий контекст. В рабочем сценарии сначала нужно определить, действительно ли задаче нужны векторы или retrieval. Затем выбираются embedding-модель и форма пакетной обработки, документы корпуса и пользовательские запросы преобразуются согласованным способом, а результаты сохраняются в хранилище, из которого можно получить близкие кандидаты. Для прототипа и небольшого объёма подходит показанный в исходном skill in-memory store с косинусным сходством. Для production-масштаба сам skill рекомендует выделенное векторное хранилище, потому что хранение и поиск не должны зависеть от памяти одного процесса. В RAG-пайплайне этот этап становится прослойкой между исходными документами, выборкой релевантных фрагментов и последующим вызовом chat-модели. Reranking здесь рассматривается как второй этап точности, а не как замена embedding-поиску. Сначала retrieval формирует набор кандидатов, после чего reranker может переупорядочить их перед передачей контекста дальше. За такую дополнительную точность нужно платить задержкой и учитывать требование отдельного dedicated endpoint: исходный материал не обещает serverless rerank как универсальный режим. Если выделенный endpoint недоступен, разумным запасным вариантом остаётся ранжирование по косинусному сходству. Embeddings и reranking также следует держать концептуально раздельно, чтобы можно было независимо менять retrieval-часть и второй этап оценки. У навыка есть практические ограничения, которые важно проверить до реализации. Для Python-примеров нужен Together v2 SDK версии 2.0.0 или новее; при старом SDK исходная инструкция предусматривает обновление зависимости. Контекст embedding-модели ограничен 514 токенами, поэтому длинные документы требуется разбивать на фрагменты до embedding-операции. Документы корпуса и запросы должны обрабатываться согласованно, иначе сравнение векторов теряет смысл. Для больших офлайн-бэкфиллов предусмотрена отдельная передача в batch-inference skill, а для финального текста — together-chat-completions. Если reranking требует выделенного развёртывания, используется dedicated-model-inference skill. Исходный репозиторий содержит отдельные примеры для embeddings и reranking, semantic search и RAG: Python- и TypeScript-скрипты показывают embedding с последующим rerank, in-memory vector store с cosine-similarity retrieval и композицию retrieval с generation. Подробности API, выбор моделей, embeddings overview, rerank overview и reference-страницы вынесены в официальную документацию Together AI. Эти материалы позволяют начинать с небольшого прототипа, отдельно проверить качество retrieval, затем решить, нужен ли второй этап reranking и какое хранилище соответствует фактическому объёму. Итоговый сценарий использования навыка — построить проверяемый retrieval-контур: подготовить короткие согласованные фрагменты, получить их embeddings, сохранить векторные представления, преобразовать запрос тем же способом, выбрать кандидатов, при необходимости rerank-нуть их через доступный dedicated endpoint и только затем передать отобранный контекст генеративному skill. Ограничения по размеру контекста, версии SDK, типу endpoint и масштабу хранилища нельзя скрывать за общим описанием «семантического поиска»: они непосредственно определяют, будет ли решение работать для прототипа, RAG-сервиса или пакетной обработки. Для проверки источника использованы публичные SKILL.md и LICENSE репозитория Together AI, а также связанные официальные страницы embeddings и rerank.
Для чего подходит
- Генерация векторных представлений
- Построение semantic search и RAG
- Улучшение retrieval через reranking
Установка
Сначала прочитайте SKILL.md и scripts в исходном репозитории. Затем выполните команду в каталоге проекта:
npx skills add https://github.com/togethercomputer/skills/tree/main/skills/together-embeddings