AI-модельMULTIMODAL202,752 токенов
Разработчик: Z.ai
Технические параметры и возможности
GLM-5V-Turbo — мультимодальная модель Z.AI, созданная прежде всего для задач, где код нужно понимать вместе с изображением, видео или текстовым описанием. В официальной документации она названа первой мультимодальной coding foundation model компании. Модель принимает видео, изображения и текст; документация Z.AI также указывает файлы среди входных форматов. Выходной модальностью является текст, поэтому результатом работы становятся объяснение, план, код, подпись или другой текстовый ответ, а не сгенерированное изображение или видео.
Главная особенность GLM-5V-Turbo — связка восприятия, планирования и исполнения. В описании разработчика модель ориентирована на длинные цепочки действий, сложное программирование и agent-driven задачи. Это делает её полезной, когда агенту нужно посмотреть на интерфейс, понять состояние среды, выбрать следующий шаг и затем выполнить его через доступный инструмент. Z.AI отдельно упоминает сценарии с Claude Code и OpenClaw, но это не означает автоматическую совместимость с любым агентским фреймворком: конкретный результат зависит от адаптера, формата сообщений и набора инструментов в приложении.
Документация описывает несколько инженерных слоёв. Native multimodal fusion связывает визуальные и текстовые признаки на этапах обучения и дообучения; для визуальной части упомянут CogViT, а inference-friendly MTP должен поддерживать эффективное выполнение. Разработчик также сообщает о совместной reinforcement learning-оптимизации более чем по тридцати типам задач, включая STEM, grounding, видео, GUI-агентов и coding-агентов. Это подтверждает широкий охват заявленных сценариев, но не заменяет проверку на собственных данных: опубликованное позиционирование не гарантирует одинаковую точность на каждом интерфейсе, документе или репозитории.
В перечне официальных навыков модели есть image captioning, visual grounding и document-grounded writing. Captioning используется для описания объектов, отношений, атмосферы и действий в кадре. Visual grounding связывает текстовый запрос с конкретным объектом или областью изображения и может использовать ограничивающую рамку. Document-grounded writing предназначен для извлечения информации из пользовательских PDF и Word-файлов и подготовки текста в заданном формате. Эти формулировки задают практические сценарии: составление описаний изображений, поиск нужной области на скриншоте, визуальная проверка интерфейса, разбор документа и подготовка отчёта на его основе.
В текущей записи OpenRouter для z-ai/glm-5v-turbo указаны контекст 202 752 токена и максимум 131 072 токена завершения; документация Z.AI округляет контекст до 200K и максимум вывода до 128K. OpenRouter показывает входные модальности image, text и video, текстовый вывод, а также параметры reasoning, tools, tool_choice, response_format, temperature, top_p и top_k. Текущая цена в каталоге OpenRouter составляет $1,20 за миллион входных токенов, $4,00 за миллион выходных и $0,24 за миллион токенов чтения кэша. Это условия конкретного маршрута на момент проверки, а не универсальная цена любого провайдера.
Практический выбор модели оправдан для визуального программирования, анализа скриншотов и видеокадров, визуального grounding, работы с документами и многошаговых агентских задач. Перед внедрением нужно отдельно проверить лимиты, формат мультимодальных сообщений, качество на вашем языке и безопасность передачи изображений, видео и файлов. Источники не дают оснований обещать определённую точность, поддержку конкретного SDK, открытую лицензию или автономное выполнение действий без настроенных инструментов, поэтому эти свойства не считаются характеристиками модели.
Официальные страницы, публикации СМИ и обсуждения сообщества