AI-модельLLM128,000 токенов
Разработчик: OpenAI
Технические параметры и возможности
GPT Audio — аудиомодель OpenAI для приложений, которым нужно принимать и возвращать звук через API. На официальной странице OpenAI она описана как первая общедоступная аудиомодель компании: модель принимает аудиовход и выдаёт аудиовыход, а также доступна через Chat Completions REST API. Это делает её подходящей для голосовых интерфейсов, разговорных помощников и сценариев, где пользователь говорит, а приложение формирует текстовый или голосовой ответ в одном модельном контуре. У модели контекстное окно 128 000 токенов и максимальный объём вывода 16 384 токена, поэтому длинный диалог или связанный с аудио текстовый контекст можно обрабатывать без искусственного дробления на очень маленькие сообщения.
Модель работает с текстом и аудио на входе и выходе. На странице OpenAI отдельно указано, что изображения и видео не поддерживаются, поэтому GPT Audio не следует описывать как универсальную vision-модель или инструмент генерации видео. В поддерживаемых возможностях отмечены потоковая выдача и function calling. Это позволяет строить голосовой интерфейс, который не только отвечает пользователю, но и передаёт подтверждённые команды прикладному сервису: например, получает аудиозапрос, вызывает функцию приложения и возвращает результат в разговоре. Возможности structured outputs, fine-tuning и predicted outputs на странице модели отмечены как неподдерживаемые, поэтому строгий JSON-контракт, обучение на собственном датасете и сценарии с предсказанным продолжением нужно закрывать другой моделью или отдельным прикладным слоем.
GPT Audio полезна в прототипах и production-сервисах с голосовым вводом и выводом: в голосовом помощнике, в интерфейсе поддержки, в диктовке с озвученным ответом, в разборе аудиосообщений и в диалоговых приложениях, где важна естественная последовательность «аудио → понимание → действие → аудио». Вызов следует проектировать вокруг аудио- и текстовых сообщений, а не вокруг обработки изображений. Официальная карточка показывает отдельные цены для текстовых и аудиотокенов: текстовый ввод стоит 2,50 доллара за миллион токенов, текстовый вывод — 10 долларов, аудиоввод — 32 доллара, аудиовывод — 64 доллара. Поэтому расчёт бюджета должен учитывать модальность каждого запроса; стоимость нельзя оценивать только по числу текстовых токенов. OpenRouter также показывает модель как openai/gpt-audio и подтверждает её доступность через провайдера, контекст 128K и аудио-ориентированный режим.
У GPT Audio есть важное ограничение по актуальности знаний: на карточке OpenAI указана дата отсечения 1 октября 2023 года. Для текущих сведений приложение должно добавлять собственный поиск, базу знаний или другой проверяемый источник, а не полагаться на память модели. Встроенный потоковый режим и function calling полезны для низколатентных голосовых сценариев, но они не заменяют валидацию команд, контроль прав доступа и обработку ошибок на стороне приложения. Перед запуском следует отдельно проверить задержку, качество распознавания конкретных микрофонов и языков, стоимость аудиотокенов, поведение при шуме и fallback при недоступности провайдера. GPT Audio подходит для аудио-диалогов и связанных с ними действий; для изображений, видео, fine-tuning или гарантированно структурированных ответов нужны другие инструменты и ограничения интеграции.
Официальные страницы, публикации СМИ и обсуждения сообщества