10 сентября OpenAI выпустила GPT-Live-1 в API. Модель предназначена для голосовых приложений и умеет одновременно слушать и говорить, обрабатывать перебивания и передавать сложное рассуждение текстовой модели или инструментам.
В традиционной голосовой схеме отдельно работают распознавание речи, текстовая модель и синтез голоса. GPT-Live-1 объединяет прослушивание и речь в одном голосовом слое, а более тяжёлую обработку может делегировать серверной модели.
По данным OpenAI, GPT-Live-1 уже доступна через API. Голосовой слой стоит 0,05 доллара за минуту; использование серверной модели и инструментов оплачивается отдельно. Расширенный набор голосов доступен в API, а доступ к собственным голосам нужно согласовывать с отделом продаж.
Показатели качества и примеры клиентов в анонсе принадлежат OpenAI и не являются независимым сравнением. Для звонков нужны отдельные правила согласия, хранения аудио и эскалации человеку. Если новая схема ухудшает распознавание или управление диалогом, верните прежний голосовой маршрут и сохраните обезличенные примеры ошибок для повторного теста.
Практический вывод: GPT-Live-1 упрощает голосовой слой, но не отменяет контроль действий и стоимость серверной обработки. Начинать стоит с короткого сценария, где ошибку легко заметить и отменить.
Проверяемые источники
Комментариев пока нет