Мы запускаем GPT‑Live‑1 в API, предоставляя разработчикам мощную модель для создания естественного голосового взаимодействия в приложениях и бизнес-процессах. Впервые представленный в ChatGPT, GPT‑Live‑1 умеет одновременно слушать и говорить, а также, как показано на примере Codex и ChatGPT Работа(открывается в новом окне), может делегировать более глубокие рассуждения и действия подключённым моделям и инструментам.
При выпуске GPT‑Live‑1 в API мы сосредоточились на новых возможностях, позволяющих разработчикам направлять и адаптировать голосовое взаимодействие с учетом пользователей, рабочих процессов и целей. Одно из ключевых преимуществ GPT‑Live‑1 — плавная обработка перебиваний — уже приносит пользу бизнесу: в первых тестах Speak выяснилось, что GPT‑Live‑1 давал учащимся больше времени подумать до ответа преподавателя языка, почти на 80% сократив число перебиваний по сравнению с прежними системами с поочерёдными репликами.
Ключевые преимущества GPT‑Live‑1 в API:
Обработка перебиваний: улучшает обработку перебиваний с помощью единой модели, одновременно анализирующей входящий и исходящий звук, что позволяет избежать задержек и ненадёжных переключений между компонентами цепочек STT–LLM–TTS.
Делегирование рассуждений и вызовов инструментов: GPT‑Live‑1 может делегировать рассуждения и вызовы инструментов серверной текстовой модели, такой как GPT‑6 Astra или сторонняя модель.
Тон, темп и стиль: разработчики могут задавать тон, темп и стиль общения агента с помощью системного промпта.
Незаметное управление контекстом и фоновый шум: модель лучше справляется с фоновым шумом и тишиной, не прерывая разговор и не проговаривая вслух каждый шаг.
Надёжность длительных сеансов: модель лучше сохраняет контекст и качество общения при продолжительном взаимодействии.
Поддержка телефонии: позволяет развёртывать полнодуплексных голосовых агентов для телефонных звонков — от бронирования столиков до поддержки клиентов.
Try GPT-Live-1
See what it can do
- Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
- Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
- Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.
Время этой демонстрации ограничено. При использовании вы соглашаетесь с Условиями использования OpenAI и подтверждаете ознакомление с нашей Политикой конфиденциальности.
Традиционные голосовые агенты объединяют распознавание речи, модель рассуждений и синтез речи в цепочку. Каждая передача данных между компонентами увеличивает задержку и риск потерять правильный момент, контекст или естественный ритм разговора. Координировать эти этапы, в том числе при перебивании, паузе или смене темы, зачастую приходится разработчикам.
GPT‑Live‑1 обрабатывает восприятие и воспроизведение речи в рамках единой модели, упрощая архитектуру голосового интерфейса. Он мгновенно реагирует на перебивания и подтверждающие реплики, делегируя более глубокие рассуждения серверной части. Благодаря этому разговор продолжается, пока работа выполняется в фоновом режиме.
Разработчики сами выбирают модели, инструменты и обвязку агента, обеспечивающие разговор. Например, для массовых задач — планирования или обновления данных о заказах — GPT‑Live‑1 можно сочетать с моделью Luna, а для сложных обращений клиентов, требующих рассуждений, использовать модель Astra. Такая гибкость позволяет подобрать для каждой задачи нужную глубину рассуждений, скорость и стоимость.
GPT‑Live‑1 изначально предоставляет расшифровки ASR и текст ответов. Кроме того, он хорошо распознаёт буквенно-цифровые последовательности и поддерживает приоритизацию ключевых слов. Хотя GPT‑Live‑1 не относится к моделям с поочерёдными репликами, она изначально поддерживает определение их границ, поэтому разработчики могут и дальше строить системы вокруг явно заданных границ реплик.
По результатам наших тестов GPT‑Live‑1 превосходит GPT‑Realtime‑2.1 в Full Duplex Bench на 30 процентных пунктов, значительно сокращая задержку при смене реплик и улучшая интерактивное поведение. В сочетании с GPT‑6 Astra при среднем уровне рассуждений он также занимает первое место в Tau3, оценивающем интеллект передовых голосовых агентов на сквозных задачах.
Оценивает голосовые задачи клиентского сервиса в сферах авиаперевозок, розничной торговли и телекоммуникаций. Pass@1 измеряет успешность выполнения задач; в общем показателе каждому домену присваивается одинаковый вес.
* Бэкенд GPT Live: Astra (средний).
Оценивает поддержку банковских услуг в устной форме с извлечением знаний и инструментами для работы со счетами. Pass@1 — это доля из 97 задач banking_knowledge, выполненных успешно.
* Бэкенд GPT Live: Astra (средний).
Оценивает обработку пауз, смену реплик в разговоре, перебивания и сигналы обратной связи.
Тестирует реакции на фоновую речь, речь, обращённую к другому человеку, сигналы обратной связи от слушателя и перебивания.
Измеряет, как быстро агент начинает отвечать после того, как пользователь заканчивает свою реплику.
Проверяет использование инструментов в устных запросах с естественными паузами, колебаниями и самокоррекцией. Показатель Pass@1 оценивает последовательность вызовов инструментов.
* Бэкенд GPT Live: Terra (низкий).
Оценивает устный ответ на запросы с использованием инструментов, содержащие паузы, заминки и самокоррекции. Оценивает, насколько ответ соответствует эталонному намерению.
* Бэкенд GPT Live: Terra (низкий).
Разработчикам нужны голоса, которые подходят их продуктам и естественно звучат для пользователей. С GPT‑Live‑1 мы расширяем небольшой набор голосов для общения в реальном времени, добавляя больше акцентов, диалектов и языков, чтобы разработчики могли точнее выбирать звучание своих ассистентов.
В ближайшие месяцы мы продолжим расширять выбор голосов и языков.
GPT‑Live‑1 уже доступен в API(открывается в новом окне) по цене 0,05 доллара США за минуту использования голосового интерфейса. Объедините его с серверной моделью и обвязкой агента, подходящими вашему продукту, и создайте голосовой интерфейс, способный масштабироваться вместе с объёмом выполняемой работы.
Чтобы узнать о критериях получения доступа к настраиваемым голосам и порядке подачи запроса, свяжитесь с отделом продаж.
Еще один способ создавать голосовые процессы на базе GPT‑Live‑1 — использовать OpenAI Presence, который задействует модель для голосового взаимодействия в реальном времени. Presence помогает компаниям внедрять надежных ИИ-агентов: они отвечают на вопросы, решают проблемы, используют корпоративные системы, выполняют одобренные действия и при необходимости передают вопрос людям. За подробностями обратитесь к своему менеджеру в OpenAI.

