OpenAI выпустила голосовую модель GPT-Live-1 в API

Собеседник перебивает голосового агента на полуслове, а затем проверяет, слышит ли тот голос на фоне постороннего шума. Агент не теряет нить беседы и…

Aravana··1 мин

Собеседник перебивает голосового агента на полуслове, а затем проверяет, слышит ли тот голос на фоне постороннего шума. Агент не теряет нить беседы и отвечает без паузы: GPT-Live-1 умеет слушать и говорить одновременно.

OpenAI сделала новую голосовую модель доступной через API. Она предназначена для естественных и выразительных диалогов, в которых пользователь может вступить в разговор, не дожидаясь конца реплики. Такой полнодуплексный режим приближает общение с приложением к обычной беседе: системе не требуется строго чередовать прослушивание и воспроизведение речи.

В опубликованной демонстрации разработчик несколько раз перебивает GPT-Live-1. Модель сразу реагирует на вмешательство и поясняет, что продолжает различать голос пользователя даже при окружающем шуме. OpenAI сравнивает этот формат взаимодействия с голосовым режимом ChatGPT, но теперь его можно встроить в сторонние продукты через API.

GPT-Live-1 отвечает за голосовую часть приложения, тогда как рассуждения и работу с инструментами можно передать отдельной серверной модели. В ролике агент объясняет, что такая связка позволяет ему поручать действия роботу и управлять информацией на дисплее, одновременно поддерживая разговор. Разработчик может выбирать модели и набор подключённых инструментов под свою задачу.

Такое разделение ролей позволяет не прерывать диалог, пока другая часть системы выполняет действие. Голосовой агент остаётся собеседником для пользователя, а серверная модель занимается рассуждением и обращением к инструментам. В демонстрации эта архитектура показана как единый интерфейс: человек говорит обычным образом, а система распределяет запросы между голосовым компонентом и подключёнными средствами.

Стоимость GPT-Live-1 составляет 5 центов за минуту работы голосовой части. OpenAI отдельно уточняет, что вычисления серверной модели и сервисы инструментов оплачиваются дополнительно. Поэтому итоговая стоимость приложения будет зависеть не только от продолжительности голосового общения, но и от выбранной разработчиком конфигурации.

Ролик длится 77 секунд. По состоянию на момент подготовки материала он набрал 373 821 просмотр, 6 055 лайков и 465 комментариев. Главная идея демонстрации укладывается в одну сцену: голосовой агент можно перебить, он продолжает слышать пользователя во время собственной речи и при необходимости обращается к другим моделям и инструментам, не останавливая беседу.

Этот материал подготовлен командой AI-агентов AravanaAI и проверен главным редактором.

Тип материала: Пост из Telegram

Поделиться:TelegramXLinkedIn
Как вам материал?

Хотите получать подобные материалы раньше?

Aravana Intelligence — авторская аналитика и закрытый круг для тех, кто думает на шаг вперёд.

Узнать про Intelligence

Не пропускайте важное

Еженедельный дайджест Aravana — ключевые события в AI, робототехнике и longevity.

Похожие материалы

Как ChatGPT помогает обнаруживать природные пожары сразу после возгорания

Как ChatGPT помогает обнаруживать природные пожары сразу после возгорания

Свой первый тепловой датчик Райан Хонари собрал в пятом классе для школьного научного проекта и получил отличную оценку. Прототип он испытывал в гараже с…

·1 мин
Дилан Патель: 50 ГВт китайских мощностей могут быть эквивалентны 20 ГВт американских

Дилан Патель: 50 ГВт китайских мощностей могут быть эквивалентны 20 ГВт американских

Китай способен к 2029 году нарастить вычислительные мощности на 50 ГВт, считает Дилан Патель. Но прямое сравнение по гигаваттам может создать неверное…

·1 мин
ИИ-учёному недостаточно интеллекта: как Faraday учат воспроизводить исследования

ИИ-учёному недостаточно интеллекта: как Faraday учат воспроизводить исследования

Из научной статьи убирают график, а ИИ-агенту дают час и одну семнадцатую ресурсов GPU NVIDIA H200, чтобы заново провести описанный эксперимент и…

·2 мин