Google объяснила, чем настоящий голосовой ИИ отличается от иллюзии диалога
Большинство голосовых ИИ-ассистентов, которые выглядят как «живой» диалог, на самом деле работают по устаревшей схеме: три отдельные системы, склеенные одна ...
Большинство голосовых ИИ-ассистентов, которые выглядят как «живой» диалог, на самом деле работают по устаревшей схеме: три отдельные системы, склеенные одна за другой. Сначала распознавание речи переводит голос в текст, затем языковая модель формирует ответ, и в конце система синтеза речи зачитывает его вслух. Формально это работает, но ощущается как обмен репликами по очереди — сказал, подождал, пока модель «думает», услышал ответ. Пока система говорит, она, как правило, не слышит собеседника.
В новом ролике Google Cloud Tech инженер компании Энни Ванг объясняет, чем принципиально отличается настоящий real-time голосовой агент. Вместо последовательной цепочки из трёх систем такой агент принимает и отправляет аудио в рамках одной непрерывной живой сессии. Именно поэтому пользователь может перебить его на середине фразы — и система действительно замолчит. Этот момент в индустрии называют barge-in (дословно «врезание» в разговор), и именно он отличает голосового бота от собеседника, с которым можно говорить как с живым человеком.
В качестве примера такой архитектуры в ролике упоминаются Gemini Live API и Agent Development Kit — инструменты Google для построения голосовых агентов с двусторонним аудиопотоком в реальном времени, без разбивки диалога на отдельные шаги «услышал — подумал — ответил».
На момент подготовки материала ролик Google Cloud Tech собрал 5778 просмотров, 151 лайк и 7 комментариев при длительности всего 52 секунды — короткая форма, которую канал использует, чтобы за минуту объяснить техническую разницу между ботом, который делает вид, что слушает, и системой, которая действительно слышит собеседника в любой момент разговора, а не только тогда, когда закончила говорить сама.
Этот материал подготовлен командой AI-агентов AravanaAI и проверен главным редактором.
Хотите получать подобные материалы раньше?
Aravana Intelligence — авторская аналитика и закрытый круг для тех, кто думает на шаг вперёд.
Узнать про IntelligenceНе пропускайте важное
Еженедельный дайджест Aravana — ключевые события в AI, робототехнике и longevity.

Google показала, как строить и защищать мультиагентные ИИ-системы на Kubernetes
Команда Google Cloud Tech провела почти двухчасовой прямой эфир о том, как строить и масштабировать мультиагентные ИИ-системы на Google Kubernetes Engine (GK...

Google Cloud: как научить AI-агента разработке с помощью «навыков» вместо длинных промптов
Дебашу Дас, работающий над generative AI для рекомендательных систем в рекламе YouTube, предложил простой рецепт: хватит писать длинные промпты для агентов, ...

Google представила remote MCP-сервер для управления облаком через ИИ-агента на естественном языке
Google Cloud Tech показала, как ИИ-агент может самостоятельно расследовать и чинить ночной сбой в конвейере данных — без единой строчки консольных команд, на...