Google показала архитектуру голосового ИИ-агента на Gemini Live API, которого можно перебить на полуслове

Ведущая канала Google Cloud Tech Энни Ванг демонстрирует голосового ассистента по имени Мира: он включает музыку в жанре дрим-поп, пропускает трек по команде...

Aravana··2 мин

Ведущая канала Google Cloud Tech Энни Ванг демонстрирует голосового ассистента по имени Мира: он включает музыку в жанре дрим-поп, пропускает трек по команде и отвечает на вопрос о том, что думает о песне — «нежная». Главная деталь демо: ассистента можно перебить на полуслове, как во время обычного телефонного звонка, и он тут же замолкает.

В ролике Google Cloud Tech Ванг объясняет, почему такой агент устроен иначе, чем обычные голосовые системы. Классический text-to-speech работает в одну сторону: получает текст и озвучивает его, но не слышит собеседника. Gemini Live API, по её словам, работает по-другому — это модель audio-to-audio: она одновременно слышит голос пользователя и говорит в ответ, различает тон, паузы и энергию речи, а начинает отвечать ещё до того, как до конца сформулирует полный ответ.

Архитектура строится на трёх компонентах: браузер захватывает звук с микрофона и воспроизводит ответ, сама модель Gemini Live обрабатывает аудио, а небольшой бэкенд держит открытое соединение между ними. Вместо обычного запроса, который закрывается сразу после ответа, используется веб-сокет — постоянное соединение, позволяющее звуку течь в обе стороны непрерывно. Бэкенд при этом выполняет две независимые задачи одновременно: отправляет звук с микрофона наверх и принимает голос модели обратно. Базовый цикл работы описан всего четырьмя шагами: открыть сессию, отправить аудио с микрофона, получить аудио от модели, воспроизвести его.

Чтобы простой рабочий цикл превратился в живой диалог, авторы добавили три механизма. Detection голосовой активности (VAD) уже встроен в Gemini Live и определяет, говорит ли пользователь прямо сейчас, находя границы реплики — когда человек начал и закончил говорить. Barge-in позволяет перебивать агента: та же система VAD замечает, что пользователь заговорил поверх модели, и она останавливается, отправляя сигнал о прерывании — при этом, по словам Ванг, приложение должно останавливать локальное воспроизведение звука мгновенно, не дожидаясь, пока сигнал дойдёт по сети, иначе перебивание не будет ощущаться естественным. Наконец, агенту дали инструменты — функции с именем и описанием, которые он может вызывать для конкретных действий: включить плейл-ist, пропустить трек, поставить на паузу. Модель решает, что нужно сделать, а код выполняет действие и возвращает результат; при этом, пока инструмент выполняется, модель ждёт, поэтому такие функции должны отвечать быстро — иначе разговор «замолкает».

Видео собрано на «сыром» GenAI SDK специально для того, чтобы показать каждую движущуюся часть системы; в следующем эпизоде авторы обещают пересобрать то же приложение на Google Agent Development Kit (ADK), который берёт управление сессией, потоковой передачей и очередью на себя. На момент подготовки материала ролик набрал 28 504 просмотра, 533 лайка и 24 комментария.

Этот материал подготовлен командой AI-агентов AravanaAI и проверен главным редактором.

Тип материала: Пост из Telegram

Поделиться:TelegramXLinkedIn
Как вам материал?

Хотите получать подобные материалы раньше?

Aravana Intelligence — авторская аналитика и закрытый круг для тех, кто думает на шаг вперёд.

Узнать про Intelligence

Не пропускайте важное

Еженедельный дайджест Aravana — ключевые события в AI, робототехнике и longevity.

Похожие материалы

🔴 Уланчаб меняет географию китайского ИИ — и упирается в воду

Дешёвая энергия и быстрые линии связи сделали степной город крупным вычислительным узлом, но заявленные проекты сталкиваются с дефицитом воды и зависимостью от угля.

·1 мин