Google показала архитектуру голосового ИИ-агента на Gemini Live API, которого можно перебить на полуслове
Ведущая канала Google Cloud Tech Энни Ванг демонстрирует голосового ассистента по имени Мира: он включает музыку в жанре дрим-поп, пропускает трек по команде...
Ведущая канала Google Cloud Tech Энни Ванг демонстрирует голосового ассистента по имени Мира: он включает музыку в жанре дрим-поп, пропускает трек по команде и отвечает на вопрос о том, что думает о песне — «нежная». Главная деталь демо: ассистента можно перебить на полуслове, как во время обычного телефонного звонка, и он тут же замолкает.
В ролике Google Cloud Tech Ванг объясняет, почему такой агент устроен иначе, чем обычные голосовые системы. Классический text-to-speech работает в одну сторону: получает текст и озвучивает его, но не слышит собеседника. Gemini Live API, по её словам, работает по-другому — это модель audio-to-audio: она одновременно слышит голос пользователя и говорит в ответ, различает тон, паузы и энергию речи, а начинает отвечать ещё до того, как до конца сформулирует полный ответ.
Архитектура строится на трёх компонентах: браузер захватывает звук с микрофона и воспроизводит ответ, сама модель Gemini Live обрабатывает аудио, а небольшой бэкенд держит открытое соединение между ними. Вместо обычного запроса, который закрывается сразу после ответа, используется веб-сокет — постоянное соединение, позволяющее звуку течь в обе стороны непрерывно. Бэкенд при этом выполняет две независимые задачи одновременно: отправляет звук с микрофона наверх и принимает голос модели обратно. Базовый цикл работы описан всего четырьмя шагами: открыть сессию, отправить аудио с микрофона, получить аудио от модели, воспроизвести его.
Чтобы простой рабочий цикл превратился в живой диалог, авторы добавили три механизма. Detection голосовой активности (VAD) уже встроен в Gemini Live и определяет, говорит ли пользователь прямо сейчас, находя границы реплики — когда человек начал и закончил говорить. Barge-in позволяет перебивать агента: та же система VAD замечает, что пользователь заговорил поверх модели, и она останавливается, отправляя сигнал о прерывании — при этом, по словам Ванг, приложение должно останавливать локальное воспроизведение звука мгновенно, не дожидаясь, пока сигнал дойдёт по сети, иначе перебивание не будет ощущаться естественным. Наконец, агенту дали инструменты — функции с именем и описанием, которые он может вызывать для конкретных действий: включить плейл-ist, пропустить трек, поставить на паузу. Модель решает, что нужно сделать, а код выполняет действие и возвращает результат; при этом, пока инструмент выполняется, модель ждёт, поэтому такие функции должны отвечать быстро — иначе разговор «замолкает».
Видео собрано на «сыром» GenAI SDK специально для того, чтобы показать каждую движущуюся часть системы; в следующем эпизоде авторы обещают пересобрать то же приложение на Google Agent Development Kit (ADK), который берёт управление сессией, потоковой передачей и очередью на себя. На момент подготовки материала ролик набрал 28 504 просмотра, 533 лайка и 24 комментария.
Этот материал подготовлен командой AI-агентов AravanaAI и проверен главным редактором.
Хотите получать подобные материалы раньше?
Aravana Intelligence — авторская аналитика и закрытый круг для тех, кто думает на шаг вперёд.
Узнать про IntelligenceНе пропускайте важное
Еженедельный дайджест Aravana — ключевые события в AI, робототехнике и longevity.