Как пользоваться голосовым режимом ChatGPT: разговор с AI в реальном времени
Advanced Voice Mode в ChatGPT — разговор с AI как по телефону. Естественный голос, эмоции, акценты. Показываем, как включить и использовать.
GPT-Live: голосовой режим ChatGPT нового поколения
Бесплатно или платно?
Обновление, 8 июля 2026: Advanced Voice Mode заменён на GPT-Live. OpenAI выпустила GPT-Live-1 для платных планов (Plus и Pro) и GPT-Live-1 mini для бесплатного тарифа. Режим работает в полном дуплексе: AI слышит и говорит одновременно, разговор можно прервать в любой момент. Добавлен поиск в интернете во время голосового разговора. Подробнее - в отдельном гайде по GPT-Live.
Доступ из России
Новое: ChatGPT в Apple CarPlay (апрель 2026)
Как включить
На iPhone / Android
На компьютере (Mac / Windows)
В автомобиле (CarPlay)
Что попробовать
5 советов
GPT-Live: голосовой режим ChatGPT нового поколения
GPT-Live -- новое поколение голосового режима ChatGPT, выпущенное 8 июля 2026 года. Это полнодуплексный (full-duplex) разговор с AI: модель слышит и говорит одновременно, без ожидания паузы в речи собеседника. Перебивать AI можно в любой момент -- он мгновенно остановится и выслушает. Для бесплатных пользователей доступен GPT-Live-1 mini, для подписчиков Plus и Pro -- GPT-Live-1. Advanced Voice Mode, который использовался ранее, заменён GPT-Live окончательно.
Бесплатно или платно?
Advanced Voice Mode был основным режимом голосового общения в ChatGPT в 2026 году. 8 июля 2026 года он заменён на GPT-Live: GPT-Live-1 доступен для подписчиков Plus и Pro, GPT-Live-1 mini - для бесплатного тарифа. Актуальные тарифы на openai.com/pricing.
Доступ из России
Голосовой режим -- часть ChatGPT. Для доступа из России понадобится VPN. Приложение скачайте с сайта OpenAI.
Новое: ChatGPT в Apple CarPlay (апрель 2026)
С марта 2026 года ChatGPT доступен как приложение в Apple CarPlay -- первым среди AI-ассистентов. Требования: iPhone с iOS 27 и выше, поддержка CarPlay. В мае 2026 функция доступна пользователям iOS 27+, полный запуск продолжается.
Как работает в CarPlay: нажмите иконку ChatGPT на экране автомобиля, задайте вопрос голосом. Приложение работает полностью через голос -- текст и история не отображаются на экране. Wake-word (как у Siri) пока не поддерживается, нужно нажать вручную.
К ChatGPT в CarPlay вскоре присоединятся Grok (от xAI) и Perplexity.
Как включить
На iPhone / Android
Шаг 1. Откройте приложение ChatGPT.
Шаг 2. Нажмите на иконку наушников/микрофона в правом нижнем углу поля ввода.
Шаг 3. Разрешите доступ к микрофону.
Шаг 4. Начните говорить -- ChatGPT ответит голосом.
Шаг 5. Для выбора голоса: нажмите на имя голоса вверху -- выберите из 9 голосов: 6 классических голосов и 3 новых (Cedar, Marin и Juniper).
На компьютере (Mac / Windows)
В десктопном приложении ChatGPT нажмите иконку микрофона -- голосовой режим работает аналогично мобильному.
В автомобиле (CarPlay)
Обновите iPhone до iOS 27+, подключите к CarPlay, найдите ChatGPT в меню приложений и нажмите для разговора.
Что попробовать
- Практикуйте английский. «Let's practice English conversation. You're a barista, I'm ordering coffee.» -- живой диалог с носителем языка.
- Слушайте объяснения. «Объясни квантовую физику как для 5-летнего» -- на ходу, без чтения.
- Мозговой штурм. Обсуждайте идеи голосом -- часто удобнее, чем печатать.
- Подготовка к встречам. «Разыграй собеседование на позицию PM в tech-компании» -- ролевые игры.
- За рулём через CarPlay. «Кратко расскажи новости за сегодня» -- без отвлечения от дороги.
5 советов
1. Используйте на ходу. Голосовой режим идеален для прогулок, вождения и домашних дел.
2. Можно перебивать. В отличие от Siri, ChatGPT можно перебить -- он остановится и послушает.
3. Выберите комфортный голос. 9 голосов с разными тембрами и характерами -- найдите свой. Рекомендуем попробовать новые Cedar, Marin и Juniper.
4. Переключайте язык на лету. Начните на русском, перейдите на английский -- ChatGPT подстроится.
5. В CarPlay -- нажимайте, не ждите. Wake-word пока не работает, поэтому перед вопросом нужно нажать на экран CarPlay.
История: Standard Voice Mode упразднён (2025), AVM заменён GPT-Live (2026)
В 2025 году OpenAI упразднил Standard Voice Mode -- упрощённый голосовой режим с меньшим качеством. Пользователи перешли на Advanced Voice Mode -- более мощную версию с реальным пониманием интонации, способностью перебивать и естественным диалогом. С 8 июля 2026 года Advanced Voice Mode в свою очередь заменён на GPT-Live.
Важное обновление: Advanced Voice Mode теперь работает на базе GPT-5, а не GPT-4o. Переход произошёл в апреле 2026 года и принёс заметные улучшения в понимании контекста и естественности речи. GPT-5 лучше справляется с длинными разговорами, не теряя нить беседы и точнее реагируя на эмоциональные нюансы.
Live Camera - новая функция Advanced Voice Mode, позволяющая ChatGPT видеть окружающий мир через камеру смартфона в реальном времени. Вы можете спросить у GPT-5, что находится перед вами, попросить объяснить текст на вывеске на иностранном языке или получить совет по сборке мебели, показав инструкцию. Функция доступна подписчикам Plus и выше.
Voice Mode на GPT-5.5 Instant
Текущая базовая модель ChatGPT Voice Mode обновлена до GPT-5.5 Instant (июнь 2026). Обновление принесло улучшенное понимание контекста в длинных разговорах, более естественные переходы между репликами и сниженную задержку отклика.
История версий голосовой модели. GPT-5.2, использовавшийся ранее в Voice Mode, выведен из эксплуатации 12 июня 2026 года. Текущая модель голосового режима -- GPT-5.5 (также в варианте GPT-5.5 Instant для сниженной задержки). GPT-5.6 находится в разработке и ожидается позднее в 2026 году. Если вы использовали старые API-интеграции с голосовым режимом на базе GPT-5.2, необходимо обновить их на актуальный endpoint.
Как использовать Voice Mode
Нажмите на кнопку наушников в нижней части ChatGPT. Первый запуск может занять несколько секунд для подключения. Прервать ответ можно нажатием или просто начав говорить -- AI остановится и будет слушать. Для смены голоса: Настройки -- Голос -- выберите из доступных вариантов. Advanced Voice Mode требует Plus или Pro подписки.
Практические сценарии
Voice Mode удобен для разговорной практики на иностранном языке -- попросите ChatGPT разговаривать только на целевом языке и исправлять ошибки. Для прослушивания длинных ответов во время поездки: задайте вопрос и слушайте ответ как подкаст. Для мозгового штурма: голосом идеи генерируются быстрее, чем при наборе текста.
Memory Sources (2026): в голосовом режиме ChatGPT теперь показывает, какие сохранённые воспоминания он использует при ответе. Иконка памяти появляется рядом с ответом -- нажмите, чтобы увидеть задействованные факты.
Обновление качества голоса (май 2026): Advanced Voice Mode получил улучшения -- более тонкая интонация, реалистичный ритм речи и богатый эмоциональный диапазон. Гибридный режим голос+текст: теперь можно переключиться в Voice Mode прямо посреди текстовой беседы и вернуться обратно без сброса контекста разговора -- вся история сохраняется. Живые виджеты в голосовом режиме: при вопросах о погоде и маршрутах ChatGPT отображает интерактивные виджеты с картами и прогнозом прямо в интерфейсе. Новый режим непрерывного перевода: ChatGPT переводит разговор в реальном времени между двумя собеседниками, говорящими на разных языках.
Детальная настройка голосового режима
Настройка на iOS
- Скачайте ChatGPT из App Store (или обновите до последней версии).
- Откройте приложение -- войдите в аккаунт.
- Нажмите иконку наушников в правом нижнем углу поля ввода.
- При первом запуске дайте разрешение на доступ к микрофону.
- Выбор голоса: нажмите на название голоса вверху экрана в режиме голосового общения -- откроется список из 6 вариантов (Alloy, Echo, Fable, Onyx, Nova, Shimmer). Каждый можно прослушать до выбора.
- Язык: голосовой режим автоматически определяет язык. Для переключения достаточно начать говорить на другом языке.
Настройка на Android
- Скачайте ChatGPT из Google Play или с сайта openai.com/chatgpt.
- Шаги 2-6 идентичны iOS. Единственное отличие: на некоторых Android-устройствах нужно дополнительно разрешить работу микрофона в фоне в настройках приложения.
Выбор голоса: 9 голосов
ChatGPT предлагает 9 голосов с разными характерами. Классические голоса: Alloy -- нейтральный, универсальный; Echo -- мягкий, задумчивый; Fable -- тёплый, повествовательный; Onyx -- глубокий, авторитетный; Nova -- энергичный, молодой; Shimmer -- спокойный, размеренный. Голоса GPT-Realtime-2 (новые): Cedar -- естественный, разговорный; Marin -- чёткий, профессиональный; Juniper -- живой, тёплый. Все голоса работают на любом языке -- переключайтесь в разговоре без ограничений.
Изучение языков голосом
Голосовой режим -- один из лучших инструментов для практики разговорного языка. Вот конкретный сценарий практики английского:
Начните сессию фразой: «Let's practice English conversation. I'm an intermediate learner. Please speak at a normal pace and correct my grammar mistakes gently after each of my responses.»
ChatGPT войдёт в роль разговорного партнёра. После каждой вашей реплики он продолжит разговор -- и мягко укажет на ошибки: «By the way, instead of 'I go yesterday', it's more natural to say 'I went yesterday' -- past tense. But great sentence structure!»
Можно сделать практику ещё интереснее:
- «You're a barista at a London coffee shop. I'm a customer. Let's roleplay.»
- «Give me 5 random topics, I'll speak about each for 1 minute, then you give feedback.»
- «Only respond in English, even if I accidentally switch to Russian.»
ChatGPT в CarPlay
С марта 2026 года ChatGPT стал первым AI-ассистентом в Apple CarPlay. Требования для использования:
- iPhone с iOS 27 или новее.
- Приложение ChatGPT обновлено до последней версии.
- Автомобиль с поддержкой CarPlay (проводной или беспроводной).
- Аккаунт ChatGPT (бесплатный или Plus).
Как настроить: подключите iPhone к CarPlay, найдите иконку ChatGPT в меню приложений CarPlay. Если иконки нет -- откройте Настройки iPhone -- Основные -- CarPlay -- выберите свой автомобиль -- добавьте ChatGPT в список приложений.
Команды за рулём: нажмите иконку ChatGPT на экране автомобиля (wake-word пока не поддерживается), затем говорите. Примеры: «Кратко расскажи о пробках на трассе М4»; «Что почитать по управлению командой -- кратко»; «Составь список дел на сегодня и напомни мне позже»; «Переведи эту фразу на английский для деловых переговоров».
Непрерывный перевод в реальном времени
Голосовой режим ChatGPT можно использовать как синхронный переводчик. Это один из самых неожиданных, но практичных сценариев.
Практический пример: вы на международной конференции, рядом иностранный коллега говорит по-немецки. Откройте ChatGPT Voice Mode, скажите: «Act as a simultaneous interpreter. I'll speak in Russian, translate to English. When someone speaks English near me, translate to Russian.»
Держите телефон между собой и собеседником. ChatGPT будет переводить реплики в обе стороны в режиме реального времени с задержкой 1-2 секунды. Для коротких деловых разговоров это работает очень хорошо.
Советы для лучшего качества звука
- Тихое место. Голосовой режим плохо справляется с сильным фоновым шумом. В кафе или на улице качество распознавания падает. Используйте наушники с микрофоном.
- Чёткое произношение. Говорите чуть медленнее, чем обычно -- это снижает количество ошибок распознавания, особенно для технических терминов.
- Скорость речи. Если ChatGPT говорит слишком быстро -- скажите ему: «Говори медленнее». Если слишком медленно -- «Говори в нормальном темпе». ChatGPT адаптируется сразу.
- Перебивайте смело. В отличие от Siri и Google Ассистента, ChatGPT можно перебить в любой момент. Он немедленно остановится и выслушает вас.
- Длинные паузы. Если вы думаете -- скажите «подожди секунду». Иначе ChatGPT может решить, что сессия завершена.
Улучшения голосового режима (июнь 2026): Голос стал естественнее: более тонкая интонация, реалистичные паузы и ритм речи, выразительная передача эмоций. Снижено количество случайных прерываний (false wake). Персонализация GPT-5.5 для тарифов Go и Free (доступна с 9 июня 2026): память ChatGPT теперь просматривает прошлые беседы, загруженные файлы и подключённый Gmail для формирования более точных и контекстных ответов. Пользователи Go и Free получают ту же персонализированную модель, что ранее была доступна только подписчикам Pro.
OpenAI разрабатывает GPT-Bidi-1 - новую голосовую модель с двунаправленным аудио (bidirectional audio). В отличие от текущего Realtime API, GPT-Bidi-1 будет работать с тремя уровнями качества: быстрый (похожий на текущий), стандартный и высококачественный. Точная дата выпуска не объявлена.
gpt-realtime API получил три новых возможности: поддержку MCP-серверов (интеграция с внешними инструментами через Model Context Protocol), ввод изображений во время голосового разговора (можно показать картинку и голосом спросить о ней), и SIP-телефония (подключение к обычным телефонным номерам через SIP-протокол).
Обновление июнь 2026: режим Advanced Voice работает на iOS 27 (ранее iOS 26.4). Доступны 9 голосов. Добавлен двунаправленный режим (bidirectional voice): голосовой ответ можно прервать в любой момент, AI мгновенно реагирует на паузу.
Новая модель speech-to-text для диктовки (июнь 2026). OpenAI выпустила обновлённую модель распознавания речи для функции диктовки в ChatGPT. Ключевые улучшения: значительно повышена точность транскрибации на всех тарифных планах (включая бесплатный). Улучшена поддержка многоязычного ввода: теперь можно переключаться между языками прямо в процессе диктовки без прерывания и перезапуска. Это отдельное улучшение от Advanced Voice Mode -- относится к текстовой диктовке (кнопка микрофона в поле ввода), а не к голосовому разговорному режиму. Особенно заметно улучшение для смешанного русско-английского ввода.
Обновление: новая модель Speech-to-Text (июль 2026)
OpenAI обновила модель преобразования речи в текст для всех тарифов. Показатель ошибок (WER) снижен на 10% и более для ведущих языков. Улучшена работа в шумной обстановке. Добавлена поддержка смешанных языков в одной фразе -- можно переключаться между языками внутри одного высказывания.
Record Mode и бесплатный доступ к Advanced Voice (2026)
В 2026 году ChatGPT получил два важных обновления, связанных с голосовыми функциями. Record Mode -- новый режим, который работает в фоновом режиме и пассивно записывает звук встречи или разговора. По завершении записи ChatGPT автоматически генерирует краткое изложение, список ключевых решений и задач. Это делает режим особенно полезным для рабочих совещаний, мозговых штурмов и лекций.
Record Mode на практике. Запись включается одним нажатием и не требует постоянного взаимодействия с телефоном. После остановки записи ChatGPT предлагает несколько форматов вывода: краткое резюме, подробные тезисы с таймкодами, список задач в формате to-do. Конспекты лекций и заметки по результатам совещаний сохраняются в истории чатов и доступны для дальнейшего редактирования.
Advanced Voice Mode стал доступен бесплатно. Если ранее Advanced Voice Mode был доступен только подписчикам ChatGPT Plus и выше, то в 2026 году OpenAI открыла базовый доступ к нему для бесплатных пользователей. Бесплатный уровень включает ограниченное количество минут разговора в месяц; полный доступ без ограничений остаётся частью платных тарифов.
Улучшенная диктовка: распознавание языков и доступ на всех планах (июль 2026)
OpenAI обновила модель speech-to-text для функции диктовки в ChatGPT - доступна на всех тарифах, включая бесплатный. Улучшения направлены прежде всего на языки с нелатинским письмом и акцентированную речь. Значительный прогресс в распознавании: японский и корейский (включая смешанный ввод хирагана/катакана/кандзи), китайский (мандаринский и кантонский), акцентированный английский (индийский, австралийский, южноафриканский акценты). Модель также лучше справляется с фоновым шумом - точность не падает при шуме в кафе или транспорте.
Обновление speech-to-text не касается Advanced Voice Mode (разговорный голосовой режим) - это отдельная система. Речь идёт о кнопке микрофона в поле текстового ввода: нажмите её, продиктуйте текст - ChatGPT распознаёт речь и вставляет в поле ввода. Теперь это работает для всех пользователей без ограничений по плану. Показатель ошибок распознавания (Word Error Rate) снижен на 10% и более по сравнению с предыдущей версией для большинства поддерживаемых языков.
GPT-Live-1 и GPT-Live-1 mini: полный дуплекс (июль 2026)
8 июля 2026 года OpenAI выпустила две новые голосовые модели. GPT-Live-1 mini стал новым режимом по умолчанию для всех пользователей ChatGPT, заменив Advanced Voice Mode. GPT-Live-1 -- старший вариант, доступный на платных тарифах. Ключевое отличие от предыдущих моделей: полный дуплекс (full-duplex audio) -- AI слушает и говорит одновременно, без ожидания паузы в речи пользователя. Это делает прерывания и живые реакции естественными. Обе модели работают на базе GPT-5.5, поддерживают поиск, рассуждения и агентские возможности. Доступны на iOS, Android и в веб-версии ChatGPT. OpenAI проектировала модели для длинных разговоров -- в тестах внутри компании фиксировались сессии продолжительностью 30-40 минут.
GPT-Live-1 поддерживает синхронный перевод в реальном времени: можно говорить на одном языке, а модель отвечает на другом без паузы для перевода. Это делает GPT-Live-1 полезным инструментом для переговоров и языкового обучения в формате живого разговора.
Новая функция визуальных карточек: при запросе прогноза погоды, котировок акций или результатов спортивных матчей GPT-Live-1 выводит структурированные карточки с данными прямо в интерфейсе, не прерывая голосовой разговор.
GPT-Live-1 поддерживает три режима рассуждения: Instant (мгновенный ответ без дополнительного обдумывания), Medium (сбалансированный режим с кратким внутренним анализом) и High (углублённый анализ перед ответом, аналог reasoning-режимов в текстовых моделях). Режим выбирается автоматически или вручную в настройках сессии. GPT-Live-1 доступен подписчикам Plus, Pro и Go; GPT-Live-1 mini доступен всем пользователям бесплатно.
Этот материал подготовлен командой AI-агентов AravanaAI и проверен главным редактором.
- Как начать пользоваться ElevenLabs: AI-озвучка, клонирование голоса и дубляж
ElevenLabs предлагает более продвинутые голосовые возможности: клонирование голоса и профессиональная озвучка
Хотите получать подобные материалы раньше?
Aravana Intelligence — авторская аналитика и закрытый круг для тех, кто думает на шаг вперёд.
Узнать про IntelligenceНе пропускайте важное
Еженедельный дайджест Aravana — ключевые события в AI, робототехнике и longevity.
Как начать пользоваться Agno: Python-фреймворк для создания AI-агентов
Agno (бывший phidata) - один из самых популярных Python-фреймворков для построения AI-агентов с 39k+ звезд на GitHub. Пошаговый гайд: установка, первый агент за 5 минут, мультиагентные команды и деплой в продакшн.
Seedance 2.5: как начать пользоваться генератором видео от ByteDance
Seedance 2.5 от ByteDance генерирует нативное 30-секундное видео в один проход, принимает до 50 мультимодальных референсов и позволяет редактировать отдельные фрагменты без перегенерации всего клипа.
ChatGPT Work: как начать пользоваться агентным рабочим столом OpenAI
9 июля 2026 OpenAI запустила ChatGPT Work -- агента, который берёт у вас целый проект, сам планирует шаги, работает часами в фоне и возвращает готовый документ, таблицу или презентацию.