Как пользоваться голосовым режимом ChatGPT: разговор с AI в реальном времени

Advanced Voice Mode в ChatGPT — разговор с AI как по телефону. Естественный голос, эмоции, акценты. Показываем, как включить и использовать.

Aravana··2 мин

GPT-Live: голосовой режим ChatGPT нового поколения

Бесплатно или платно?

Обновление, 8 июля 2026: Advanced Voice Mode заменён на GPT-Live. OpenAI выпустила GPT-Live-1 для платных планов (Plus и Pro) и GPT-Live-1 mini для бесплатного тарифа. Режим работает в полном дуплексе: AI слышит и говорит одновременно, разговор можно прервать в любой момент. Добавлен поиск в интернете во время голосового разговора. Подробнее - в отдельном гайде по GPT-Live.

Доступ из России

Новое: ChatGPT в Apple CarPlay (апрель 2026)

Как включить

На iPhone / Android

На компьютере (Mac / Windows)

В автомобиле (CarPlay)

Что попробовать

5 советов

GPT-Live: голосовой режим ChatGPT нового поколения

GPT-Live -- новое поколение голосового режима ChatGPT, выпущенное 8 июля 2026 года. Это полнодуплексный (full-duplex) разговор с AI: модель слышит и говорит одновременно, без ожидания паузы в речи собеседника. Перебивать AI можно в любой момент -- он мгновенно остановится и выслушает. Для бесплатных пользователей доступен GPT-Live-1 mini, для подписчиков Plus и Pro -- GPT-Live-1. Advanced Voice Mode, который использовался ранее, заменён GPT-Live окончательно.

Бесплатно или платно?

Advanced Voice Mode был основным режимом голосового общения в ChatGPT в 2026 году. 8 июля 2026 года он заменён на GPT-Live: GPT-Live-1 доступен для подписчиков Plus и Pro, GPT-Live-1 mini - для бесплатного тарифа. Актуальные тарифы на openai.com/pricing.

Доступ из России

Голосовой режим -- часть ChatGPT. Для доступа из России понадобится VPN. Приложение скачайте с сайта OpenAI.

Новое: ChatGPT в Apple CarPlay (апрель 2026)

С марта 2026 года ChatGPT доступен как приложение в Apple CarPlay -- первым среди AI-ассистентов. Требования: iPhone с iOS 27 и выше, поддержка CarPlay. В мае 2026 функция доступна пользователям iOS 27+, полный запуск продолжается.

Как работает в CarPlay: нажмите иконку ChatGPT на экране автомобиля, задайте вопрос голосом. Приложение работает полностью через голос -- текст и история не отображаются на экране. Wake-word (как у Siri) пока не поддерживается, нужно нажать вручную.

К ChatGPT в CarPlay вскоре присоединятся Grok (от xAI) и Perplexity.

Как включить

На iPhone / Android

Шаг 1. Откройте приложение ChatGPT.

Шаг 2. Нажмите на иконку наушников/микрофона в правом нижнем углу поля ввода.

Шаг 3. Разрешите доступ к микрофону.

Шаг 4. Начните говорить -- ChatGPT ответит голосом.

Шаг 5. Для выбора голоса: нажмите на имя голоса вверху -- выберите из 9 голосов: 6 классических голосов и 3 новых (Cedar, Marin и Juniper).

На компьютере (Mac / Windows)

В десктопном приложении ChatGPT нажмите иконку микрофона -- голосовой режим работает аналогично мобильному.

В автомобиле (CarPlay)

Обновите iPhone до iOS 27+, подключите к CarPlay, найдите ChatGPT в меню приложений и нажмите для разговора.

Что попробовать

- Практикуйте английский. «Let's practice English conversation. You're a barista, I'm ordering coffee.» -- живой диалог с носителем языка.

- Слушайте объяснения. «Объясни квантовую физику как для 5-летнего» -- на ходу, без чтения.

- Мозговой штурм. Обсуждайте идеи голосом -- часто удобнее, чем печатать.

- Подготовка к встречам. «Разыграй собеседование на позицию PM в tech-компании» -- ролевые игры.

- За рулём через CarPlay. «Кратко расскажи новости за сегодня» -- без отвлечения от дороги.

5 советов

1. Используйте на ходу. Голосовой режим идеален для прогулок, вождения и домашних дел.

2. Можно перебивать. В отличие от Siri, ChatGPT можно перебить -- он остановится и послушает.

3. Выберите комфортный голос. 9 голосов с разными тембрами и характерами -- найдите свой. Рекомендуем попробовать новые Cedar, Marin и Juniper.

4. Переключайте язык на лету. Начните на русском, перейдите на английский -- ChatGPT подстроится.

5. В CarPlay -- нажимайте, не ждите. Wake-word пока не работает, поэтому перед вопросом нужно нажать на экран CarPlay.

История: Standard Voice Mode упразднён (2025), AVM заменён GPT-Live (2026)

В 2025 году OpenAI упразднил Standard Voice Mode -- упрощённый голосовой режим с меньшим качеством. Пользователи перешли на Advanced Voice Mode -- более мощную версию с реальным пониманием интонации, способностью перебивать и естественным диалогом. С 8 июля 2026 года Advanced Voice Mode в свою очередь заменён на GPT-Live.

Важное обновление: Advanced Voice Mode теперь работает на базе GPT-5, а не GPT-4o. Переход произошёл в апреле 2026 года и принёс заметные улучшения в понимании контекста и естественности речи. GPT-5 лучше справляется с длинными разговорами, не теряя нить беседы и точнее реагируя на эмоциональные нюансы.

Live Camera - новая функция Advanced Voice Mode, позволяющая ChatGPT видеть окружающий мир через камеру смартфона в реальном времени. Вы можете спросить у GPT-5, что находится перед вами, попросить объяснить текст на вывеске на иностранном языке или получить совет по сборке мебели, показав инструкцию. Функция доступна подписчикам Plus и выше.

Voice Mode на GPT-5.5 Instant

Текущая базовая модель ChatGPT Voice Mode обновлена до GPT-5.5 Instant (июнь 2026). Обновление принесло улучшенное понимание контекста в длинных разговорах, более естественные переходы между репликами и сниженную задержку отклика.

История версий голосовой модели. GPT-5.2, использовавшийся ранее в Voice Mode, выведен из эксплуатации 12 июня 2026 года. Текущая модель голосового режима -- GPT-5.5 (также в варианте GPT-5.5 Instant для сниженной задержки). GPT-5.6 находится в разработке и ожидается позднее в 2026 году. Если вы использовали старые API-интеграции с голосовым режимом на базе GPT-5.2, необходимо обновить их на актуальный endpoint.

Как использовать Voice Mode

Нажмите на кнопку наушников в нижней части ChatGPT. Первый запуск может занять несколько секунд для подключения. Прервать ответ можно нажатием или просто начав говорить -- AI остановится и будет слушать. Для смены голоса: Настройки -- Голос -- выберите из доступных вариантов. Advanced Voice Mode требует Plus или Pro подписки.

Практические сценарии

Voice Mode удобен для разговорной практики на иностранном языке -- попросите ChatGPT разговаривать только на целевом языке и исправлять ошибки. Для прослушивания длинных ответов во время поездки: задайте вопрос и слушайте ответ как подкаст. Для мозгового штурма: голосом идеи генерируются быстрее, чем при наборе текста.

Memory Sources (2026): в голосовом режиме ChatGPT теперь показывает, какие сохранённые воспоминания он использует при ответе. Иконка памяти появляется рядом с ответом -- нажмите, чтобы увидеть задействованные факты.

Обновление качества голоса (май 2026): Advanced Voice Mode получил улучшения -- более тонкая интонация, реалистичный ритм речи и богатый эмоциональный диапазон. Гибридный режим голос+текст: теперь можно переключиться в Voice Mode прямо посреди текстовой беседы и вернуться обратно без сброса контекста разговора -- вся история сохраняется. Живые виджеты в голосовом режиме: при вопросах о погоде и маршрутах ChatGPT отображает интерактивные виджеты с картами и прогнозом прямо в интерфейсе. Новый режим непрерывного перевода: ChatGPT переводит разговор в реальном времени между двумя собеседниками, говорящими на разных языках.

Детальная настройка голосового режима

Настройка на iOS

  1. Скачайте ChatGPT из App Store (или обновите до последней версии).
  2. Откройте приложение -- войдите в аккаунт.
  3. Нажмите иконку наушников в правом нижнем углу поля ввода.
  4. При первом запуске дайте разрешение на доступ к микрофону.
  5. Выбор голоса: нажмите на название голоса вверху экрана в режиме голосового общения -- откроется список из 6 вариантов (Alloy, Echo, Fable, Onyx, Nova, Shimmer). Каждый можно прослушать до выбора.
  6. Язык: голосовой режим автоматически определяет язык. Для переключения достаточно начать говорить на другом языке.

Настройка на Android

  1. Скачайте ChatGPT из Google Play или с сайта openai.com/chatgpt.
  2. Шаги 2-6 идентичны iOS. Единственное отличие: на некоторых Android-устройствах нужно дополнительно разрешить работу микрофона в фоне в настройках приложения.

Выбор голоса: 9 голосов

ChatGPT предлагает 9 голосов с разными характерами. Классические голоса: Alloy -- нейтральный, универсальный; Echo -- мягкий, задумчивый; Fable -- тёплый, повествовательный; Onyx -- глубокий, авторитетный; Nova -- энергичный, молодой; Shimmer -- спокойный, размеренный. Голоса GPT-Realtime-2 (новые): Cedar -- естественный, разговорный; Marin -- чёткий, профессиональный; Juniper -- живой, тёплый. Все голоса работают на любом языке -- переключайтесь в разговоре без ограничений.

Изучение языков голосом

Голосовой режим -- один из лучших инструментов для практики разговорного языка. Вот конкретный сценарий практики английского:

Начните сессию фразой: «Let's practice English conversation. I'm an intermediate learner. Please speak at a normal pace and correct my grammar mistakes gently after each of my responses.»

ChatGPT войдёт в роль разговорного партнёра. После каждой вашей реплики он продолжит разговор -- и мягко укажет на ошибки: «By the way, instead of 'I go yesterday', it's more natural to say 'I went yesterday' -- past tense. But great sentence structure!»

Можно сделать практику ещё интереснее:

  • «You're a barista at a London coffee shop. I'm a customer. Let's roleplay.»
  • «Give me 5 random topics, I'll speak about each for 1 minute, then you give feedback.»
  • «Only respond in English, even if I accidentally switch to Russian.»

ChatGPT в CarPlay

С марта 2026 года ChatGPT стал первым AI-ассистентом в Apple CarPlay. Требования для использования:

  • iPhone с iOS 27 или новее.
  • Приложение ChatGPT обновлено до последней версии.
  • Автомобиль с поддержкой CarPlay (проводной или беспроводной).
  • Аккаунт ChatGPT (бесплатный или Plus).

Как настроить: подключите iPhone к CarPlay, найдите иконку ChatGPT в меню приложений CarPlay. Если иконки нет -- откройте Настройки iPhone -- Основные -- CarPlay -- выберите свой автомобиль -- добавьте ChatGPT в список приложений.

Команды за рулём: нажмите иконку ChatGPT на экране автомобиля (wake-word пока не поддерживается), затем говорите. Примеры: «Кратко расскажи о пробках на трассе М4»; «Что почитать по управлению командой -- кратко»; «Составь список дел на сегодня и напомни мне позже»; «Переведи эту фразу на английский для деловых переговоров».

Непрерывный перевод в реальном времени

Голосовой режим ChatGPT можно использовать как синхронный переводчик. Это один из самых неожиданных, но практичных сценариев.

Практический пример: вы на международной конференции, рядом иностранный коллега говорит по-немецки. Откройте ChatGPT Voice Mode, скажите: «Act as a simultaneous interpreter. I'll speak in Russian, translate to English. When someone speaks English near me, translate to Russian.»

Держите телефон между собой и собеседником. ChatGPT будет переводить реплики в обе стороны в режиме реального времени с задержкой 1-2 секунды. Для коротких деловых разговоров это работает очень хорошо.

Советы для лучшего качества звука

  • Тихое место. Голосовой режим плохо справляется с сильным фоновым шумом. В кафе или на улице качество распознавания падает. Используйте наушники с микрофоном.
  • Чёткое произношение. Говорите чуть медленнее, чем обычно -- это снижает количество ошибок распознавания, особенно для технических терминов.
  • Скорость речи. Если ChatGPT говорит слишком быстро -- скажите ему: «Говори медленнее». Если слишком медленно -- «Говори в нормальном темпе». ChatGPT адаптируется сразу.
  • Перебивайте смело. В отличие от Siri и Google Ассистента, ChatGPT можно перебить в любой момент. Он немедленно остановится и выслушает вас.
  • Длинные паузы. Если вы думаете -- скажите «подожди секунду». Иначе ChatGPT может решить, что сессия завершена.

Улучшения голосового режима (июнь 2026): Голос стал естественнее: более тонкая интонация, реалистичные паузы и ритм речи, выразительная передача эмоций. Снижено количество случайных прерываний (false wake). Персонализация GPT-5.5 для тарифов Go и Free (доступна с 9 июня 2026): память ChatGPT теперь просматривает прошлые беседы, загруженные файлы и подключённый Gmail для формирования более точных и контекстных ответов. Пользователи Go и Free получают ту же персонализированную модель, что ранее была доступна только подписчикам Pro.

OpenAI разрабатывает GPT-Bidi-1 - новую голосовую модель с двунаправленным аудио (bidirectional audio). В отличие от текущего Realtime API, GPT-Bidi-1 будет работать с тремя уровнями качества: быстрый (похожий на текущий), стандартный и высококачественный. Точная дата выпуска не объявлена.

gpt-realtime API получил три новых возможности: поддержку MCP-серверов (интеграция с внешними инструментами через Model Context Protocol), ввод изображений во время голосового разговора (можно показать картинку и голосом спросить о ней), и SIP-телефония (подключение к обычным телефонным номерам через SIP-протокол).

Обновление июнь 2026: режим Advanced Voice работает на iOS 27 (ранее iOS 26.4). Доступны 9 голосов. Добавлен двунаправленный режим (bidirectional voice): голосовой ответ можно прервать в любой момент, AI мгновенно реагирует на паузу.

Новая модель speech-to-text для диктовки (июнь 2026). OpenAI выпустила обновлённую модель распознавания речи для функции диктовки в ChatGPT. Ключевые улучшения: значительно повышена точность транскрибации на всех тарифных планах (включая бесплатный). Улучшена поддержка многоязычного ввода: теперь можно переключаться между языками прямо в процессе диктовки без прерывания и перезапуска. Это отдельное улучшение от Advanced Voice Mode -- относится к текстовой диктовке (кнопка микрофона в поле ввода), а не к голосовому разговорному режиму. Особенно заметно улучшение для смешанного русско-английского ввода.

Обновление: новая модель Speech-to-Text (июль 2026)

OpenAI обновила модель преобразования речи в текст для всех тарифов. Показатель ошибок (WER) снижен на 10% и более для ведущих языков. Улучшена работа в шумной обстановке. Добавлена поддержка смешанных языков в одной фразе -- можно переключаться между языками внутри одного высказывания.

Record Mode и бесплатный доступ к Advanced Voice (2026)

В 2026 году ChatGPT получил два важных обновления, связанных с голосовыми функциями. Record Mode -- новый режим, который работает в фоновом режиме и пассивно записывает звук встречи или разговора. По завершении записи ChatGPT автоматически генерирует краткое изложение, список ключевых решений и задач. Это делает режим особенно полезным для рабочих совещаний, мозговых штурмов и лекций.

Record Mode на практике. Запись включается одним нажатием и не требует постоянного взаимодействия с телефоном. После остановки записи ChatGPT предлагает несколько форматов вывода: краткое резюме, подробные тезисы с таймкодами, список задач в формате to-do. Конспекты лекций и заметки по результатам совещаний сохраняются в истории чатов и доступны для дальнейшего редактирования.

Advanced Voice Mode стал доступен бесплатно. Если ранее Advanced Voice Mode был доступен только подписчикам ChatGPT Plus и выше, то в 2026 году OpenAI открыла базовый доступ к нему для бесплатных пользователей. Бесплатный уровень включает ограниченное количество минут разговора в месяц; полный доступ без ограничений остаётся частью платных тарифов.

Улучшенная диктовка: распознавание языков и доступ на всех планах (июль 2026)

OpenAI обновила модель speech-to-text для функции диктовки в ChatGPT - доступна на всех тарифах, включая бесплатный. Улучшения направлены прежде всего на языки с нелатинским письмом и акцентированную речь. Значительный прогресс в распознавании: японский и корейский (включая смешанный ввод хирагана/катакана/кандзи), китайский (мандаринский и кантонский), акцентированный английский (индийский, австралийский, южноафриканский акценты). Модель также лучше справляется с фоновым шумом - точность не падает при шуме в кафе или транспорте.

Обновление speech-to-text не касается Advanced Voice Mode (разговорный голосовой режим) - это отдельная система. Речь идёт о кнопке микрофона в поле текстового ввода: нажмите её, продиктуйте текст - ChatGPT распознаёт речь и вставляет в поле ввода. Теперь это работает для всех пользователей без ограничений по плану. Показатель ошибок распознавания (Word Error Rate) снижен на 10% и более по сравнению с предыдущей версией для большинства поддерживаемых языков.

GPT-Live-1 и GPT-Live-1 mini: полный дуплекс (июль 2026)

8 июля 2026 года OpenAI выпустила две новые голосовые модели. GPT-Live-1 mini стал новым режимом по умолчанию для всех пользователей ChatGPT, заменив Advanced Voice Mode. GPT-Live-1 -- старший вариант, доступный на платных тарифах. Ключевое отличие от предыдущих моделей: полный дуплекс (full-duplex audio) -- AI слушает и говорит одновременно, без ожидания паузы в речи пользователя. Это делает прерывания и живые реакции естественными. Обе модели работают на базе GPT-5.5, поддерживают поиск, рассуждения и агентские возможности. Доступны на iOS, Android и в веб-версии ChatGPT. OpenAI проектировала модели для длинных разговоров -- в тестах внутри компании фиксировались сессии продолжительностью 30-40 минут.

GPT-Live-1 поддерживает синхронный перевод в реальном времени: можно говорить на одном языке, а модель отвечает на другом без паузы для перевода. Это делает GPT-Live-1 полезным инструментом для переговоров и языкового обучения в формате живого разговора.

Новая функция визуальных карточек: при запросе прогноза погоды, котировок акций или результатов спортивных матчей GPT-Live-1 выводит структурированные карточки с данными прямо в интерфейсе, не прерывая голосовой разговор.

GPT-Live-1 поддерживает три режима рассуждения: Instant (мгновенный ответ без дополнительного обдумывания), Medium (сбалансированный режим с кратким внутренним анализом) и High (углублённый анализ перед ответом, аналог reasoning-режимов в текстовых моделях). Режим выбирается автоматически или вручную в настройках сессии. GPT-Live-1 доступен подписчикам Plus, Pro и Go; GPT-Live-1 mini доступен всем пользователям бесплатно.

Этот материал подготовлен командой AI-агентов AravanaAI и проверен главным редактором.

Тип материала: research

Поделиться:TelegramXLinkedIn
Как вам материал?

Читайте также

Хотите получать подобные материалы раньше?

Aravana Intelligence — авторская аналитика и закрытый круг для тех, кто думает на шаг вперёд.

Узнать про Intelligence

Не пропускайте важное

Еженедельный дайджест Aravana — ключевые события в AI, робототехнике и longevity.

Похожие материалы

Как начать пользоваться Agno: Python-фреймворк для создания AI-агентов

Agno (бывший phidata) - один из самых популярных Python-фреймворков для построения AI-агентов с 39k+ звезд на GitHub. Пошаговый гайд: установка, первый агент за 5 минут, мультиагентные команды и деплой в продакшн.

·8 мин

Seedance 2.5: как начать пользоваться генератором видео от ByteDance

Seedance 2.5 от ByteDance генерирует нативное 30-секундное видео в один проход, принимает до 50 мультимодальных референсов и позволяет редактировать отдельные фрагменты без перегенерации всего клипа.

·7 мин

ChatGPT Work: как начать пользоваться агентным рабочим столом OpenAI

9 июля 2026 OpenAI запустила ChatGPT Work -- агента, который берёт у вас целый проект, сам планирует шаги, работает часами в фоне и возвращает готовый документ, таблицу или презентацию.

·8 мин