«Мхм», «ага»: свежий голосовой ChatGPT ведет себя как живой собеседник

2 мин
«Мхм», «ага»: свежий голосовой ChatGPT ведет себя как живой собеседник

OpenAI представила GPT-Live — новое поколение голосовых моделей, которое с 8 июля становится основой голосового режима ChatGPT. Ключевое отличие — full-duplex архитектура: модель слушает и сообщает одновременно. В разговоре она поддакивает ("мхм", "ага"), дает себя перебить, ждет, если собеседник задумался, а по просьбе может просто помолчать и послушать.

Прежние голосовые системы OpenAI работали иначе. Начальный ChatGPT Voice был каскадом из трех моделей (распознавание речи, языковая схема, синтез), в связи с чего отвечал медленно и терял нюансы. Advanced Voice Mode обрабатывал звук одной моделью, но по очереди: он ждал тишины, чтобы начать говорить, и потому перебивал при любой паузе. GPT-Live непрерывно обрабатывает входящий звук прямо во время генерации ответа и принимает решения — говорить, прослушивать, замолчать или вызвать инструмент — множество раз в секунду.

Второе новшество — делегирование. Легкая разговорная схема отвязана от "глубокой работы": если вопрос требует веб-поиска или сложных рассуждений, GPT-Live передает задачу фронтир-модели (на старте это GPT-5.5), а сама продолжает беседу, пока ответ готовится в фоне. Пользователь может выбрать уровень рассуждений — Instant, Medium или High. Кроме того, прямо во время разговора ChatGPT теперь демонстрирует визуальные карточки: погоду, котировки, спортивные результаты, карты.

Развертывание уже началось на iOS, Android и вебе по всему миру: GPT-Live-1 станет моделью по умолчанию для подписчиков Go, Plus и Pro, а GPT-Live-1 mini — для бесплатных пользователей. В слепых сравнениях 5–10-минутных разговоров обе версии заметно выигрывают у Advanced Voice Mode по естественности и смене реплик. Из ограничений: на старте нет поддержки видео и демонстрации экрана (для них остаются старые режимы), а на части языков возможен акцент и пробелы во владении. В api модели обещают позже — голосовыми функциями ChatGPT, по данным OpenAI, еженедельно пользуются более 150 млн человек.

P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.

Читают сейчас

Black Forest Labs выпустила FLUX Video Upscale — апскейлер видео до 4K

4 часа назад

Black Forest Labs выпустила FLUX Video Upscale — апскейлер видео до 4K

Black Forest Labs запустила FLUX Video Upscale — схема для восстановления и увеличения разрешения видео до 4K. Средство работает не как обычный покадровый апскейлер: он перегенерирует кадры на новом р

5 часов назад

Anthropic встроила Mythos 5 в Claude Security

Anthropic начала использовать Claude Mythos 5 для сканирования кода на уязвимости в Claude Security. Опция уже доступна в публичной бете клиентам Claude Enterprise. Администратор включает Claude Secur

5 часов назад

Похоже, команда NVIDA добилась ощутимого прогресса в улучшении возможностей уже существующих LLM

В блоге компании NVIDA обнародован пост о возможностях разработанной ими обвязки над LLM c названием AVO (Agentic Variation Operators). Судя по всему, изначально она разрабатывалась для улучшения архи

Просмотр рилсов деактивирует когнитивную систему контроля мозга

5 часов назад

Просмотр рилсов деактивирует когнитивную систему контроля мозга

Когда люди смотрят короткое видео, оно им нравится, и они досматривают его до конца, две области мозга, участвующие в когнитивном контроле, демонстрируют значительную деактивацию. Это главный вывод но

В веб-версии Telegram появился WEB-прокси

6 часов назад

В веб-версии Telegram появился WEB-прокси

22 августа 2026 года в веб-версии Telegram появилось обновление с WEB-прокси. В коде клиента мессенджера добавлен свежий тип прокси. Клиент мессенджера сможет скрывать посещаемость MTProxy внутри обыч