8 июля 2026, 20:26
«Мхм», «ага»: свежий голосовой ChatGPT ведет себя как живой собеседник

OpenAI представила GPT-Live — новое поколение голосовых моделей, которое с 8 июля становится основой голосового режима ChatGPT. Ключевое отличие — full-duplex архитектура: модель слушает и сообщает одновременно. В разговоре она поддакивает ("мхм", "ага"), дает себя перебить, ждет, если собеседник задумался, а по просьбе может просто помолчать и послушать.
Прежние голосовые системы OpenAI работали иначе. Начальный ChatGPT Voice был каскадом из трех моделей (распознавание речи, языковая схема, синтез), в связи с чего отвечал медленно и терял нюансы. Advanced Voice Mode обрабатывал звук одной моделью, но по очереди: он ждал тишины, чтобы начать говорить, и потому перебивал при любой паузе. GPT-Live непрерывно обрабатывает входящий звук прямо во время генерации ответа и принимает решения — говорить, прослушивать, замолчать или вызвать инструмент — множество раз в секунду.
Второе новшество — делегирование. Легкая разговорная схема отвязана от "глубокой работы": если вопрос требует веб-поиска или сложных рассуждений, GPT-Live передает задачу фронтир-модели (на старте это GPT-5.5), а сама продолжает беседу, пока ответ готовится в фоне. Пользователь может выбрать уровень рассуждений — Instant, Medium или High. Кроме того, прямо во время разговора ChatGPT теперь демонстрирует визуальные карточки: погоду, котировки, спортивные результаты, карты.
Развертывание уже началось на iOS, Android и вебе по всему миру: GPT-Live-1 станет моделью по умолчанию для подписчиков Go, Plus и Pro, а GPT-Live-1 mini — для бесплатных пользователей. В слепых сравнениях 5–10-минутных разговоров обе версии заметно выигрывают у Advanced Voice Mode по естественности и смене реплик. Из ограничений: на старте нет поддержки видео и демонстрации экрана (для них остаются старые режимы), а на части языков возможен акцент и пробелы во владении. В api модели обещают позже — голосовыми функциями ChatGPT, по данным OpenAI, еженедельно пользуются более 150 млн человек.
P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.
Читают сейчас

5 часов назад
Нобелевскую премию по физике вручили руководителю проекта нейтринного детектора
Нобелевская премия по физике 2026 года присуждена исследователю, который превратил огромный массив льда на Южном полюсе в детектор неуловимых частиц, называемых нейтрино, прилетающих на Землю из космо

9 часов назад
В ЕС введут штрафы до 15 млн евро за публикацию нейрослопа без маркировки
OpenAI объявила, что добавит в генерации текста ChatGPT и Codex невидимые водяные знаки. Мы с вами их не заметим. Особый механизм меняет статистику набора слов, для того чтобы детектор вотермарок смог

11 часов назад
Сравнили 461 тысячу AI-ответов: упоминание бренда не коррелирует с цитированием источника
Организация MarketScale, которая развивает B2B-платформу для создания и распространения экспертного контента, вчера обновила B2B Marketing Index — регулярно пересчитываемый набор данных о том, как пят

11 часов назад
Что ждет российский сегмент ПО в 2027 году: обсудим на GuardConf
Российский ИТ-рынок вступает в фазу жесткой конкуренции: импортозамещение теряет роль драйвера, клиент выбирает решения по эффективности и совместимости, а отрасль ищет новые точки роста. Куда движетс

11 часов назад
Моушн-дизайн за копейки: Grom Motion создаёт инфографику и рилсы одной кнопкой
Моушн-дизайн традиционно остается одной из самых ресурсоемких задач в продакшене. Написание сценария, подбор футажей, анимация инфографики, синхронизация звука – всё это требует часов рутинной работы