8 июля 2026, 20:26
«Мхм», «ага»: свежий голосовой ChatGPT ведет себя как живой собеседник

OpenAI представила GPT-Live — новое поколение голосовых моделей, которое с 8 июля становится основой голосового режима ChatGPT. Ключевое отличие — full-duplex архитектура: модель слушает и сообщает одновременно. В разговоре она поддакивает ("мхм", "ага"), дает себя перебить, ждет, если собеседник задумался, а по просьбе может просто помолчать и послушать.
Прежние голосовые системы OpenAI работали иначе. Начальный ChatGPT Voice был каскадом из трех моделей (распознавание речи, языковая схема, синтез), в связи с чего отвечал медленно и терял нюансы. Advanced Voice Mode обрабатывал звук одной моделью, но по очереди: он ждал тишины, чтобы начать говорить, и потому перебивал при любой паузе. GPT-Live непрерывно обрабатывает входящий звук прямо во время генерации ответа и принимает решения — говорить, прослушивать, замолчать или вызвать инструмент — множество раз в секунду.
Второе новшество — делегирование. Легкая разговорная схема отвязана от "глубокой работы": если вопрос требует веб-поиска или сложных рассуждений, GPT-Live передает задачу фронтир-модели (на старте это GPT-5.5), а сама продолжает беседу, пока ответ готовится в фоне. Пользователь может выбрать уровень рассуждений — Instant, Medium или High. Кроме того, прямо во время разговора ChatGPT теперь демонстрирует визуальные карточки: погоду, котировки, спортивные результаты, карты.
Развертывание уже началось на iOS, Android и вебе по всему миру: GPT-Live-1 станет моделью по умолчанию для подписчиков Go, Plus и Pro, а GPT-Live-1 mini — для бесплатных пользователей. В слепых сравнениях 5–10-минутных разговоров обе версии заметно выигрывают у Advanced Voice Mode по естественности и смене реплик. Из ограничений: на старте нет поддержки видео и демонстрации экрана (для них остаются старые режимы), а на части языков возможен акцент и пробелы во владении. В api модели обещают позже — голосовыми функциями ChatGPT, по данным OpenAI, еженедельно пользуются более 150 млн человек.
P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.
Читают сейчас

4 часа назад
Black Forest Labs выпустила FLUX Video Upscale — апскейлер видео до 4K
Black Forest Labs запустила FLUX Video Upscale — схема для восстановления и увеличения разрешения видео до 4K. Средство работает не как обычный покадровый апскейлер: он перегенерирует кадры на новом р
5 часов назад
Anthropic встроила Mythos 5 в Claude Security
Anthropic начала использовать Claude Mythos 5 для сканирования кода на уязвимости в Claude Security. Опция уже доступна в публичной бете клиентам Claude Enterprise. Администратор включает Claude Secur
5 часов назад
Похоже, команда NVIDA добилась ощутимого прогресса в улучшении возможностей уже существующих LLM
В блоге компании NVIDA обнародован пост о возможностях разработанной ими обвязки над LLM c названием AVO (Agentic Variation Operators). Судя по всему, изначально она разрабатывалась для улучшения архи

5 часов назад
Просмотр рилсов деактивирует когнитивную систему контроля мозга
Когда люди смотрят короткое видео, оно им нравится, и они досматривают его до конца, две области мозга, участвующие в когнитивном контроле, демонстрируют значительную деактивацию. Это главный вывод но

6 часов назад
В веб-версии Telegram появился WEB-прокси
22 августа 2026 года в веб-версии Telegram появилось обновление с WEB-прокси. В коде клиента мессенджера добавлен свежий тип прокси. Клиент мессенджера сможет скрывать посещаемость MTProxy внутри обыч