6 марта 2026, 15:59
OpenAI готовит к релизу двунаправленную аудиомодель

Компания OpenAI ведет разработку инновационной двунаправленной (BiDi) аудиомодели, которая сделает диалог с искусственным интеллектом максимально похожим на человеческий. В отличие от текущих систем, новая техника позволяет ИИ обрабатывать речь непрерывно и мгновенно реагировать на изменения в процессе беседы.
ТТехника BiDi: конец эпохи пошаговых диалогов
Суть новой двунаправленной (BiDi) обработки звука заключается в непрерывном анализе входящего аудиопотока. В отличие от существующих пошаговых систем, где искусственный интеллект ожидает окончания фразы пользователя, BiDi-модель адаптируется к изменениям в режиме реального времени. Подобная архитектура даёт возможность алгоритму мгновенно корректировать ответ, если собеседник перебивает его или меняет тему разговора. Исследователи OpenAI отмечают, что текущие аудиомодели уступают текстовым решениям в точности и скорости, из-за чего большинство пользователей ChatGPT предпочитает текстовый оболочку голосовому.
Проблемы разработки и новые сроки запуска
В процессе тестирования прототипов инженеры столкнулись с техническими сбоями: схема начинает работать некорректно спустя несколько минут диалога. По этой причине запускание технологии перенесли с первого квартала 2026 года на следующий квартал или более поздний дедлайн. Данная задержка продолжает историю сложностей OpenAI с аудиопродуктами. Ранее добавление режима Advanced Voice Mode для GPT-4o откладывалось для доработки инфраструктуры и систем безопасности. В процессе ранних тестов специалисты фиксировали ошибки, включая имитацию голоса пользователя и неожиданные выкрики системы. Сегодня разработчики сосредоточены на способности модели обнаруживать и отклонять нежелательный контент.
Аппаратное будущее и экосистема устройств OpenAI
РСоздание новой модели является частью стратегии OpenAI по выходу на сегмент потребительской электроники. Компания планирует представить персональное аудиоустройство на протяжении года, а в дальнейшем расширить портфель за счет умных колонок и очков. Для интеграции в гаджеты и автомобили ведется создание облегченных моделей, способных обрабатывать аудио локально. Это позволит снизить затраты по сравнению с облачными вычислениями, следуя примеру Google, использующей схема Gemini Nano в смартфонах Pixel. Для ускорения работ руководство OpenAI объединило команды инженеров, исследователей и продуктологов в единую группу, сфокусированную на аудиорешениях.
Читают сейчас

16 минут назад
Энтузиаст запустил DLSS 5 Neural Rendering для обычной веб-камеры
Разработчик под ником jpneagle опубликовал экспериментальный инициатива, который пропускает изображение с обычной веб-камеры через NVIDIA DLSS 5 Neural Rendering в реальном времени. Исходный код демо
17 минут назад
Astra использует рекуррентную глубину — и это осложняет аудит модели
В будущей модели Astra OpenAI использует архитектурный прием recurrent depth, также известный как looped transformer. Вместо того чтобы каждый слой обрабатывать вход один раз, модель многократно прого

29 минут назад
Приглашаем обсудить добавление ИИ-агентов в бизнес
Регистрируйтесь на бесплатный вебинар 10 сентября в 12:00 (мск). Эксперты из Selectel, GlowByte и DataSapience в прямом эфире поговорят про экономику ИИ и растущий тенденция на ИИ-агентов, а также пре
33 минуты назад
СМИ: виртуальный рубль может привести к потере до 100 млрд рублей комиссионных доходов банков и к оттоку 10% пассивов
По информации СМИ, виртуальный рубль может привести к потере до 100 млрд рублей комиссионных доходов банков ежегодно, а равным образом к оттоку 10% пассивов. Кроме того, появление на окупаемость проек

1 час назад
«Бюро 1440»: начато поэтапное добавление спутниковой связи нового поколения на скоростных поездах
Российская аэрокосмическая компания «Бюро 1440» (занимается разработкой низкоорбитальной спутниковой группировки и планирует предоставление услуг широкополосной передачи данных с глобальным покрытием,