2 часа назад
Google выкатила Gemini 3.8 Live и версию с рассуждениями

15 сентября Google представила две нативные speech-to-speech модели, Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Первая заточена под масштаб и цену, вторая — под многошаговые задачи с рассуждением прямо в диалоге.
Интереснее баллов то, что голосовые агенты наконец получили признаки продакшен-продукта. Асинхронные вызовы функций, предсказуемая цена, интеграции с тем, на чем такие системы реально собирают.
Хочу напомнить, как это делалось раньше. Голосовой бот — конвейер из трех сервисов. Распознавание речи, языковая схема и синтез. Задержки складываются, а наряду с текстом может потеряться все остальное — интонация, скорость речи, эмоция, шум на фоне. Модель получает расшифровку и не знает, что собеседник злится. Проблемным было и перебивание. Пока распознавание не закрыло фразу, платформа вообще не понимает, что ее прервали. Нативная speech-to-speech модель работает с аудио напрямую и снимает оба ограничения разом.
Цифры
Extended Thinking занял первое место в Speech to Speech Quality Index от Artificial Analysis с результатом 82,6. На агентных задачах τ-Voice у него 68,6%, на банковском срезе τ-Voice-banking от Sierra — 35,1%, на Big Bench Audio — 97,7%.

Бенчмарки звучат абстрактно, поэтому переведу. Разговаривать и рассуждать вслух модель научилась отлично. А вот довести клиента до конца банковской процедуры, где надо проверить данные, удержать состояние и не ошибиться в сумме, у нее получается в трети случаев.
Обычная Live встала второй в Speech Agent Arena, и здесь акцент сделан на стоимости. Аудио на входе стоит 0,005 $ за минуту, на выходе — 0,018 $. В пересчете на токены получается приблизительно 3 $ за миллион входных и $12 за миллион выходных.
Что появилось технически
Асинхронный вызов функций — самое практичное изменение. Инструмент выполняется в фоне, пока аудиопоток продолжается, и агент больше не замолкает, уходя в api. Extended Thinking вдобавок проговаривает прогресс вслух, пока думает. В голосовом интерфейсе это заменяет анимированный значок загрузки, который обычно крутится на экране, пока программа выполняет какую-то задачу.
Из остального — обработка визуального контекста почти в реальном времени и 97 языков с переключением посреди разговора. Отдельно Google поработала над точностью распознавания буквенно-цифровых последовательностей, номеров заказов, кодов, счетов. Аудио на выходе помечается водяным знаком SynthID.
Где это живет
Модели доступны через Gemini api и Google AI Studio, в Gemini Enterprise пока приватное превью. Для пользователей обычная Live уехала в Search Live, Extended Thinking — в Gemini Live и Workspace на тарифах AI Pro и Ultra. Из интеграций заявлены LiveKit, Pipecat, LangChain, Vercel, Agora. Из партнерских кейсов — Salesforce, ServiceNow, Genspark и Lumeris.
В релизе не подсвечена одна оговорка. Self-hosting не предусмотрен, обе модели работают только как хостируемый служба.
Что это значит
Цену полезно перевести в понятные единицы. Час разговора, где схема сообщает примерно половину времени, обходится в доллар с небольшим, без учета вызовов инструментов. Час работы живого оператора почти в любой юрисдикции стоит на порядок дороже.
При таких цифрах экономика сценария упирается уже в интеграции с CRM и телефонией, а главное — в цену ошибки. Поэтому 35,1% на банковском бенчмарке для того, кто планирует внедрить, важнее, чем первое место в общем рейтинге.
Ограничение тоже понятное. Голос — персональные данные в самой неудобной форме. Голосовой отпечаток, фоновые звуки, случайные фразы третьих лиц рядом. Отсутствие self-hosted варианта закрывает весь класс сценариев, где аудио не имеет права покидать периметр, а в медицине, финансах и госсекторе таких сценариев довольно много.
Кто-нибудь уже собирал голосового агента на нативной speech-to-speech модели? Пишите в комментарии.

ИИ‑роутер — доступ к 300+ моделям из одной панели
Подключите OpenAI‑совместимый шлюз по единому api‑ключу. Настраивайте сквозную аналитику, отслеживайте лимиты и квотируйте ресурсы.
Запустить ИИ‑роутер →
Читают сейчас

1 час назад
опубликовал полноценное программа для ПК
— платформа для работы с сотнями ИИ-моделей. В одном интерфейсе доступны ChatGPT, Claude, Gemini, Grok, DeepSeek, генераторы изображений, видео и другие модели. Для использования не нужно оформлять от

2 часа назад
От рабочего опыта к публичной экспертизе в эпоху AI
У многих за плечами кейсы, эксперименты, ошибки и найденные решения — но публично о них почти никто не рассказывает. 17 сентября в 18:30 МСК Катя Ярадайкина, DevRel Garage Eight, проведёт вебинар «От

2 часа назад
Denuvo подала иск против взломщика игр с ником voices38 за обход системы защиты игр
Австрийская компания‑разработчик цифровых средств защиты видеоигр Denuvo Software Solutions направила в федеральный суд США иск согласно Законом об авторском праве в цифровую эпоху (DMCA) против анони

2 часа назад
В «Яндекс Картах» теперь можно без подключения к интернету построить все виды маршрутов через офлайн‑карту
В «Яндексе» сообщили, что в «Яндекс Картах» стали доступны без интернета все виды навигации. В офлайн‑режиме геосервис теперь умеет прокладывать путь на общественном транспорте (автобусе, трамвае и др
3 часа назад
Изменения в диете снизили расчётный биологический возраст испытуемых всего за 4 недели
Новое исследование Сиднейского университета показало, что у австралийцев в возрасте от 65 до 75 лет изменение соотношения жиров, углеводов и источников белка в рационе всего за четыре недели сопровожд