1 час назад
Google DeepMind выпустила ML‑модель для перевода жестового языка в текст

Google DeepMind представила SL2T — модель для перевода американского жестового языка в текст. Нейросеть интегрировали в Gboard и Live Transcribe на Pixel 11: пользователи могут вводить текст, показывая жесты на камеру. В будущем технологию планирую добавить на другие устройства и расширят поддерживаемые языки.
В Gboard функция работает как голосовая диктовка: пользователь направляет камеру устройства на себя и начинает жестикулировать, а система преобразует жесты в текст на английском языке. Так можно писать сообщения, набирать документы, вводить поисковые запросы или общаться с Gemini. В Live Transcribe техника позволяет отвечать жестами во время разговора с человеком, использующим устную речь.
Схема SL2T построена на базе трансформера и генерирует перевод авторегрессионно. На вход модель получает не изображение с камеры, а последовательность координат 130 ключевых точек лица, тела и рук. Это отличает SL2T от других систем, которые пытаются сопоставлять отдельные жесты со словами. Это важно, так как смысл фраз на жестовом языке часто передаётся не только руками, но и движениями корпуса, головы и лица.

Google отмечает, что система локально обрабатывает видео с камеры и сразу удаляет, а на сервера компании попадают только координаты. Это даёт больше приватности и снижает требования к передаче данных, но накладывает несколько ограничений. Например, SL2T не может отслеживать движение языка, не видит окружающие объекты и не получает информацию о глубине.
Для обучения Google собрала более 100 тысяч часов данных на более чем 50 жестовых языках, около четверть датасета приходится на ASL. Компания отмечает, что обучение сразу на нескольких языках помогло улучшить качество перевода американского жестового языка. Дополнительно разработчики имитировали сценарии использования смартфона одной рукой и зеркально отражали движение, чтобы платформа хорошо работала с левшами.
В тесте FLEURS‑ASL схема получила 70 баллов в режиме zero‑shot, а на версии теста с жестами одной рукой — 74 балла. Точность распознавания по FSboard составляет 64%. В целом схема может хуже справляться с распознаванием региональных вариантов жестов и сложных грамматических конструкций, ошибаться при передаче смысла через мимику и генерировать перевод, когда пользователь не показывает жестов.
В ранних версиях у SL2T прослеживались ошибки, характерные для других языковых моделей. В частности, телефонный код 207 система распознавала как 2007. Часть подобных проблем Google исправила перед релизом, но галлюцинации всё ещё встречаются.
Равным образом система пока может обрабатывать фрагменты продолжительностью не более 60 секунд и не хранит историю реплик. Она не учитывает приложение, в котором активируют распознавание, и не поддерживает внедрение пользовательских жестов в словарь. Команды «удалить», «новая строка» или «отправить» пока тоже не поддерживаются.
Читают сейчас

25 минут назад
Стартап-компания Discovered Materials при помощи ИИ‑агентов ищет новые материалы для чипов, которые будут меньше нагреваться
Стартап Discovered Materials ищет новые материалы для создания чипов, которые будут меньше нагреваться. Для этого организация использует программный конвейер: ИИ‑агенты предлагают потенциальные матери

29 минут назад
В Москве стартовали устанавливать зарядные станции на зданиях центральных тепловых пунктов
В Москве запустили проект по размещению зарядных станций для электромобилей на зданиях центральных тепловых пунктов (ЦТП), расположенных во дворах многоквартирных домов. Инициатором проекта выступило

34 минуты назад
Amazon будет по умолчанию применять для обучения ИИ‑моделей контент стримеров Twitch, если они не откажутся от этого
Стриминговая платформа Twitch будет по умолчанию использовать контент авторов для обучения моделей генеративного искусственного интеллекта своей материнской компании Amazon. Стримерам придётся самим з

39 минут назад
Go-Go-Gadg...Error? Смотрим, как ошибаются Go авторы
В Go авторы ошибаются как и в любом другом языке: опечатки, дубликаты, нерабочие условия проверок и тому подобное. Но почему? Ведь многие используют тот же go vet который прекрасно находит всё это… ве

47 минут назад
DeepSeek обновили V4 Pro: конкурент Fable 5, Kimi K3 и GLM 5.2
DeepSeek без большого анонса обновили V4 Pro. Новая релиз уже работает в api под прежним ID deepseek-v4-pro, следовательно существующие интеграции переключатся на неё автоматически. Основной прирост в