Российские исследователи разработали модели для перевода устных математических формул в LaTeX

2 мин
Российские исследователи разработали модели для перевода устных математических формул в LaTeX

Исследователи из AIRI, Иннополиса, МТУСИ, НИУ ВШЭ и МГУ представили открытый датасет и набор решений для задачи Speech-to-LaTeX — перевода надиктованных математических формул в структурированную запись. Речь идёт о системе, которая позволяет произнести формулу вслух и получить на выходе текст в формате LaTeX, который используется в научных статьях, учебных материалах и редакторах вроде Overleaf.

Проблема здесь сложнее обычного распознавания речи. Математическая речь содержит вложенные конструкции, неоднозначные формулировки и сильно зависит от контекста: одна и та же фраза может соответствовать нескольким разным записям. Разработчики отмечают, что одной из главных проблем в этой области долгое время было отсутствие крупных открытых наборов данных именно с живыми аудиозаписями математической речи.

Для решения этой проблемы исследователи собрали собственный датасет. В него вошли более 66 тысяч человеческих аудиозаписей и приблизительно 571 тысячи синтетических, а также приблизительно 12 тысяч уникальных математических предложений и 10,7 тысячи отдельных уравнений на русском и английском языках. По задумке авторов, сочетание реальной и синтетической речи должно помочь моделям лучше функционировать с разными голосами, акцентами и произношением.

В работе сравнивались два подхода. Начальный — ASR post-correction: сначала аудио превращается в обычный текст системой распознавания речи, а затем языковая схема исправляет итог и переводит его в корректный LaTeX. Второй — end-to-end Audio-LLM, где схема обучается напрямую принимать аудио и сразу выдавать формулу. По данным исследователей, лучшие результаты представил именно end-to-end решение, но он требует гораздо больше вычислительных ресурсов и более крупных моделей.

Следовательно практическим компромиссом авторы считают первый вариант — связку ASR и постобработки языковой моделью примерно на 0,5–1,5 млрд параметров. Такой решение даёт более реалистичный баланс между качеством и стоимостью внедрения. Помимо этого, сами исследователи считают, что их датасет может пригодиться не только для Speech-to-LaTeX, но и для других задач, связанных с анализом речи: от голосовой биометрии до систем защиты от подделки голоса.

На практике такой средство может быть полезен в образовании, научной работе и редакторах технических текстов — везде, где математические записи приходится вводить вручную и где голосовой интерфейс мог бы серьёзно ускорить работу. Для российского AI-сегмента это ещё и редкий пример не абстрактной “модели для всего”, а довольно конкретного исследовательского инструмента с понятной областью применения.

Читают сейчас

Представлен публике публичный инициатива GNU Radio World в браузере для исследования экосистемы SDR без необходимости установки ПО

2 часа назад

Представлен публике публичный инициатива GNU Radio World в браузере для исследования экосистемы SDR без необходимости установки ПО

Представлен публичный проект под названием GNU Radio World (проект на GitHub, сообщество GNU Radio). Решение работает в браузере как учебная среда для исследования экосистемы SDR (Software Defined Rad

4 часа назад

Anthropic выпустили 3 сценария будущего с ИИ

Красивый сайт и PDF. Если кратко, то к 2030 году ИИ сделает экономику богаче, но неравенство — рекордным: по прогнозу Anthropic, к 2030 году ВВП США может вырасти до +32%, однако безработица среди офи

Apple представила iPhone 18 Pro и 18 Pro Max с переменной диафрагмой и 2-нм чипом A20 Pro

7 часов назад

Apple представила iPhone 18 Pro и 18 Pro Max с переменной диафрагмой и 2-нм чипом A20 Pro

Apple представила iPhone 18 Pro и 18 Pro Max. Главным нововведением линейки стал главный модуль камеры с физически регулируемой диафрагмой и расширенными настройками съёмки. Кроме того, смартфоны полу

Apple представила iPhone Duo — начальный складной iPhone за $2000

10 часов назад

Apple представила iPhone Duo — начальный складной iPhone за $2000

Apple представила iPhone Duo — свой первый складной телефон. Устройство выполнено в формате «книжки»: в сложенном виде пользователю доступен компактный iPhone с внешним 5,4-дюймовым экраном, а в разло

Исследователи смогли подслушать разговор по наушникам через бетонную стену

10 часов назад

Исследователи смогли подслушать разговор по наушникам через бетонную стену

Исследователи из Гонконгского университета науки и технологий и Гонконгского политехнического университета показали новый метод электромагнитной атаки, позволяющий извлекать низкочастотные аналоговые