1 час назад
Яндекс показал Sona — схема, способную заменить десятки алгоритмов рекомендаций
Мы разработали Sona — генеративную нейросеть, которая по действиям пользователя определяет, что ему порекомендовать и в каком порядке. Для крупного рекомендательного сервиса такой решение нетипичен: обычно за эти задачи отвечают разные модели, обученные по отдельности. В A/B-тесте музыкальных рекомендаций на умных колонках с Алисой Sona заменила такую систему из десятков алгоритмов; по сравнению с контрольной группой общее время прослушивания выросло на 6,30%, а число лайков — на 11,42%.
Разработкой и тестированием новой модели занимались команда R&D, инженеры Алисы и Яндекс Музыки. Расскажем, как они научили модель находить треки среди миллионов без перебора всего каталога и определять их порядок, зачем им понадобился «учитель» и как Sona учится на свежих действиях слушателей. Разберём результаты теста и объясним, что ещё предстоит проверить перед широким внедрением.

Зачем менять систему из десятков алгоритмов
В действующей системе музыкальных рекомендаций на Яндекс Станциях, с которой мы сравнивали Sona, треки проходят несколько этапов отбора. Сначала более 15 алгоритмов находят в каталоге композиции, которые могут подойти слушателю. Затем модель предранжирования сокращает этот список, а финальная схема ранжирования оценивает оставшиеся треки и определяет порядок воспроизведения. Для отбора используются сотни признаков, в том числе сигналы трансформерной модели Argus — о ней мы уже рассказывали на е.
Развивать такую систему сложно: модели на разных этапах обучаются отдельно, а результат зависит от их совместной работы. Например, алгоритм поиска может научиться находить более подходящие треки, но следующие модели могут отсеять их или поставить в конец списка. Поэтому каждое изменение нужно проверять на всей цепочке — усовершенствование одного этапа ещё не означает улучшения итоговых рекомендаций. Одновременно команда поддерживает и сами модели, и сотни признаков, которые они используют.
Над тем, как преодолеть ограничения многоэтапной схемы, работают и другие компании. В частности, китайская видеоплатформа Kuaishou с 2025 года публикует исследования OneRec, где генеративная нейросеть подбирает видео для рекомендаций. Тем не менее в опубликованной архитектуре OneRec одна схема предлагает видео, а другая выбирает лучшие. Мы решили проверить, сможет ли одна схема и находить треки, и определять их порядок.
Как Sona формирует рекомендации
Чтобы объединить поиск и ранжирование, мы дали им общее представление истории слушателя. При подборе музыки на Станциях Sona один раз анализирует прослушивания, пропуски и лайки. Результат этих вычислений она использует сначала для поиска треков, затем для их оценки.
Для поиска мы заранее присваиваем каждому треку Semantic ID — короткий составной код. При его построении учитываем первые 90 секунд записи и метаданные трека. Чтобы исходник отражал ещё и поведение слушателей, механизм его построения обучаем на данных о прослушиваниях и рекомендациях. В результате у композиций, похожих по звучанию или поведению слушателей, может совпадать начало кода. Благодаря этому модель при обучении на одних треках учится подбирать и другие, похожие на них.
По истории слушателя Sona генерирует такие коды. Сначала она выбирает начало кода, затем дополняет его: с каждым добавленным элементом остаётся меньше композиций, которым соответствует полученная последовательность. Так модель постепенно сужает поиск. По готовым кодам платформа находит соответствующие композиции в каталоге. Одному коду могут соответствовать некоторое количество треков — все они попадают в список кандидатов для дальнейшей оценки.
Теперь нужно решить, какие из найденных треков поставить выше. Для этого внутри Sona работает модуль ранжирования. Он сопоставляет каждый трек с историей слушателя, выставляет оценку и по этим оценкам определяет порядок воспроизведения. Здесь Semantic ID тоже полезны: они служат признаками, по которым схема оценивает композицию. Итак, информация о сходстве треков участвует и в поиске, и в ранжировании.
Зачем Sona понадобился «учитель»
Оценивать найденные треки нужно и точно, и быстро: от этого зависит, какую музыку услышит слушатель и сколько ему придётся ждать. Чтобы научить Sona оценивать рекомендации, мы использовали отдельную большую модель — «учителя». Во время обучения она может выполнять больше вычислений, чем схема, которая подбирает музыку в работающем сервисе.
Сначала мы обучили «учителя» на данных о действиях слушателей за год: какие композиции они слушали, какие пропускали, каким ставили лайки и дизлайки. На основе этих данных модель научилась оценивать, насколько подходящей рекомендацией будет определённый трек для конкретного слушателя.
Затем оценки «учителя» стали примерами для обучения Sona. Для одной и той же истории слушателя обе модели оценивают одни и те же композиции, включая найденные самой Sona. Мы сравниваем результаты и корректируем Sona так, чтобы её оценки приближались к оценкам «учителя».
При подборе музыки «учитель» уже не нужен: Sona сама находит треки, оценивает их и определяет порядок. Большая схема помогает обучить Sona, а сама Sona рассчитана на оперативный ответ в работающем сервисе.
Как Sona учится на свежих действиях слушателей
После запуска обучение Sona продолжается. Пока одна копия модели подбирает музыку, другая учится на новых прослушиваниях, пропусках и лайках. Обновлённые версии регулярно поступают в сервис рекомендаций.
Для обучения мы связываем три вещи: что было известно о слушателе перед рекомендацией, какие треки ему предложили и как он на них отреагировал. Одновременно сохраняем порядок событий. Например, лайк, поставленный после рекомендации, служит результатом, на котором схема учится. В историю, по которой она должна была выбрать этот трек, такой лайк попадать не должен — иначе при обучении у модели появилась бы подсказка из будущего.
Каждые 10 минут служба получает обновлённую версию Sona. Но это не значит, что любой свежий лайк повлияет на обучение уже через 10 минут: сначала нужно собрать информация и обучить на них схема. Весь путь от действия слушателя до работающей версии Sona, которая учла это действие, занимает 45 минут по медиане и не больше часа в 99% случаев.
Итоги
Мы проверили Sona в музыкальных рекомендациях на умных колонках с Алисой. В этом сценарии слушатель запускает музыку, не указывая исполнителя, жанр или настроение, — выбор треков полностью ложится на систему рекомендаций.
Тест шёл семь дней. Мы случайным образом распределили пользователей в две группы, по 15% аудитории в каждой. В контрольной группе музыку подбирала действующая система, в экспериментальной — Sona.
По сравнению с контрольной группой:
• общее время прослушивания выросло на 6,30%;
• число лайков — на 11,42 процентов.
Активная аудитория выросла в тесте Sona на 4,53% — в 2,4 раза больше, чем после внедрения Argus, который в своё время существенно улучшил качество рекомендаций.
Перед широким внедрением нам нужно проверить, сохраняется ли результат в течение нескольких месяцев. Ещё предстоит испытать Sona в других сценариях музыкальных рекомендаций. Равным образом мы планируем проверить подход в Яндекс Рекламе. В перспективе его можно применять и в других продуктах с персональными рекомендациями. Для этого модель нужно обучить на данных соответствующего продукта и отдельно проверить качество её рекомендаций.
Архитектуру Sona, обучение и результаты экспериментов мы подробно описали в техническом отчёте на arXiv.
Читают сейчас
23 минуты назад
Cloudflare станет публичным центром сертификации
Компания Cloudflare заявила, что станет публичным центром сертификации и начнёт самостоятельно выпускать бесплатные TLS‑сертификаты для сайтов. Читать далее

27 минут назад
СК предложил приравнять электросамокатчиков к водителям и обязать их получать права
Следственный комитет предложил распространить статус водителя транспортных средств на электросамокатчиков, а также ввести требование о получении прав для управления этими устройствами. Об этом сообщил
43 минуты назад
Суд Токио впервые в истории Японии защитил голос человека правом на коммерческое использование
Впервые в истории Японии окружной суд Токио постановил, что голос человека защищён правом на коммерческое использование образа, как и право на портрет. Такое подход суд вынес по делу об имитации речи

1 час назад
Версия GitRiver 1.1.0 — self-hosted платформы для управления git-репозиториями
В конце сентября 2026 года состоялся версия GitRiver 1.1.0 – self-hosted платформы для управления git-репозиториями. Исходный исходник проекта написан на Rust. В базе решения один бинарник (~46 МБ), к

2 часа назад
Как строить защиту облачной инфраструктуры: от логов до мониторинга
6 октября на вебинаре эксперты УЦСБ SOC и T1 Облако разберут, как выстроить продуктивный мониторинг и защиту облачной инфраструктуры: какие данные собирать, как выявлять и предотвращать угрозы с помощ