В России представили первую открытую методологию тестирования RAG‑систем

2 мин

Исследователи из Сбера (команда SberAI), МТС Web Services (MWS AI) и ведущих российских и международных вузов разработали первую открытую динамическую методологию тестирования русскоязычных систем генеративного ИИ с поиском (RAG). Работу приняли на EACL 2026 — одну из крупнейших конференций по компьютерной лингвистике, которая проходит с 24 по 29 марта 2026 года в Рабате (Марокко), рассказали у в МТС.

RAG‑системы (Retrieval‑Augmented Generation) объединяют большие языковые модели с базами знаний и корпоративными данными. Это позволяет ИИ‑ассистентам отвечать на запросы с опорой на актуальную информацию и снижать риск ошибок. Такие решения лежат в основе современных ИИ‑агентов, способных выполнять сложные задачи без участия человека.

Новая методология получила название DRAGOn (Designing RAG on Periodically Updated Corpus). Она решает ключевую проблему существующих тестов: большинство из них либо используют устаревающие статичные данные, либо не учитывают специфику корпоративных баз знаний. DRAGOn, напротив, работает с постоянно обновляемыми источниками — в частности, новостными лентами — и автоматически формирует из них «карту знаний».

Платформа генерирует не простые вопросы, а многоуровневые логические задачи, требующие сопоставления фактов из разных источников. Проверку ответов выполняет отдельная нейросеть, которая оценивает не только совпадение формулировок, но и точность и полноту ответа.

По словам соавтора исследования, руководителя центра разработки больших языковых моделей MWS AI Валентина Малых, индустрия ИИ смещается от гонки размеров моделей к качеству прикладных решений. Он отметил, что методология универсальна и может применяться в разных сферах — от анализа научных публикаций до юридических документов.

В рамках проекта также запустили начальный публичный рейтинг (лидерборд) русскоязычных RAG‑систем. Предварительные результаты показывают, что наилучшие показатели достигаются при комбинации нескольких моделей и продвинутых методов поиска, однако даже такие решения пока испытывают сложности при работе со сложными логическими связями.

Практическая ценность разработки заключается в том, что компании смогут разворачивать собственные тестовые среды на внутренних данных. Это позволит заранее оценивать точность ИИ‑систем, сравнивать разные подходы и снижать риски ошибок при внедрении.

В исследовании приняли участие специалисты Сбера, MBZUAI, ИТМО, МИСИС, НИУ ВШЭ, МТС Web Services, IITU и Школы анализа данных «Яндекса».

Читают сейчас

Правительство поддержало законопроект о резервировании «красивых» автомобильных номеров

1 час назад

Правительство поддержало законопроект о резервировании «красивых» автомобильных номеров

Правительственная комиссия по законопроектной деятельности подготовила положительный отзыв на инициативу о введении механизма резервирования автомобильных госномеров для граждан. Об этом пишет «Ъ». За

ComNews: «1С» повысит на 14% цены на свои продукты и услуги в 2026 году

1 час назад

ComNews: «1С» повысит на 14% цены на свои продукты и услуги в 2026 году

По информации источников издания ComNews, «1С» повысит на 14% цены на свои продукты и услуги с 1 апреля 2026 года. Формально это удорожание укладывается в рамки Ценовой хартии социально ответственного

$150 000 за месяц на Claude Code: новая гонка пожирателей токенов

2 часа назад

$150 000 за месяц на Claude Code: новая гонка пожирателей токенов

Один пользователь Claude Code внутри Anthropic потратил более $150 000 за месяц, а инженер OpenAI за неделю прогнал через модели компании 210 млрд токенов — этого хватило бы, чтобы заполнить Википедию

В московском метро нашли гарнитура «Яндекс Дропс»: в компании заявили, что девайс проходит финальные тесты

2 часа назад

В московском метро нашли гарнитура «Яндекс Дропс»: в компании заявили, что девайс проходит финальные тесты

Фотография наушников «Яндекс Дропс» появилась в социальной сети X. Автор поста отмечает, что нашла их на полу на станции метро «Театральная» в центре Москвы. Устройство анонсировали в декабре прошлого

Количество подписчиков на Rutube превысило миллион

2 часа назад

Количество подписчиков на Rutube превысило миллион

База платных подписчиков Rutube превысила 1 млн человек, пишет «Ъ» со ссылкой на представителей платформы. В контексте подписки пользователи получают доступ к расширенным возможностям сервиса, в частн