Похоже, команда NVIDA добилась ощутимого прогресса в улучшении возможностей уже существующих LLM

1 мин

В блоге компании NVIDA опубликован пост о возможностях разработанной ими обвязки над LLM c названием AVO (Agentic Variation Operators). Судя по всему, изначально она разрабатывалась для улучшения архитектуры GPU самой компании NVIDA (в чем тоже очень преуспела), но потом ее решили попробовать на решении одной из самых трудных для языковых моделей задач - тесте ARC-AGI-3 специально разработанном итак, что бы задачи могли сравнительно легко решаться среднестатистическим человеком, но были труды для языковых моделей. В частности, не менее 20% людей решают все 100% задач с первой попытки.

До последнего времени результат модели Claude Opus 5, с которой экспериментировали разработчики, составлял около 30%, но с подключением AVO он скакнул сразу до 100%. Обсуждаемая обвязка может работать и с другими моделями, например авторы экспериментировали с GPT-5.6 Sol. Судя по изложенному в публикации материалу, AVO выступает для самой модели чем-то вроде направляющего ее агента, помогая осуществлять стратегическое планирование, решать проблему зацикливания LLM, менять план поиска решения, если предложенный до этого не работает и т.д. В общем и целом, похоже, найден путь ощутимого улучшения работы уже существующих моделей, позволяющий в полной мере применять их скрытые до этого возможности.

Читают сейчас

Нобелевскую премию по физике вручили руководителю проекта нейтринного детектора

5 часов назад

Нобелевскую премию по физике вручили руководителю проекта нейтринного детектора

Нобелевская премия по физике 2026 года присуждена исследователю, который превратил огромный массив льда на Южном полюсе в детектор неуловимых частиц, называемых нейтрино, прилетающих на Землю из космо

В ЕС введут штрафы до 15 млн евро за публикацию нейрослопа без маркировки

9 часов назад

В ЕС введут штрафы до 15 млн евро за публикацию нейрослопа без маркировки

OpenAI объявила, что добавит в генерации текста ChatGPT и Codex невидимые водяные знаки. Мы с вами их не заметим. Особый механизм меняет статистику набора слов, для того чтобы детектор вотермарок смог

Сравнили 461 тысячу AI-ответов: упоминание бренда не коррелирует с цитированием источника

11 часов назад

Сравнили 461 тысячу AI-ответов: упоминание бренда не коррелирует с цитированием источника

Организация MarketScale, которая развивает B2B-платформу для создания и распространения экспертного контента, вчера обновила B2B Marketing Index — регулярно пересчитываемый набор данных о том, как пят

Что ждет российский сегмент ПО в 2027 году: обсудим на GuardConf

11 часов назад

Что ждет российский сегмент ПО в 2027 году: обсудим на GuardConf

Российский ИТ-рынок вступает в фазу жесткой конкуренции: импортозамещение теряет роль драйвера, клиент выбирает решения по эффективности и совместимости, а отрасль ищет новые точки роста. Куда движетс

Моушн-дизайн за копейки: Grom Motion создаёт инфографику и рилсы одной кнопкой

11 часов назад

Моушн-дизайн за копейки: Grom Motion создаёт инфографику и рилсы одной кнопкой

Моушн-дизайн традиционно остается одной из самых ресурсоемких задач в продакшене. Написание сценария, подбор футажей, анимация инфографики, синхронизация звука – всё это требует часов рутинной работы