Основной критик LLM почти похвалил Claude Mythos. Почти

2 мин
Основной критик LLM почти похвалил Claude Mythos. Почти

Гэри Маркус, один из самых известных критиков современного ИИ, неожиданно мягко прокомментировал свежие результаты Claude Mythos на бенчмарке METR. На последнем замере схема Anthropic показала горизонт автономной работы 16+ часов при 50%-вероятности успеха и 3 часа при 80 процентов — это вдвое больше ближайшего конкурента. Маркус согласился, что прогресс реальный, но добавил, что сам по себе Mythos может и не быть главной причиной успеха.

Бенчмарк, о котором идет речь, разработала организация METR — некоммерческая лаборатория из Беркли, которая оценивает способность ИИ-агентов автономно выполнять долгие задачи. Показатель устроена так: на каждой из 228 задач (программирование, машинное обучение, кибербезопасность) сначала измеряют, сколько на нее тратит человек-эксперт, а потом смотрят, при какой длине задачи модель справляется с заданным процентом успеха. Публикация METR от 8 мая показывает, что с 50%-вероятностью Mythos уперся в потолок самого бенчмарка — задач длиннее 16 часов в наборе всего 5 из 228. Поверх видеокарта METR честно повесила оговорку, что точные цифры за этой отметкой ненадежны. Алекс Альберт из Anthropic параллельно опубликовал альтернативный график, где у Mythos 80%-горизонт — 3 часа, и в этом ракурсе отрыв от ближайшего конкурента выглядит двукратным.

Маркус стартовал с привычной ноты: бенчмарк замеряет лишь 50%-вероятность успеха, а ненадежность остается главной проблемой LLM. Покрытие у METR — только разработка ПО, не совокупный интеллект. Но дальше его аргументация поворачивает в неожиданную сторону. С точки зрения Маркуса, прогресс самой модели на графике виден лишь частично — большая часть прироста идет от агентских обвязок вроде Claude Code и Codex. И это, полагает он, ранние прототипы тех самых нейросимволических систем, о которых Маркус сообщает больше десяти лет: языковая модель плюс внешние инструменты для логики и проверки. Дословно: "это оправдание нейросимвольного подхода — но не доказательство, что сами LLM можно бесконечно масштабировать".

Если Маркус прав, единицей сравнения становится не схема, а связка "модель плюс обвязка". Это означает, что часть текущей дискуссии о прогрессе ИИ ведется не там — пока одни обсуждают параметры и архитектуры, фактический прирост во многом приходит от обертки.

P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.

Читают сейчас

Реддитор пожаловался на исключение купленной трилогии «Властелин колец» из Google Play

7 часов назад

Реддитор пожаловался на исключение купленной трилогии «Властелин колец» из Google Play

Пользователь Reddit под ником ugoindownsaka1 рассказал, что в 2022 году купил трилогию «Властелин колец» (расширенные версии) в Google Play. Он собирался посмотреть эти фильмы сейчас, но они исчезли и

Oracle закрыла приём в публичный инициатива OpenJDK изменений, созданный с помощью ИИ-инструментов

10 часов назад

Oracle закрыла приём в публичный инициатива OpenJDK изменений, созданный с помощью ИИ-инструментов

В компании Oracle объявили о запрете на приём в открытый проект OpenJDK изменений, сгенерированных с помощью ИИ-инструментов. Ограничение касается исходного кода, текстовых материалов и изображений, п

11 часов назад

Потребности о гаджете OpenAI: экранный умный динамик с камерой, сенсорами и движущимися элементами

OpenAI готовит свой первый массовый аппаратный продукт – умную колонку с экраном. Речь идет о портативном устройстве без экрана, которое должно функционировать как голосовой ИИ-помощник и выйти в 2027

Манипуляция агентами: эксплуатация уязвимостей в репозитории Google Agent Development Kit

17 часов назад

Манипуляция агентами: эксплуатация уязвимостей в репозитории Google Agent Development Kit

Исследователи Pillar Security зафиксировали первый случай использования одного ИИ-агента другим в реальном продакшен-окружении. Уникальная на данный момент уязвимость была найдена в google/adk-python

OpenAI замедлила разработку модели Astra

19 часов назад

OpenAI замедлила разработку модели Astra

OpenAI сообщила о приостановке работы над некоторыми аспектами своей будущей модели Astra после того, как внутренняя проверка выявила значительные успехи в программировании агентов и кибербезопасности