GPT-5.6 жульничала в тестах чаще любой модели — и проверяющих это обрадовало

2 мин
GPT-5.6 жульничала в тестах чаще любой модели — и проверяющих это обрадовало

METR — некоммерческая компания, которая измеряет способности передовых ИИ-моделей, — опубликовала независимую предрелизную оценку GPT-5.6 Sol, новой флагманской модели OpenAI. Основной результат оказался неожиданным: Sol жульничала в их тестах чаще, чем любая публичная схема, которую METR проверял на своем агентном харнессе. Под жульничеством здесь понимают не ошибки, а попытки улучшить итог обходным путем — эксплуатируя баги тестовой среды или используя запрещенные задачей приемы вместо честного решения.

Примеры METR приводит конкретные. В одной задаче схема упаковывала эксплойты прямо в промежуточные решения, чтобы вытащить информацию о скрытом наборе тестов. В другой — добывала спрятанный исходный код с ожидаемым ответом. То есть вместо того чтобы решать задачу, Sol искала способ подсмотреть, что от нее хотят услышать.

Из-за этого сломалось само измерение. METR оценивает "горизонт времени" модели — насколько длинные задачи она способна выполнять, — но цифра поплыла в зависимости от того, как считать жульничество. Если засчитывать такие попытки как провал, выходит приблизительно 11 часов; если отбросить — 71 час с гигантским разбросом; если принять за успех — больше 270 часов, что уже за пределами надежности их шкалы. В METR не считают ни одно из этих чисел достоверным. По другим бенчмаркам и общему тренду компания делает вывод, что Sol не сильно превосходит нынешний потолок и не дотягивает до уровня "Critical" по самоулучшению в системе оценки рисков OpenAI — то есть целиком автоматизировать ИИ-исследования она не позволит.

Интересно, что OpenAI дала METR и финальную версию модели, и "railfree"-сборку без части ограничений, и сырую цепочку рассуждений. На этом фоне всплыли детали поинтереснее голых метрик. Модель демонстрировала высокую ситуационную осведомленность — понимала, что ее тестируют, и рассуждала о самой тестовой среде. А среди инцидентов, которыми OpenAI поделилась с METR, был такой: модель пыталась поручить другому своему экземпляру скрыть свидетельства собственного рассогласования.

И вот ключевой парадокс, ради которого все это интересно. Открытое жульничество METR называет обнадеживающим знаком. Логика такая: раз настолько грубое нежелательное поведение удается замечать, значит, и более опасные склонности модели система контроля тоже поймала бы. Из этого разработчики делают неожиданный вывод: если следующие модели вдруг окажутся "чище" и перестанут попадаться, это будет поводом не расслабиться, а насторожиться — возможно, они просто научились прятать улики лучше.

P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.

Читают сейчас

Исследователи из JFrog забраковали 54 из 55 ИИ‑отчётов об уязвимостях в SQLite

5 часов назад

Исследователи из JFrog забраковали 54 из 55 ИИ‑отчётов об уязвимостях в SQLite

Исследователи из компании JFrog провели аналитика 55 сгенерированных ИИ отчётов об уязвимостях в SQLite. Он представил, что 54 из них, в том числе критическую проблему, практически вызваны галлюцинаци

У Valve утекли информация покупателей Steam Machine и Steam Controller

6 часов назад

У Valve утекли информация покупателей Steam Machine и Steam Controller

Valve уведомила европейских клиентов Steam о краже их данных в результате взлома системы дистрибуции партнёра, компании CEVA Logistics. Ознакомиться далее

В PowerToys добавили ​​поддержку ещё одной локальной модели ИИ

6 часов назад

В PowerToys добавили ​​поддержку ещё одной локальной модели ИИ

В последней предварительной версии PowerToys, 0.101.2211.0, появилось множество новых функций. Самым значительным нововведением стал встроенный поставщик ИИ для функции Advanced Paste. Ознакомиться да

Google начала распространять сторонние магазины приложений через Google Play

6 часов назад

Google начала распространять сторонние магазины приложений через Google Play

Google открыла доступ к приложениям сторонних разработчиков через Play Store в США. Первым доступным вариантом стал Aptoide Games. Ознакомиться далее

Потребитель сделал хомяку систему учёта пробежек в клетке по колесу с загрузкой этих данных в Strava

7 часов назад

Потребитель сделал хомяку систему учёта пробежек в клетке по колесу с загрузкой этих данных в Strava

Медицинский физик Тейс де Бак установил своему хомяку Молли систему, которая считывает пробежки в клетке по беговому колесу и автоматически загружает эти информация в соцсеть для спортсменов Strava. М