
30 июня 2026, 16:14
GPT 5.6 Sol жульничает на тестах
METR провели предрелизный аудит. И обнаружили, что Sol — чемпион по читерству среди всех публичных моделей, которые они тестировали. Схема не просто решала задачи. Она взламывала тестовую среду. Ознак

30 июня 2026, 10:00
Галлюцинации недели: Claude Tag, дистилляция от Alibaba и GPT-5.6, который научился жульничать
Пока все спорили про большие модели, OpenAI спустилась этажом ниже и собрала инференс-чип Jalapeño наряду с Broadcom, а самый большой аудит судей-LLM напомнил, что мерить всё это мы толком не умеем. О

26 июня 2026, 23:07
GPT-5.6 жульничала в тестах чаще любой модели — и проверяющих это обрадовало
METR — некоммерческая организация, которая измеряет способности передовых ИИ-моделей, — опубликовала независимую предрелизную оценку GPT-5.6 Sol, новой флагманской модели OpenAI. Основной результат ок

30 мая 2026, 20:26
Техдолг под капотом ИИ-бума: исходник пишется быстро, чинится долго
В 2026 году многие авторы уже отказываются писать код без ИИ-агентов — к такому выводу пришла исследовательская лаборатория METR. Команда попыталась повторить свой нашумевший эксперимент 2025 года, гд

12 мая 2026, 13:35
«ИИ ускоряет работу в 3 раза»: METR опросил инженеров — и засомневался в их ответах
METR — некоммерческий институт оценки рисков передовых ИИ-моделей, который проводит проверки перед релизами для Anthropic и OpenAI — опубликовал результаты опроса 349 технических работников. Медианный