10 июля 2026, 11:42
Meta* выпустила Muse Spark 1.1 — агентную схема, которая обходит Opus 4.8 и GPT-5.5
Спустя три месяца после первой Muse Spark, которую глава Superintelligence Labs Александр Ванг сам называл «закуской», Meta* наконец подала «горячее». В тот же день, когда вышли релизы от OpenAI, сост

8 июля 2026, 20:26
«Мхм», «ага»: свежий голосовой ChatGPT ведет себя как живой собеседник
OpenAI представила GPT-Live — новое поколение голосовых моделей, которое с 8 июля становится основой голосового режима ChatGPT. Ключевое отличие — full-duplex архитектура: модель слушает и говорит одн

7 июля 2026, 09:15
Открытая GLM-5.2 почти догнала фронтир: новые отраслевые индексы Artificial Analysis
Artificial Analysis запустила шесть отраслевых индексов, которые сравнивают ИИ-модели не по абстрактным тестам, а по задачам конкретных профессий: финансы и бухгалтерия (Finance & Accounting), юриспру

5 июля 2026, 13:00
Соавтор Django рассказал, как Claude Fable 5 подготовил выпуск sqlite-utils за $149
Саймон Уиллисон, соавтор Django и создатель Datasette, выпустил sqlite-utils 4.0rc2 — следующий релиз-кандидат своей популярной библиотеки для работы с SQLite. Большую часть работы над релизом выполни

3 июля 2026, 13:12
Ставка Цукерберга на Claude Code не сыграла. Но глава Meta* Superintelligence уже обещает схема, догнавшую GPT-5.5
Марк Цукерберг заявил на внутреннем таунхолле в четверг, что развитие ИИ-агентов за последние четыре месяца "не ускорилось так, как ожидали в Meta*" (компания признана экстремистской и запрещена в Рос

1 июля 2026, 22:25
Fable 5 уже может заменить фрилансеров на 16% реальных заказов — увеличение в 6 раз за 8 месяцев
Center for AI Safety (CAIS) и Scale Labs обновили результаты Remote Labor Index (RLI) — бенчмарка, который проверяет ИИ-агентов не на синтетических тестах, а на настоящих фриланс-заказах: 3D и CAD, ар

1 июля 2026, 10:45
От 5% до 28,7%: GeneBench-Pro представил, как быстро ИИ учится мыслить как учёный
OpenAI выпустила GeneBench-Pro — бенчмарк, который проверяет не способность ИИ-агента запускать готовые пайплайны, а его исследовательское чутье: умение решить, отражает ли паттерн в данных биологию и

19 июня 2026, 13:26
Fable 5 стала первой в бенчмарке по кодингу DeepSWE. Всего на 3% лучше GPT-5.5 за вдвое большую цену
Модель Claude Fable 5 от Anthropic возглавила обновленный лидерборд DeepSWE — бенчмарка по кодингу от стартапа Datacurve. На самых сложных, "длинных" инженерных задачах она набрала 70% pass@1 и формал

19 июня 2026, 11:49
Человечество в безопасности: OpenAI рассказала, как развивает в ИИ добрые качества
OpenAI опубликовала исследование о том, как привить большим языковым моделям полезные черты — и сделать это так, чтобы они не скатились в подхалимство при даже небольшом давлении. Интересно, что метод