1 час назад
Gemini 4 Argon. Очередной победитель гонки нейросетей. А протестировать дадут?


Пока не дадут. Вышла Gemini 4 Argon, новая флагманская схема, где ставка сделана на выполнение длинных и сложных задач. Доступна она не для всех пользователей, а только для специалистов по информационной безопасности в контексте программы Fairwind, через которую Google представляет новые модели для проверки безопасности.
Главная особенность Argon — увеличенный лимит вывода. Схема может выдавать до 1 млн токенов за запрос, тогда как предыдущая версия смогла выдавать только до 64 000 токенов. Это даёт возможность модели дольше функционировать над большой задачей и выдавать очень развернутый ответ без необходимости разбиения работы на множество запросов. Стоит оговориться — даже тут слона едят по кусочкам. Argon продолжит анализировать информация, писать и исправлять свой код, проверять результат, но без постоянного дерганья пользователя.
На старте модель будет стоить 2 $ за миллион входных токенов и 10 $ за миллион выходных. Для кэшированных данных Google сделает вам скидку в размере 95%, и обработка обойдется уже в 0,10 $ за миллион токенов.
Бенчмарки
Бенчмарки как обычно на высоте. В большинстве тестов Argon обгоняет недавно вышедшие Claude Opus 5.5 и Claude Fable 5.1 от Anthropic и GPT-6 Astra от OpenAI. Исключения тоже есть, в FrontierSWE v2 и Terminal-Bench 4.0 она уступает всем трем.
AutomationBench – 51,3%, довольно высокий метрика по сравнению с остальными. Проверка оценивает способность выполнять многоэтапные задачи, где используются несколько инструментов. В тесте DeepSWE v1.1, который оценивает действия ИИ в долгосрочной программной инженерии, Argon набрала 77,9% и установила свежий рекорд. В ALE (Agent’s Last Exam), который проверяет способность модели решать сложные задачи из разных областей науки показал 39,5%, что немного выше Claude Opus 5.5.
Самый крупный разрыв с остальными моделями получился в тесте Harvey’s Legal Agent Benchmark, который оценивает выполнение задач в юридической сфере. 19,6% против 6,7 процентов у Claude Fable 5.1. Так что скоро модели смогут не только править нам исходник или перечитывать новости за день, но и представлять людей в суде.

Для чего полезна эта модель
Argon предназначена для многошаговых проектов по программированию и анализу данных. На мой взгляд, самый показательный пример оптимизации помог Google освободить в достаточной степение количество памяти в своих ЦОДах. Некоторое количество агентов проанализировали данные о работе оборудования, нашли неэффективные моменты и предложили их устранить. После анализа предложенных исправлений специалистам удалось освободить более 300 ТБ памяти, а оценочный общий объем экономии от оптимизации составит от 500 ТБ до 1 ПБ.
Яркий пример работы с кодом у Google тоже есть. Декодер видео с открытым исходным кодом libgav1 переработали с помощью Argon. Проанализировав существующую версию на Rust, агенты заменили 32 000 строк SIMD-кода и провели эксперименты с профилированием. В итоге получили безопасный для памяти видеодекодер на Rust, работающий в 2,7 раза быстрее предыдущей версии при идентичном видеовыходе. Компилятор одновременно автоматически векторизирует свежий код.
В результате мы на живом примере можем увидеть реальную пользу модели, а не прогнанные бенчмарки в идеальной среде.
Выводы
Gemini 4 Argon создана для игры вдолгую — она отлично справляется с длительным выполнением сложных задач. Большой объем контекста не только потратит больше денег за раз, но и даст возможность для работы с большими программными и документальными проектами. Пока мы увидели бенчмарки и интересные истории от Google, как сильна, эффективна и оптимизирована схема, как она справляется с самыми сложными задачами лучше конкурентов, но пока она не релизнется – все это будут лишь слова.
Когда Argon выйдет в свет для всех желающих, обязательно проверьте ее в юридическом вопросе — не зря же она лучшая схема в этом бенчмарке.

ИИ‑роутер — доступ к 300+ моделям из одной панели
Подключите OpenAI‑совместимый шлюз по единому программный интерфейс‑ключу. Настраивайте сквозную аналитику, отслеживайте лимиты и квотируйте ресурсы.
Запустить ИИ‑роутер →
Читают сейчас

31 минуту назад
DeepSeek выпустили свой десктопный заказчик
DeepSeek представили preview версию своего Harness с десктопным приложением для работы с кодом, документами и данными. На сайте доступны сборки под macOS и Windows. В выпуск равным образом вошли менед

41 минуту назад
Регулятор США стартовал расследование рисков ИИ‑инструментов для потребителей и общественной безопасности
Федеральная торговая комиссия США (FTC) начала расследование в отношении OpenAI, Anthropic и других компаний в сфере искусственного интеллекта из‑за рисков, которые могут представлять нейросетевые про

48 минут назад
Гуманоидные роботы спасут производителей полупроводников от схлопывания пузыря ИИ
Американский чипмейкер Micron, входящий в тройку мировых лидеров по производству полупроводниковой памяти, опубликовал финансовые результаты, превзошедшие прогнозы аналитиков. Квартальная выручка комп
52 минуты назад
Операторам роботакси в США грозят штрафы за блокирование работы экстренных служб
Согласно новому закону Калифорнии, компании‑разработчики технологий для беспилотных транспортных средств, такие как Tesla, Waymo и Zoox, будут обязаны обеспечивать оперативную поддержку на месте проис

54 минуты назад
Доходы от техсбора на гаджеты в 2027 году оценили в 11,7 млрд рублей
В 2027 году правительство планирует привлечь в бюджет 11,7 млрд рублей от технологического сбора на гаджеты. Это следует из пояснительной записки к проекту федерального бюджета на 2027 год и плановый