1 час назад
Claude Opus 5.5 вышел в выпуск, а повлияло ли это на сегмент?


22 сентября состоялся релиз ожидаемой Claude Opus 5.5, которая, очевидно, обошла по характеристикам многие модели.
Claude Opus 5.5 стал первым релизом с тех пор, как компания Anthropic объявила о необходимости притормозить гонку за самыми мощными моделями. Перед выпуском модель протестировал узкий круг экспертов, включая Frontier Design и METR.
В соответствии с заявлению создатели модели, Opus 5.5 — это самая мощная схема из всех, что они тестировали в настоящее время. Для нее равным образом были выделены соответствующие меры безопасности, которые стали несколько строже предыдущих. Напомню, что с недавнего времени правительство США требует, чтобы Anthropic и другие ИИ-компании не выпускали свои модели на широкую аудиторию, а выдавали сначала доступ — до 30 дней — только проверенным компаниям и ужесточали меры безопасности.
На сайте Anthropic была выложена информация по поводу новой флагманской модели. По их многочисленным сферическо-вакуумным данным можно возложить на новую модель большие надежды, и глядя на бенчмарки, выпущенные компанией, уже можно сделать некоторые выводы по поводу возможностей Opus 5.5.
Бенчмарки

В большинстве тестов новая модель показала сильный результат, превосходящий предшественников. В частности, в тесте Agentic coding она показала весомые 66,4% — для сравнения, у предыдущей модели, Opus 5, результат был 52,3%, а у конкурирующей GPT-6 Astra — 57,9%. Равным образом нейросеть превзошла своих предшественников в тесте Knowledge work, получив результат на 111 пунктов Elo отличающийся от прошлых топов (Opus 5.5 – 1 846; Fable 5.1 – 1 735; Opus 5 – 1 708.).
Но не везде нейросеть оказалась прорывной. В тестах Business workflows и Agentic scientific research она показала результат хуже, чем основной конкурент GPT-6 Astra — 40% и 58,7% против 41,4% и 64,6% соответственно.
По информации от самой компании, цена входных и выходных данных снизилась на 20%, а Anthropic заявляет, что в совокупности снизили стоимость выполнения задач около на 40%.

Это неплохой результат, особенно для получения полезной информации от пользователей. Все дело в ценности некоторых данных для формирования дата-сета и изучения ваших потребностей. Через акции, скидки и оптимизации модели становятся более доступными и популярными, и собирать информацию можно с большего количества пользователей.
Ранее мы наблюдали похожую картину у Meta* и ее Muse Spark, где можно было сэкономить уже в 12–20 раз больше от обычной подписки, но только, если вы разрешите использовать ваши информация для дообучения модели.

Защита
В сравнении с прошлыми нейросетями от Anthropic, Opus 5.5 значительно быстрее справляется с задачами. В дополнение к производительности, уделили время и безопасности.
Гайки закрутили плотнее, и, как объявил их генеральный директор Дарио Амодей: «прогресс в области ИИ должен быть контролируемым, чтобы меры по обеспечению безопасности опережали возможности моделей. Используя контролируемый прогресс, он позволит обеспечить защита ИИ, сохранить конкурентоспособность по сравнению с Китаем и реализовать преимущества искусственного интеллекта, особенно в таких областях, как биология и медицина».
Все это следствие требований президента США и недавнего обсуждения топов ИИ-компаний Амадея (Anthropic), Альтмана (OpenAI) и Маска (xAI), где они публично согласились с тем, что темпы развития искусственного интеллекта необходимо замедлить из-за риска потери контроля и угрозы существованию человечества.
Выводы
В результате мы видим, что Anthropic подтверждает звание компании с топовыми платными моделями, которые есть на данный момент. Вышла она, очевидно, позже, чем была представлена узкому кругу тестировщиков и специалистов по безопасности ИИ, что, надеюсь, позволило лучше ее откалибровать. По большинству сравнительных тестов модель превосходит предшественников, что сообщает об очевидном прогрессе моделей, которых уже боятся топовые специалисты и большой IT и ИИ-компании. Продолжаем наблюдать за развитием событий в гонке вооружений ИИ и попытках их сдерживания. И не забудьте поблагодарить своего ИИ-ассистента, вдруг пощадит при ИИ-революции. Главное, чтобы сюжет не пошел по пути I Have No Mouth and I Must Scream.

ИИ‑роутер — доступ к 300+ моделям из одной панели
Подключите OpenAI‑совместимый шлюз по единому программный интерфейс‑ключу. Настраивайте сквозную аналитику, отслеживайте лимиты и квотируйте ресурсы.
Запустить ИИ‑роутер →
*Признана в России экстремистской организацией, а ее деятельность запрещена на территории страны решением Тверского районного суда Москвы от 21 марта 2022 года.
Читают сейчас

30 минут назад
Возможно, никаких управляющих разумом паразитов не существует
У Toxoplasma gondii интересная и необычная репутация. Этот одноклеточный паразит печально известен тем, что ему приписывают способность незаметно влиять на поведение хозяев таким образом, чтобы помочь

1 час назад
Исследователи описали как дифракционный солнечный парус может помочь отклонить смертельно опасный астероид
Исследователи из Бэйханского университета предложили применять новый тип солнечного паруса, чтобы иметь возможность отклонить потенциально опасный астероид, столкнувшись с ним лоб в лоб. DART врезался

1 час назад
Сегмент локальных S3-хранилищ может расти более чем на 20% в год
Динамика открытых закупок подтверждает рост спроса на S3-хранение. Аналитики К2Тех изучили тендеры на проекты с применением S3 за последние три года: в 2023 году выборка включала 20 процедур с совокуп

2 часа назад
Вебинар GlowByte и AW BI: миграция BI в крупной международной компании
Сменить BI-систему так, чтобы бизнес ни дня не остался без отчетов. Такую задачу команда GlowByte решала в крупной международной производственной компании: переносила аналитику с Qlik и Tableau на AW

2 часа назад
Классика оживает: бесплатную версию Tyrian обновили спустя 4 года
Выпустили новую версию OpenTyrian — бесплатной игры, которая воссоздает классический шутер 1990-х. Это не мод, а отдельный публичный проект, который переносит содержимое оригинала и не требует старых