17 марта 2026, 16:10
Mistral AI показала Leanstral: кодинг, который можно не проверять

Французская Mistral AI представила Leanstral – открытого ИИ-агента, который не просто генерирует, а ещё и формально доказывает корректность своих же творений. Это помощник, который работает в связке с инструментом формального доказательства Lean 4. Его проблема – помогать в “инженерии доказательств”, то есть строго проверять математические выкладки и программные спецификации.
В Mistral рассудили здраво: зачем нам просто “умная” нейросеть? Будущее – за агентами, которые умеют не только выполнять задачи, но и расписываться за каждую строчку, строго следуя спецификациям. Leanstral стал первым крупным шагом в этом направлении.
Leanstral построен на архитектуре состава экспертов (MoE), которую оптимизировали специально для задач доказательства. Секрет в том, что схема использует лишь часть своих параметров (активных – около 6 миллиардов), выбирая нужные экспертные модули для конкретной задачи. Это позволяет ей быть одновременно производительной и экономичной. За счёт тому что Lean выступает в роли идеального верификатора, Leanstral может параллельно генерировать и проверять кучу вариантов решений.
Авторы уже сравнили своего новичка с другими моделями. Для теста использовали бенчмарк FLTEval, который оценивает завершение формальных доказательств и корректное определение новых математических концепций.

Как видно на графике, даже самый мощный из открытых соперников, Qwen3.5 (397B-A17B), добрался до отметки 25,4 за 4 попытки. Leanstral же (притом что у него всего 120B параметров с учётом всех экспертов и 6B активных) за 2 попытки выдаёт 26,3, а за 4 попытки и вовсе улетает к 29,3.
Но самое интересное – это сравнение с коллегами из семейства Claude. Leanstral оказался не просто конкурентоспособным, а невероятно экономичным. Claude Sonnet 4.6 стоит 549 $ и выдаёт скромные 23,7 балла. Leanstral за 36 $ (pass@2) набирает 26,3 балла, обгоняя его почти на 3 пункта и одновременно оказываясь в 15 раз дешевле. Но Claude Opus 4.6 с его 39,6 балла всё ещё впереди.
Подробности на официальном сайте Mistral AI и в документации.
Читают сейчас

1 час назад
Агенту поручили починить программа, а он изменил собственную схема
Исследователи Irregular поручили кодинг-агенту на базе Qwen3.5-27B задачу по исправлению приложения, которое неправильно обрабатывало запросы. Агент нашёл обучающие примеры и инструменты для fine-tuni

1 час назад
Claude Code сам делит инициатива между AI-агентами
Anthropic целиком переделала Projects в Claude Code. Теперь это не папка с чатами, а единый центр управления разработкой. Описываем какую-нибудь большую и грандиозную цель. В частности, хотим ускорить

2 часа назад
GPT-6 Astra помогла прочести зашифрованную Enigma немецкую радиограмму 1941 года — над ней бились 21 год
Сотрудник Bloomberg Картер Леффен с помощью GPT-6 Astra расшифровал немецкую военную радиограмму MVUEH от 10 июля 1941 года. Сообщение состояло всего из 82 зашифрованных символов и находилось в коллек
5 часов назад
GPT-5.5 отключат 14 октября
OpenAI объявила о выводе GPT-5.5 из ChatGPT, ChatGPT Work и Codex. Модель перестанет быть доступна 14 октября 2026 года — это касается всех тарифов, в том числе потребительские планы, Business, Enterp

8 часов назад
Игра «Миссия Луна»: построить лунную базу и решить, что создавать, когда всё идёт не по плану
В России начали разрабатывать компьютерную игру о жизни на Луне. «Миссия Луна» — многопользовательская кооперативная игра, где экипаж строит и обслуживает постоянную лунную колонию. Анонсируют проект