Mistral выпустила 119B модель для формальной верификации — и та сразу нашла баги в реальном коде
Mistral выпустила Leanstral 1.5 — открытую 119B модель для формальной верификации. 100% на miniF2F, 587/672 на PutnamBench и пять новых багов в реальных репозиториях.

Mistral AI открыла исходный код Leanstral 1.5 — специализированной модели для формальной верификации на языке Lean 4. Модель не просто насытила стандартные математические бенчмарки, но и обнаружила пять ранее неизвестных багов при сканировании 57 открытых репозиториев. Лицензия Apache 2.0 — значит, можно брать и использовать без ограничений.
Что умеет модель и какие числа за этим стоят
Leanstral 1.5 весит 119 миллиардов параметров и заточена под одну задачу: писать и проверять формальные доказательства на Lean 4 (язык, где математические утверждения и программный код верифицируются компьютером с математической строгостью).
На бенчмарке miniF2F, который проверяет решение олимпиадных задач по математике, модель набрала 100% — то есть фактически насытила его. На PutnamBench — наборе задач из Путнамской математической олимпиады для студентов, одного из самых сложных соревнований в США — Leanstral 1.5 решила 587 из 672 задач. Для сравнения: это задачи уровня, с которым справляются единицы людей. Модель также показала высокие результаты на FATE-H и FATE-X — бенчмарках, ориентированных на формальное доказательство теорем.
Почему формальная верификация — это не просто математика
Формальная верификация долго оставалась уделом академических исследователей и узкого круга инженеров в аэрокосмической или финансовой отрасли. Инструменты вроде Lean 4, Coq или Isabelle позволяют доказать, что программа или алгоритм работает именно так, как задумано — не «скорее всего», а математически гарантированно.
Проблема в том, что писать формальные доказательства вручную — мучительно долго. Даже опытный специалист тратит часы на то, чтобы верифицировать несколько строк кода. Именно здесь появляется смысл в языковой модели: если она умеет генерировать корректные доказательства на Lean 4, скорость верификации вырастает на порядки.
До Leanstral 1.5 в этой нише работали преимущественно закрытые или узкоспециализированные решения. Mistral делает ставку на открытость: модель доступна всем, кто хочет встроить формальную верификацию в свой пайплайн.
Пять багов — это не демонстрация, это результат
Самое интересное в релизе — не бенчмарки, а практический эксперимент. Команда Mistral прогнала Leanstral 1.5 по 57 открытым репозиториям и получила пять ранее неизвестных багов.
Это принципиально важный момент. Большинство AI-инструментов для кода демонстрируют возможности на синтетических тестах или на задачах, где ответ заранее известен. Здесь модель работала с реальным кодом и нашла реальные проблемы, которые до неё никто не замечал. Сколько именно репозиториев содержали баги и какова их критичность — Mistral пока не раскрывает, но сам факт говорит о том, что инструмент работает за пределами лабораторных условий.
Что это значит для разработчиков прямо сейчас
Для большинства команд формальная верификация всего кодовой базы остаётся нереалистичной — слишком дорого по времени. Но Leanstral 1.5 открывает несколько практических сценариев.
Первый — верификация критических модулей: криптографических примитивов, парсеров, финансовых расчётов. Там, где баг стоит дорого, математическая гарантия корректности оправдывает затраты. Второй — автоматизированный аудит библиотек перед включением в зависимости. Третий — образовательный: модель может помочь командам, которые хотят начать использовать Lean 4, но не знают, с чего начать.
Лицензия Apache 2.0 снимает юридические барьеры для коммерческого использования, что особенно важно для европейских компаний, которые осторожно относятся к проприетарным AI-инструментам.
Где пока есть ограничения
119 миллиардов параметров — это серьёзные требования к железу. Запустить модель локально смогут только команды с доступом к нескольким A100 или H100. Для большинства это означает либо облако, либо ожидание квантизированных версий от сообщества.
Кроме того, Lean 4 — не самый распространённый язык. Экосистема растёт, но большинство разработчиков никогда с ним не работали. Модель не снижает порог входа в саму верификацию — она ускоряет тех, кто уже умеет в Lean.
Наконец, пять багов в 57 репозиториях — хороший результат, но пока недостаточно данных, чтобы судить о покрытии и типах ошибок, которые модель способна находить системно.
Куда это движется
Mistral последовательно строит экосистему открытых специализированных моделей — и Leanstral 1.5 вписывается в эту логику. Формальная верификация с AI-ускорением — одна из немногих областей, где языковые модели дают не вероятностный, а проверяемый результат. Если сообщество подхватит инструмент и начнёт верифицировать популярные библиотеки, это может изменить стандарты качества кода быстрее, чем кажется.
Источники
Читайте также
Комментарии
Пока никто не написал. Будьте первым.

