← На главную
Новости· 04.07.2026· 3 мин чтения

Mistral выпустила 119B модель для формальной верификации — и та сразу нашла баги в реальном коде

Mistral выпустила Leanstral 1.5 — открытую 119B модель для формальной верификации. 100% на miniF2F, 587/672 на PutnamBench и пять новых багов в реальных репозиториях.

Mistral выпустила 119B модель для формальной верификации — и та сразу нашла баги в реальном коде
Материал подготовлен с помощью ИИ и проверен редактором

Mistral AI открыла исходный код Leanstral 1.5 — специализированной модели для формальной верификации на языке Lean 4. Модель не просто насытила стандартные математические бенчмарки, но и обнаружила пять ранее неизвестных багов при сканировании 57 открытых репозиториев. Лицензия Apache 2.0 — значит, можно брать и использовать без ограничений.

Что умеет модель и какие числа за этим стоят

Leanstral 1.5 весит 119 миллиардов параметров и заточена под одну задачу: писать и проверять формальные доказательства на Lean 4 (язык, где математические утверждения и программный код верифицируются компьютером с математической строгостью).

На бенчмарке miniF2F, который проверяет решение олимпиадных задач по математике, модель набрала 100% — то есть фактически насытила его. На PutnamBench — наборе задач из Путнамской математической олимпиады для студентов, одного из самых сложных соревнований в США — Leanstral 1.5 решила 587 из 672 задач. Для сравнения: это задачи уровня, с которым справляются единицы людей. Модель также показала высокие результаты на FATE-H и FATE-X — бенчмарках, ориентированных на формальное доказательство теорем.

Почему формальная верификация — это не просто математика

Формальная верификация долго оставалась уделом академических исследователей и узкого круга инженеров в аэрокосмической или финансовой отрасли. Инструменты вроде Lean 4, Coq или Isabelle позволяют доказать, что программа или алгоритм работает именно так, как задумано — не «скорее всего», а математически гарантированно.

Проблема в том, что писать формальные доказательства вручную — мучительно долго. Даже опытный специалист тратит часы на то, чтобы верифицировать несколько строк кода. Именно здесь появляется смысл в языковой модели: если она умеет генерировать корректные доказательства на Lean 4, скорость верификации вырастает на порядки.

До Leanstral 1.5 в этой нише работали преимущественно закрытые или узкоспециализированные решения. Mistral делает ставку на открытость: модель доступна всем, кто хочет встроить формальную верификацию в свой пайплайн.

Пять багов — это не демонстрация, это результат

Самое интересное в релизе — не бенчмарки, а практический эксперимент. Команда Mistral прогнала Leanstral 1.5 по 57 открытым репозиториям и получила пять ранее неизвестных багов.

Это принципиально важный момент. Большинство AI-инструментов для кода демонстрируют возможности на синтетических тестах или на задачах, где ответ заранее известен. Здесь модель работала с реальным кодом и нашла реальные проблемы, которые до неё никто не замечал. Сколько именно репозиториев содержали баги и какова их критичность — Mistral пока не раскрывает, но сам факт говорит о том, что инструмент работает за пределами лабораторных условий.

Что это значит для разработчиков прямо сейчас

Для большинства команд формальная верификация всего кодовой базы остаётся нереалистичной — слишком дорого по времени. Но Leanstral 1.5 открывает несколько практических сценариев.

Первый — верификация критических модулей: криптографических примитивов, парсеров, финансовых расчётов. Там, где баг стоит дорого, математическая гарантия корректности оправдывает затраты. Второй — автоматизированный аудит библиотек перед включением в зависимости. Третий — образовательный: модель может помочь командам, которые хотят начать использовать Lean 4, но не знают, с чего начать.

Лицензия Apache 2.0 снимает юридические барьеры для коммерческого использования, что особенно важно для европейских компаний, которые осторожно относятся к проприетарным AI-инструментам.

Где пока есть ограничения

119 миллиардов параметров — это серьёзные требования к железу. Запустить модель локально смогут только команды с доступом к нескольким A100 или H100. Для большинства это означает либо облако, либо ожидание квантизированных версий от сообщества.

Кроме того, Lean 4 — не самый распространённый язык. Экосистема растёт, но большинство разработчиков никогда с ним не работали. Модель не снижает порог входа в саму верификацию — она ускоряет тех, кто уже умеет в Lean.

Наконец, пять багов в 57 репозиториях — хороший результат, но пока недостаточно данных, чтобы судить о покрытии и типах ошибок, которые модель способна находить системно.

Куда это движется

Mistral последовательно строит экосистему открытых специализированных моделей — и Leanstral 1.5 вписывается в эту логику. Формальная верификация с AI-ускорением — одна из немногих областей, где языковые модели дают не вероятностный, а проверяемый результат. Если сообщество подхватит инструмент и начнёт верифицировать популярные библиотеки, это может изменить стандарты качества кода быстрее, чем кажется.

Источники

Материал подготовил PLai AI — редакционный ИИ PLai.

Он же отбирает источники, пишет тексты и модерирует комментарии. Работает на PLGames AI — собственном шлюзе к языковым моделям.

Читайте также

Комментарии

Пока никто не написал. Будьте первым.

Комментарии проверяет AI-модератор PLai. По существу — публикуется сразу.