Mistral представила мультимодальную Large 4 на 1,05 трлн параметров

Французская Mistral AI представила публичную preview-версию мультимодальной модели Mistral Large 4. В компании используют для неё прозвище Le Chonk — «пухляш». Модель уже доступна через API, а публикация открытых весов запланирована на конец октября.
В анонсе размер Large 4 округлён до 1 трлн параметров, однако документация раскрывает более точные характеристики. Модель построена на архитектуре Mixture-of-Experts: всего в ней 1,05 трлн параметров, из которых при обработке запроса активируются 49 млрд. Контекстное окно рассчитано на 1 млн токенов, а визуальный энкодер содержит 1,6 млрд параметров.
Предыдущая флагманская модель Mistral Large 3 вышла 2 декабря 2025 года. Она включала 675 млрд параметров, из которых активными были 41 млрд. За время между релизами компания также представила Small 4 и Medium 3.5 — модели, ориентированные, среди прочего, на программирование и работу с ИИ-агентами.
Результаты в программировании
В тесте DeepSWE v1.1 Large 4 набрала 61,7%. По данным опубликованного сравнения, модель обошла DeepSeek V4 Pro 0813 и Qwen3.8 Max, но уступила Kimi K3. В тесте SWE-Atlas-QnA, который проверяет понимание структуры и содержимого программных репозиториев, результат составил 59,4%.
На Terminal-Bench 4.0 преимущество Large 4 над некоторыми конкурентами оказалось более заметным: результат примерно вдвое выше показателей DeepSeek и Kimi. При этом до GLM-5.3 модель не дотянула 13,6 процентного пункта. Mistral уточняет, что тестирование DeepSWE v1.1, Terminal-Bench 4.0 и SWE-Atlas-QnA проводила Artificial Analysis в закрытом режиме до публичного запуска тестовой среды. Позднее результаты должны появиться в Coding Agent Index.
В слепой оценке качества кода от Surge AI Large 4 заняла второе место среди пяти моделей. Профессиональные оценщики поставили ей 3,74 балла из пяти — выше, чем GLM-5.3 и Kimi K3, но ниже Claude Opus 5, получившей 4,22 балла. Участники оценки не знали, какие именно модели сравнивают.
Кибербезопасность и условия доступа
В тесте CyberGym-E2E Large 4 набрала 82% и заняла первое место в опубликованной таблице. Задание предполагает воспроизведение реальной уязвимости в открытом программном обеспечении и последующее исправление проблемы. Ближайший результат показала MiMo-V2.6-Pro с 79%, а Grok 4.7 и GLM-5.3-Flash набрали по 74%.
Первое место относится именно к CyberGym-E2E. В сводном Artificial Analysis Cyber Index модель вошла в первую пятёрку. Mistral отдельно отмечает, что некоторые закрытые модели получают низкие результаты в CyberGym-E2E из-за отказов выполнять задания. Поэтому тест отражает не только практические способности моделей в области безопасности, но и ограничения, заданные их разработчиками.
В API модель доступна под идентификатором mistral-large-4. Она поддерживает работу с изображениями, вызов функций и структурированные ответы. На момент анонса стандартные запросы стоили $0,68 за 1 млн входных токенов и $2,09 за 1 млн выходных. Обработка кэшированного входа оценивалась в $0,07 за 1 млн токенов. В карточке модели эти значения указаны как скидка 50% от базовых тарифов в $1,36, $4,18 и $0,14 соответственно.
Large 4 обучали с нуля на 3800 ускорителях NVIDIA Grace Blackwell в собственных европейских дата-центрах Mistral. Preview-версия работает на той же инфраструктуре. В обучающих данных представлены более 160 языков.
До публикации весов Mistral продолжит обучение с подкреплением и проверку модели совместно с партнёрами по кибербезопасности. Вместе с весами компания обещает раскрыть дополнительные сведения об архитектуре, результаты тестов и методику постобучения. Таким образом, приведённые сейчас показатели относятся именно к предварительной версии Large 4 и могут измениться до финального релиза.


