Gemini 4 Argon: модель Google для длительных и сложных задач

Google представила Gemini 4 Argon — новую флагманскую модель, рассчитанную на выполнение длинных и сложных задач. Однако на старте она недоступна широкой аудитории: протестировать систему могут специалисты по информационной безопасности, участвующие в программе Fairwind. Через неё Google предоставляет новые модели для проверки безопасности.
Ключевое отличие Argon — увеличенный лимит вывода. Модель способна генерировать до 1 млн токенов за один запрос, тогда как у предыдущей версии этот показатель составлял 64 000 токенов. Такой объём рассчитан на работу с крупными программными проектами, документами и многоэтапными заданиями без постоянного разделения процесса на отдельные запросы.
Большой лимит не означает, что модель мгновенно решает любую задачу целиком. В процессе работы Argon может последовательно анализировать данные, писать и исправлять код, проверять результаты и возвращаться к предыдущим этапам. При этом пользователю не обязательно постоянно вмешиваться в каждый шаг выполнения.
Стоимость и результаты тестов
На старте обработка обойдётся в 2 доллара за 1 млн входных токенов и 10 долларов за 1 млн выходных. Для кэшированных данных Google заявила скидку 95%: в этом случае цена составит 0,10 доллара за 1 млн токенов.
В большинстве приведённых сравнений Argon опережает Claude Opus 5.5 и Claude Fable 5.1 от Anthropic, а также GPT-6 Astra от OpenAI. При этом лидерство не является абсолютным: в FrontierSWE v2 и Terminal-Bench 4.0 модель уступила всем трём конкурентам.
В AutomationBench, проверяющем способность выполнять многоэтапные задачи с использованием нескольких инструментов, Argon получила 51,3%. В тесте долгосрочной программной инженерии DeepSWE v1.1 модель набрала 77,9%, установив новый рекорд. Результат в тесте ALE (Agent’s Last Exam), посвящённом сложным вопросам из разных научных областей, составил 39,5% — немного выше показателя Claude Opus 5.5.
Наиболее заметная разница зафиксирована в Harvey’s Legal Agent Benchmark для юридических задач: 19,6% у Argon против 6,7% у Claude Fable 5.1. Впрочем, результаты бенчмарков отражают поведение модели в конкретных сценариях и не заменяют независимую проверку в реальной работе.
Практические примеры применения
Google приводит несколько примеров использования Argon в собственных проектах. В одном из них несколько агентов проанализировали работу оборудования в центрах обработки данных, нашли неэффективные процессы и предложили варианты оптимизации. После проверки рекомендаций специалистам удалось освободить более 300 ТБ памяти. По оценке компании, общий эффект от оптимизации может составить от 500 ТБ до 1 ПБ.
Другой пример связан с открытым видеодекодером libgav1. С помощью Argon специалисты переработали версию проекта на Rust, заменили около 32 000 строк SIMD-кода и провели эксперименты с профилированием. В результате, по данным Google, получился более безопасный для памяти видеодекодер, который работает в 2,7 раза быстрее прежней версии при идентичном видеовыходе. Новый код также автоматически векторизируется компилятором.
Таким образом, Gemini 4 Argon ориентирована прежде всего на длительное выполнение сложных задач, а не на быстрые ответы в обычном диалоге. Большой лимит вывода открывает возможности для работы с крупными кодовыми базами, технической документацией и агентными сценариями, но одновременно повышает потенциальные расходы на обработку запросов.
Пока оценивать модель приходится по опубликованным тестам и примерам Google. Полноценные выводы можно будет сделать после более широкого релиза и независимых проверок. Тогда станет понятнее, насколько заявленные преимущества сохраняются за пределами демонстрационных сценариев и насколько практичной окажется Argon для разработки, анализа данных и юридических задач.


