Главные события недели в ИИ: Gemini 4 Argon, DevDay и Sonnet 5.5

Прошедшая неделя оказалась насыщенной релизами в области искусственного интеллекта. Google представила Gemini 4 Argon, OpenAI провела DevDay и расширила экосистему ChatGPT, а Anthropic выпустила Claude Sonnet 5.5. Параллельно появились новые инструменты для агентских приложений, API принятия решений и открытые модели с поддержкой работы через код.
Gemini 4 Argon: длинное рассуждение за меньшие деньги
Gemini 4 Argon пока доступна только выбранным участникам программы киберзащиты Fairwind. Позднее модель обещают открыть разработчикам, компаниям и обычным пользователям — сначала через платный API и подписку Google AI Ultra. Стартовая цена API составляет $2 за миллион входных и $10 за миллион выходных токенов. После завершения демонстрационного периода тариф должен вырасти до $4 и $20 соответственно, однако дату окончания скидки Google не назвала.
Лимит ответа Argon увеличили с 64 тысяч до миллиона токенов. Размер контекста также составляет миллион токенов, а длинное рассуждение можно приостанавливать и продолжать следующим запросом. В тестах Artificial Analysis модель набрала 53 балла при высоком уровне reasoning effort — столько же, сколько GPT-6 Astra на максимальном усилии. При этом средняя задача для Argon обходилась в $1,99 против $3,26 у Astra. После повышения цены расчётная стоимость вырастет примерно до $3,98.
Разница объясняется не только ценой токена. Argon в среднем генерировала около 62 тысяч выходных токенов на задачу, тогда как Astra — примерно 27 тысяч. Иными словами, более низкий тариф позволяет модели дольше рассуждать, но не делает сам процесс рассуждения короче. Google также рассказала о практических применениях Argon: агенты компании помогли высвободить более 300 TiB памяти в дата-центрах, а в видеодекодере libgav1 переписали 32 тысячи строк SIMD-кода на безопасный Rust. Новый вариант оказался в 2,7 раза быстрее прежнего Rust-порта, хотя до оптимизированной версии на C++ ещё не дотягивает.
Pi 1.0 и надёжные агентские процессы
Стабильный релиз Pi 1.0 получил Codemode, нативную поддержку MCP и отложенную загрузку инструментов. Теперь описания всех доступных инструментов не обязательно передавать модели при каждом запросе. В проекте также появилась поддержка прогрева кэша Anthropic и системных сообщений, которые можно добавлять во время разговора. При этом Pi сохраняет небольшой базовый набор возможностей, а дополнительные функции предлагается подключать расширениями.
Для приложений, которым требуется переживать перезапуски и сбои, выпустили экспериментальный пакет Pi Durable. Он сохраняет состояние выполнения на каждом шаге и умеет различать незавершённый запрос к модели и незавершённый вызов инструмента. Запрос к модели можно отправить повторно, а инструмент повторяется только при безопасном воспроизведении. Такой подход важен, например, если агент успел отправить письмо, но приложение не получило подтверждение: простого восстановления истории в этом случае недостаточно.
OpenAI DevDay: ChatGPT превращается в рабочую среду
На DevDay OpenAI представила более двадцати обновлений. Компания развивает ChatGPT в сторону постоянного рабочего пространства с моделями, фоновыми агентами, общими документами и инструментами для разработчиков. GPT-6.1 Sol заменила GPT-6 Sol всего через семь дней после релиза. Цена осталась на уровне $2 за миллион входных и $10 за миллион выходных токенов, а чтение кэша подешевело с $0,20 до $0,10. Модель доступна через API, Codex и ChatGPT Work, но на старте не появилась в обычном Chat.
В тестах Artificial Analysis Sol на максимальном усилии отстала от Astra всего на один балл, зато средняя задача стоила $0,72 против $3,26. По сравнению с предыдущей версией Sol стоимость задачи снизилась на 31%, хотя новая модель использовала больше выходных токенов. Это подчёркивает важный нюанс оценки моделей: одинаковая цена миллиона токенов не означает одинаковую стоимость реального прогона.
Dots получили собственный облачный компьютер и возможность выполнять постоянные фоновые задачи: отслеживать источники, анализировать обратную связь и готовить изменения к проверке. В режиме автономного исследования агент может читать данные, но не отправлять сообщения и не изменять их. Для команд OpenAI представила ChatGPT Space и Pages — общее пространство и документы для совместной работы людей и агентов. Codex получил облачные окружения, голосовой ввод в консольном клиенте и управление несколькими агентами, а Agents API научился работать с компьютером.
Новые тарифы ChatGPT Pro
OpenAI добавила тариф ChatGPT Pro 500 стоимостью $500 в месяц. План Pro 200 за $200 сохранился, но включённый объём для него меняется. По объяснению руководителя Codex Тибо, Plus соответствует условному уровню 1x, Pro 100 — 5x, Pro 200 — 10x вместо прежних 20x, а Pro 500 — 25x. Пользователи, у которых Pro 200 была активна в период с 22 по 29 сентября 2026 года, сохранят прежнюю квоту до 29 октября 2026 года включительно при условии, что подписка остаётся активной.
OpenAI объясняет сокращение квот ростом эффективности новых моделей и обещает, что со временем за те же деньги пользователи смогут выполнять больше работы. Однако для тех, кто покупал Pro прежде всего ради большого объёма, арифметика выглядит менее выгодной: за прежние 20x платили $200, а за новые 25x в старшем тарифе предлагают $500. Дополнительным преимуществом Pro 500 станет Astra Ultrafast — ускоренный режим, который, по заявлению OpenAI, может работать до восьми раз быстрее в Codex и до шести раз быстрее в API. В подписке он расходует квоту в восемь раз быстрее стандартного режима.
Claude Sonnet 5.5 расходует больше токенов
Anthropic выпустила Claude Sonnet 5.5 с прежней ценой $2 за миллион входных и $10 за миллион выходных токенов, а чтение кэша стоит $0,20. Компания заявляет, что модель более чем на 30% быстрее Sonnet 5 и использует меньше токенов на задачу. Однако в предрелизном тестировании Artificial Analysis Sonnet 5.5 набрала 56 баллов против 58 у Opus 5.5 и потратила около 193 тысяч выходных токенов на задачу. Это самый высокий показатель среди проверенных моделей — примерно в семь раз больше, чем у Astra на максимальном усилии. Средняя стоимость задачи составила $7,60, примерно на 50% выше результата предыдущего Sonnet.
Результаты относятся к версии, в которой позднее исправили проблему со структурированными ответами, поэтому Artificial Analysis планирует повторное измерение. Кроме того, расход зависит от уровня усилия: в Claude Code и приложениях по умолчанию используется Medium, на платформе — High, а максимальные показатели относятся к режиму Max. В тестах Artificial Analysis именно High оказался наиболее конкурентоспособным по соотношению качества и стоимости.
API решений и открытые модели
OpenAI на DevDay показала Decisions API на базе Luna. Такой интерфейс предназначен для задач, где модели нужно вернуть не свободный текст, а один из разрешённых вариантов или вероятности: например, выбрать маршрут запроса между агентами или классифицировать обращение. Пока API доступен в ограниченном предварительном режиме.
Cloudflare выпустила открытые модели Clef и Clef-flash под лицензией Apache 2.0 и разместила их в Workers AI. Они совместимы с API Jev, поддерживают изображения и контекст до 64 тысяч токенов. Perplexity представила собственный Decisions API с моделью pplx-decider-v1-27b: миллион входных токенов стоит $0,04, а выходные токены не тарифицируются. Модель основана на Qwen3.8-27B, имеет открытые веса под Apache 2.0, поддерживает изображения и заявленный контекст в 250 тысяч токенов. На одиннадцати тестах Perplexity указывает среднюю точность 85,71% против 84,51% у Jev, но на сложной части JevBench уступает — 70,30% против 73,27%.
Инструменты для агентов и управления контекстом
DeepSeek показала открытую под лицензией MIT оболочку Harness на архитектуре Cordis. Она умеет работать с кодом, файлами, таблицами, документами и фоновыми заданиями. Для macOS на Apple Silicon доступно отдельное приложение, а веб-интерфейс запускается через Node.js. Инструменты и поведение агента расширяются плагинами, причём в режиме Creator агент может создавать новые плагины по описанию. Команды агентов, расписания и автоматическая проверка согласований пока отмечены как экспериментальные.
Исследователи Meta Superintelligence Labs, Вашингтонского университета, MIT и Trillium Labs предложили Context Language Models — подход к управлению контекстом существующих моделей. История превращается в редактируемый файл: агент может удалять лишние фрагменты, обновлять таблицу состояния и сохранять важные сведения в компактном виде. На десяти задачах длительной оптимизации программ в бенчмарке EdgeBench метод за 12 часов дал результат на 5% выше базового, использовав на 59% меньше вычислительных операций.
Anthropic тем временем добавила Mods в Claude Code. Мод представляет собой функцию TypeScript внутри плагина и может перехватывать события до или после выполнения, блокировать вызовы инструментов, удалять секреты из результата или менять элементы интерфейса. Это позволяет добавлять корпоративные правила, журналы вызовов и дополнительные согласования. Но моды не изолированы в песочнице и имеют тот же доступ к машине, что и Claude Code, поэтому их установка требует такого же доверия, как и подключение самого инструмента к проекту.


