GPT-6.1 Sol первой решила все задачи FrontierMath Tier 4

GPT-6.1 Sol впервые получила максимальный результат на верхнем уровне математического бенчмарка FrontierMath. На лидерборде Epoch AI появилась отметка 100%: модель решила все задачи категории Tier 4 при максимальном режиме рассуждения.
Результат примечателен не только сложностью самих заданий, но и выбором модели. Рекорд установила не флагманская Astra, а более доступная GPT-6.1 Sol. По данным источника, OpenAI продаёт её примерно в пять раз дешевле, чем флагманскую модель.
Что такое FrontierMath Tier 4
FrontierMath разработала исследовательская организация Epoch AI совместно с профессиональными математиками. В бенчмарк входят сотни оригинальных задач, подготовленных и проверенных специалистами. Они охватывают разные направления — от вычислительно сложных вопросов теории чисел до абстрактной алгебраической геометрии.
Tier 4 считается самым высоким уровнем FrontierMath. В него входят 43 задачи исключительной сложности, близкие к исследовательским математическим проблемам. На решение одной такой задачи профессиональному математику может потребоваться от нескольких часов до нескольких дней.
В июне Epoch AI выпустила версию бенчмарка v2. В ней исправили ошибки, обнаруженные в значительной части условий. Именно обновлённый набор задач использовался для результата GPT-6.1 Sol.
Почему результат считают значимым
Ещё прошлой осенью лучшие модели показывали на FrontierMath результаты, выражавшиеся однозначными числами. Поэтому идеальное прохождение Tier 4 стало заметным изменением на фоне прежних показателей. Бенчмарк создавался как проверка предельных возможностей систем искусственного интеллекта и, как ожидалось, мог оставаться непреодолимым в течение нескольких лет.
Результат GPT-6.1 Sol не означает, что модель решила все существующие исследовательские задачи в математике. Он показывает, что система справилась с конкретным набором из 43 проверенных задач в версии FrontierMath v2. При этом оценка относится к запуску на максимальном уровне усилий рассуждения.
Таким образом, новый показатель одновременно подчёркивает прогресс моделей в сложных математических рассуждениях и меняет представление о связи между стоимостью системы и её результатами. В данном тесте более доступная GPT-6.1 Sol смогла первой достичь полного результата, хотя ожидать его могли прежде всего от флагманской Astra.


