Как Qwen 27B обгоняет модель с триллионом параметров

В сообществе r/LocalLLaMA активно обсуждают ситуацию, которая ещё недавно казалась невозможной: модель Qwen 27B, способная работать на игровом ноутбуке, в ряде сравнений уверенно обходит GPT-4o образца 2024 года. При этом GPT-4o приписывали около триллиона параметров — примерно в сорок раз больше, чем у Qwen 27B.
Обсуждение началось с вопроса о том, как модель с существенно меньшим числом параметров может показывать более высокие результаты. За сутки публикация собрала 1276 положительных оценок и 343 комментария. Судя по ответам участников, объяснение связано не с одним техническим приёмом, а с изменением самого подхода к разработке языковых моделей.
Параметры не определяют качество сами по себе
Размер модели остаётся важным фактором, но он не гарантирует качества ответов. GPT-4o создавалась в период, когда основным способом улучшения систем считалось масштабирование: больше обучающих данных, больше параметров и больше вычислительных ресурсов. Такой подход позволял заметно наращивать возможности моделей, однако со временем его эффективность стала зависеть от качества исходных данных и методов последующего обучения.
В случае Qwen 27B ключевую роль, по мнению участников обсуждения, сыграли современные методы обучения с подкреплением. Они помогают модели не только воспроизводить закономерности из обучающего корпуса, но и лучше выбирать между возможными вариантами ответа с учётом поставленной задачи. В результате компактная модель может эффективнее использовать уже имеющиеся параметры.
Дистилляция и качество данных
Ещё одним фактором стала дистилляция из старшей модели Qwen 3.8 Max. При таком подходе компактная система получает возможность перенять часть закономерностей и навыков более крупной модели. Это не увеличивает число параметров Qwen 27B, но позволяет эффективнее наполнить их полезными знаниями и стратегиями решения задач.
Важны и более чистые размеченные данные. Большой объём текстов сам по себе не гарантирует хороший результат: шумные, противоречивые или плохо подготовленные примеры могут ограничивать развитие модели. Качественная разметка помогает точнее формировать нужное поведение и уменьшает влияние ошибок в обучающем наборе.
Обучение на действиях, а не только на текстах
Относительно новым направлением стало обучение на агентных траекториях. В этом случае модель анализирует не только готовые тексты, но и последовательности действий, которые выполняются при решении задачи. Такой формат ближе к реальной работе агента: системе нужно определить следующий шаг, оценить результат и продолжить выполнение, а не просто выдать правдоподобное продолжение фразы.
Именно сочетание обучения с подкреплением, дистилляции, качественных размеченных данных и агентных сценариев объясняет, почему Qwen 27B может конкурировать с гораздо более крупными системами. Это не означает, что число параметров перестало иметь значение или что компактная модель превосходит GPT-4o абсолютно во всех задачах. Однако пример показывает: при сравнении современных ИИ-систем важно учитывать не только масштаб, но и то, как модель обучали и для каких сценариев её оптимизировали.


