DrivingBench проверил ИИ за рулём реального автомобиля

Команда проекта DrivingBench провела эксперимент, чтобы выяснить, насколько современные универсальные ИИ-агенты способны управлять настоящим автомобилем. В отличие от симуляторов, модели столкнулись с физическими ограничениями, задержками передачи данных и необходимостью интерпретировать изображение с дорожных камер в реальном времени.
Для испытаний использовали седан Toyota Corolla 2022 года. Управление передавалось через устройство Comma Four с открытой системой Openpilot, подключённое непосредственно к CAN-шине автомобиля. Вся вычислительная часть работала на ноутбуке, который выходил в сеть через мобильную точку доступа.
Телеметрия и изображения с двух камер поступали в чат с моделью через локальный MCP-сервер. ИИ-агентам были доступны три инструмента: наблюдение за дорожной обстановкой, передача команды на движение и экстренное торможение. В управляющей команде можно было указать угол поворота руля, скорость и продолжительность действия.
Как проходил заезд
Эксперимент проводили на изолированной парковке. Скорость автомобиля программно ограничили диапазоном от 0,5 до 3,5 м/с, то есть примерно до 13 км/ч. На водительском месте постоянно находился оператор, державший ногу над педалью тормоза и готовый вмешаться при опасной ситуации.
Маршрут протяжённостью около 130 метров обозначили конусами. Он включал прямые участки, левые и правые повороты, а также финальную зону для парковки. Каждой модели разрешили сделать до трёх попыток в рамках одного диалога. После неудачных заездов агент просили проанализировать ошибки — так исследователи оценивали способность моделей корректировать поведение в пределах текущего контекста.
Результаты моделей
Полностью пройти трассу смогла только GPT-6 Astra. Со второй попытки модель преодолела весь маршрут примерно за пять минут, тогда как в первом заезде достигла середины дистанции.
Остальные участники показали заметно более слабые результаты. Claude Fable 5.1 в лучшей попытке проехала 45% маршрута, Grok 4.6 достиг 11%, а GPT-5.6 Sol смогла пройти только 6% дистанции.
Основной причиной сходов стали ошибки восприятия окружающей среды. Модели путали стороны конусной разметки, неточно оценивали габариты автомобиля по изображениям с камер и иногда делали слишком большие паузы между управляющими командами. Эти проблемы приводили к потере траектории даже на невысокой скорости.
Создатели DrivingBench считают, что эксперимент подтвердил принципиальную способность современных нейросетей ориентироваться в физическом пространстве и управлять автомобилем в простых условиях. При этом для более стабильной работы ИИ-агентам потребуются меньшие задержки между восприятием и действием, а также более развитые навыки пространственного планирования.


