Ollama получила поддержку локальных Jev-подобных моделей

В версии 0.35 Ollama появилась поддержка моделей, работающих по принципу Jev. Они не формируют произвольный длинный ответ, а выбирают один из заранее заданных вариантов и возвращают оценки вероятности для каждого решения. Обработка выполняется полностью локально.
Такой подход может пригодиться для сортировки обращений в службу поддержки, модерации пользовательского контента и автоматического выбора наиболее подходящей модели под конкретный запрос. Интерфейс Ollama построен по образцу API Jev — моделей компании TypeSafe.
Какие модели доступны
Сейчас в Ollama можно использовать Nimble от Bespoke Labs с 9 млрд параметров, а также две экспериментальные модели Tev1 от Together AI. Они имеют 4 млрд и 0,8 млрд параметров соответственно. Все три модели созданы с помощью дообучения Qwen 3.5.
Наименьшая Tev1 после загрузки занимает на диске 812 МБ. В зависимости от задачи модели поддерживают три формата взаимодействия: выбор одного варианта из списка, оценку по заданной шкале и ответ на вопрос в формате «да или нет».
Задержка и подключение
Производительность команды Ollama проверяли на примере игры Pac-Man. Модель Nimble 9B на MacBook Pro с процессором M5 Max принимала решение в среднем за 91 мс. Одной из причин низкой задержки стала локальная обработка: модели не требуется отправлять запросы в облачный сервис.
Для работы с новым режимом необходимо использовать адрес API /v1/systemone либо официальный Python SDK TypeSafe, настроенный на локальный экземпляр Ollama. Встроенные библиотеки Ollama для Python и JavaScript пока не поддерживают этот режим.


