Ollama 0.30 стала дружелюбнее к видеокартам. Но не спеши ждать магические +20%
Новая версия расширила GGUF-совместимость, ускорила NVIDIA и включила Vulkan по умолчанию.
Хорошая новость: локальные модели должны запускаться на большем количестве железа. Плохая: цифра «до 20%» всё ещё означает «проверь на своей машине».
Что изменилось
Ollama 0.30 лучше работает с файлами моделей GGUF через движок llama.cpp. Проще говоря: больше моделей должно запускаться без ручной настройки отдельных программ.
Для NVIDIA заявлено ускорение до 20%. Vulkan теперь включён по умолчанию, поэтому видеокартам AMD и Intel стало проще использовать ускорение.
Где звёздочка
Замер NVIDIA делали на RTX 5090 с Gemma 4 26B. На ноутбучной RTX 4060, другой модели и другом контексте результат будет иным. Обновиться стоит, но шампанское открывай после собственного бенчмарка.
Источник материалаOllama Blog