← К проектам

Исследование

Локальный LLM-агент

Путь от 1 до 16 токенов в секунду на RTX 3060. Корень оказался не там, где его искали.

OllamaopencodeCUDAPython
Замер: 1 токен в секунду до и 16 после установки драйвера

Симптом

Локальная модель, поставленная агентом в opencode на ноутбуке с RTX 3060, выдавала 1 токен в секунду и падала по таймаутам.

Ложный след

Перебор квантов и режимов работы не дал ничего. Гипотеза о квантовании была дорогой в проверке и при этом неверной.

Настоящая причина

В системе не было драйвера NVIDIA — видеокарта считала через открытый Vulkan. После установки драйвера с CUDA и прокси, отключающего «думанье» модели, скорость выросла до 16 токенов в секунду, заработал вызов инструментов.

Что из этого следует

Ценность кейса не в цифрах. Дорогая гипотеза оказалась неверной, а дешёвая проверка окружения — верной. Проверять среду стоит первым делом.