Главная ошибка новичка в локальном ИИ — скачать самую большую модель и разочароваться в скорости. Разбираемся, что реально определяет выбор, и подбираем модель под ваш компьютер.
Что означают цифры в названии
В названиях моделей встречаются обозначения вроде 7B, 14B, 70B — это количество параметров в миллиардах. Практический смысл простой: чем больше число, тем «умнее» модель и тем больше памяти ей нужно.
Второе важное слово — квантизация (Q4, Q8 и подобное). Это сжатие модели: Q4 занимает примерно вдвое меньше памяти, чем Q8, теряя немного в качестве. По умолчанию Ollama качает разумно сжатый вариант, так что специально в это лезть не нужно.
Таблица подбора
| Ваше железо | Размер модели | Чего ожидать |
|---|---|---|
| Ноутбук без видеокарты, 8–16 ГБ ОЗУ | 1–3B | Работает медленно, годится для простых задач: пересказ, перевод |
| Видеокарта 6–8 ГБ | 7–8B | Комфортная скорость, хорошее качество для повседневного |
| Видеокарта 12–16 ГБ | 12–14B | Заметно умнее, справляется с кодом и анализом документов |
| Видеокарта 24 ГБ+ | 27–32B | Близко к облачным моделям среднего класса |
| Mac с Apple Silicon, 16 ГБ | 7–14B | Хорошая скорость за счёт единой памяти |
| Mac с Apple Silicon, 32–64 ГБ | 27–70B | Лучший «домашний» вариант без сборки ПК |
Правило большого пальца: модель должна помещаться в видеопамять целиком. Если не помещается — часть считает процессор, и скорость падает в разы.
Как выбрать конкретную модель
Свежие открытые модели выходят каждые пару месяцев, поэтому вместо конкретных названий — критерии:
- Начните со среднего размера для вашего железа из таблицы (обычно 7–8B). Понравится скорость — попробуйте на ступень выше.
- Берите свежие версии — прогресс в открытых моделях быстрый: модель этого года на 8B часто сильнее прошлогодней на 14B.
- Проверьте поддержку русского: не все открытые модели одинаково хорошо пишут по-русски. Тестируйте на своей типичной задаче, а не на «расскажи анекдот».
- Для агентов важен вызов инструментов — если модель будет «мозгом» ИИ-агента, проверьте, что она умеет работать с инструментами (в описании моделей это обычно указано как tools/function calling).
Список доступных моделей — в каталоге Ollama, ставятся все одинаково: ollama pull имя.
Быстрая проверка «потянет ли»
Скачайте модель и задайте ей типичный для вас вопрос. Смотрите на две вещи:
- Скорость ответа: если текст появляется медленнее, чем вы читаете, — берите модель меньше.
- Качество на вашей задаче: не на абстрактной, а на реальной — вашем письме, вашем документе, вашем куске кода.
Две-три пробы, и вы найдёте свой баланс. Место на диске потом освободите командой ollama rm.
Если железо не тянет
Не повод отказываться от идеи:
- используйте облачный режим Ollama — те же команды, вычисления на стороне (когда это оправдано);
- держите гибрид: маленькая локальная модель для приватного и рутинного, облачная — для сложного;
- посмотрите сравнение с LM Studio — иногда удобнее интерфейс, а не движок.