Короткий ответ
Главная ошибка новичка — скачать самую популярную модель и разочароваться. Половина того, что стоит в топе каталога, на вашем компьютере не запустится в принципе: это облачные модели, у которых локального варианта нет.
Ниже девять семейств, которые действительно работают локально, с размерами файлов в гигабайтах, таблицей подбора под память и правилом, по которому размер выбирается. Размеры проверены в каталоге Ollama 17 августа 2026 года.
Сначала проверьте, что модель вообще локальная
В каталоге Ollama у моделей есть метки: tools, thinking, vision и — ключевая для нас — cloud. Метка cloud означает, что модель выполняется на серверах Ollama, а не у вас.

На снимке первые три результата — glm-5.2, deepseek-v4-flash и kimi-k3 — все с меткой cloud. Это флагманы, о которых пишут новости, и именно их чаще всего пытаются поставить себе на ноутбук.
ВажноМетка
cloud— не про то, что модель большая. Она про то, что весов для локального запуска не опубликовано вовсе. Ждать, пока «скачается», бессмысленно: скачиваться нечему.
Проверить просто: у локальной модели в описании стоят размеры (3b, 12b, 27b), и на странице тегов виден вес файла. Нет размеров и веса — модель облачная.
Что означают цифры в названии
В названиях встречаются обозначения вроде 3B, 12B, 30B — это количество параметров в миллиардах. Чем больше число, тем «умнее» модель и тем больше памяти ей нужно.
Второе слово — квантизация (q4, q8, qat в имени тега). Это сжатие: у одного и того же семейства gemma4 вариант на 12B весит 7,6 ГБ в обычном виде и 13 ГБ в q8 — почти вдвое больше при том же числе параметров. По умолчанию Ollama качает разумно сжатый вариант, и лезть в это специально не нужно.
Третье, что стоит знать: MoE. У таких моделей заявлено, скажем, 30B параметров, но в каждом запросе работают только 3B. Памяти нужно как под большую модель, а скорость — как у маленькой. Хороший размен, если память есть.
Правило, по которому выбирают размер
Модель должна помещаться в память целиком. Если не помещается — часть считает процессор, и скорость падает в разы. Не на проценты, а именно в разы: с «быстрее, чем читаю» до «успеваю заварить чай».
Практическая прикидка: берите вес файла из таблицы ниже и прибавьте пару гигабайт на контекст. Получившееся число должно быть меньше вашей видеопамяти — или, на Mac с Apple Silicon, меньше общего объёма памяти минус то, что занято системой.
Скорость в токенах в секунду здесь намеренно не приводится: она зависит от конкретной видеокарты, версии драйвера и длины контекста, и чужие цифры на вашем железе не воспроизведутся. Проверяется она за две минуты — как именно, в разделе про пробу ниже.
Таблица подбора под железо
Та же таблица целиком, если хочется увидеть все варианты сразу:
| Ваше железо | Размер модели | Чего ожидать |
|---|---|---|
| Ноутбук без видеокарты, 8–16 ГБ ОЗУ | 1–3B | Медленно, годится для простого: пересказ, перевод |
| Видеокарта 6–8 ГБ | 7–8B | Комфортная скорость, хорошее качество для повседневного |
| Видеокарта 12–16 ГБ | 12–14B | Заметно умнее, справляется с кодом и разбором документов |
| Видеокарта 24 ГБ и больше | 27–32B | Близко к облачным моделям среднего класса |
| Mac с Apple Silicon, 16 ГБ | 7–14B | Хорошая скорость за счёт единой памяти |
| Mac с Apple Silicon, 32–64 ГБ | 27–70B | Лучший «домашний» вариант без сборки ПК |
Девять семейств, которые работают локально
1. gemma4 — универсал по умолчанию
Самое скачиваемое семейство в каталоге: 22,5 млн загрузок. Умеет инструменты, изображения и рассуждение, доступно в размерах от e2b до 31b.
| Тег | Вес файла |
|---|---|
gemma4:e2b-it-qat | 4,3 ГБ |
gemma4:e4b-it-qat | 6,1 ГБ |
gemma4:12b-it-qat | 7,2 ГБ |
gemma4:12b | 7,6 ГБ |
gemma4:latest | 9,6 ГБ |
gemma4:26b-it-qat | 16 ГБ |
gemma4:31b | 20 ГБ |
Кому: всем, кто не знает, с чего начать. Подвох: gemma4:latest весит 9,6 ГБ — на машине с 8 ГБ памяти он не поместится, хотя команда выглядит самой безобидной в каталоге.
2. granite4.1 — самый лёгкий вход
IBM, лицензия Apache 2.0, поддержка инструментов и структурированного JSON.
| Тег | Вес файла |
|---|---|
granite4.1:3b | 2,1 ГБ |
granite4.1:8b | 5,3 ГБ |
granite4.1:30b | 17 ГБ |
Кому: ноутбукам без видеокарты и тем, кому нужен предсказуемый JSON на выходе. Версия на 3B — самая лёгкая модель в подборке, которая при этом умеет вызывать инструменты, то есть годится в мозг простому агенту.
3. qwen3.6 — сильный универсал верхнего сегмента
Размеры 27B и 35B, есть работа с изображениями и рассуждение. Вес вариантов на 27B — от 17 до 20 ГБ в зависимости от квантизации, а версия без сжатия доходит до 56 ГБ.
Кому: видеокартам на 24 ГБ и Mac с 32 ГБ и больше. Подвох: разброс весов внутри одного размера здесь самый большой в каталоге — смотрите на гигабайты, а не на «27b» в имени.
4. qwen3.8 — то же семейство, свежее
Обновлённая линейка с упором на код и долгие агентские задачи, размер 27B.
Кому: тем, у кого qwen3.6 уже работает и хочется прибавки без смены железа.
5. muse-glimmer — под локальных агентов
Модель Meta на 30B под лицензией Apache 2.0, заявлена как рассчитанная на постоянно работающих локальных агентов: вызов инструментов, длинные задачи, восстановление после ошибок.
Кому: если локальная модель нужна не для чата, а как мозг агента. Ровно тот случай, ради которого стоит поставить 30B вместо 12B.
6. nemotron-3.5-lightning — MoE для постоянной работы
NVIDIA, 30B общих параметров при 3B активных. Заявлена под «always-on» агентов — то есть под сценарий, когда модель отвечает часто и понемногу.
Кому: когда памяти хватает, а скорость важнее максимального качества.
7. nemotron3 — мультимодальный разбор документов
NVIDIA, 33B, объединяет видео, аудио, изображения и текст. Заявленные сценарии — вопросы по документам, пересказ, расшифровка.
Кому: разбору бумаг и записей, когда данные не должны уходить в облако.
8. ornith — под агентское программирование
Семейство для агентского кода, размеры 9B и 35B, поддержка инструментов.
Кому: 9B — редкий случай, когда модель под код помещается на среднее железо.
9. lfm2 — для устройств
24B при архитектуре, рассчитанной на работу на устройстве, поддержка инструментов.
Кому: промежуточный вариант между «совсем лёгкой» и «серьёзной», если у вас 16–24 ГБ.
Что не запустится локально
Модели, которые в каталоге помечены cloud и постоянно попадают в подборки «лучших открытых»:
| Модель | Чем известна |
|---|---|
| glm-5.2 | флагман Z.ai под долгие задачи |
| deepseek-v4-flash | MoE на 284B, 13B активных, контекст 1M |
| deepseek-v4-pro | старшая версия того же семейства |
| kimi-k3 | мультимодальная агентская модель Moonshot |
| kimi-k2.6 и kimi-k2.7-code | предыдущие версии, в том числе под код |
| minimax-m3 и minimax-m2.7 | агентские модели с контекстом 1M |
| glm-5.1 | предыдущий флагман Z.ai |
| nemotron-3-super | 120B MoE от NVIDIA |
Все они доступны в облачном режиме Ollama — команды те же, вычисления на стороне. Когда это оправдано — отдельный разбор; коротко: когда приватность не критична, а качество нужно выше локального потолка.
ОсторожноОблачный режим Ollama выглядит как локальный: та же команда, тот же интерфейс. Отличие в том, что ваш текст уходит на чужие серверы. Если локальную модель вы выбирали именно ради приватности — проверьте метку перед запуском.
Как выбрать конкретную модель
Свежие открытые модели выходят каждые пару месяцев, поэтому кроме списка выше держите в голове критерии:
- Начните со среднего размера для вашего железа из таблицы. Понравится скорость — попробуйте на ступень выше.
- Берите свежие версии. Прогресс быстрый: модель этого года на 8B часто сильнее прошлогодней на 14B.
- Проверьте поддержку русского. Не все открытые модели одинаково пишут по-русски. Тестируйте на своей типичной задаче, а не на «расскажи анекдот».
- Для агента нужен вызов инструментов. Если модель будет мозгом ИИ-агента, у неё должна быть метка
tools. Без неё агент не сможет ничего сделать — только поговорить.
Быстрая проверка «потянет ли»
Скачайте модель и задайте типичный для вас вопрос. Смотрите на две вещи.
Скорость. Если текст появляется медленнее, чем вы читаете, — берите модель меньше. Это и есть тот замер, который имеет значение: не чужие токены в секунду, а ваше ощущение на вашем железе.
Качество на вашей задаче. Не на абстрактной, а на реальной: вашем письме, вашем документе, вашем куске кода.
Две-три пробы, и вы найдёте баланс. Место на диске потом освободите командой ollama rm.
ПолезноЕсли модель уже скачана, а места мало, посмотрите список командой
ollama list— веса лежат до тех пор, пока их не удалить, и три-четыре забытых эксперимента спокойно съедают полсотни гигабайт.
Пять ошибок при первом запуске
Все пять встречаются постоянно и все пять лечатся до того, как вы решите, что «локальные модели не работают».
1. Скачали latest, не посмотрев вес. Тег latest — не «самая новая и лёгкая», а просто вариант по умолчанию, который выбрал автор. У gemma4 это 9,6 ГБ. На машине с 8 ГБ памяти модель формально скачается и даже запустится, но считать будет процессор, и ответа вы не дождётесь.
2. Считали память по числу параметров. «12B — это же 12 гигабайт» — неверно в обе стороны. У gemma4 вариант на 12B весит от 7,2 до 13 ГБ в зависимости от квантизации. Гигабайты на странице тегов, число в имени — только ориентир.
3. Забыли про контекст. Вес файла — это модель без разговора. Длинный диалог и большой документ занимают память сверх этого. Модель, которая впритык поместилась, начинает тормозить на третьем сообщении — и это выглядит как «сначала работала, потом сломалась».
4. Взяли модель без метки tools под агента. Агент даст модели список инструментов, а модель не поймёт, что с ним делать: ответит текстом вместо вызова. Со стороны это выглядит как «агент отказывается работать», хотя дело в модели.
5. Не закрыли остальное. Браузер с тридцатью вкладками на Mac с единой памятью — прямой конкурент модели за те же гигабайты. Перед замером скорости стоит закрыть тяжёлое, иначе вы измеряете не модель.
Где лежат веса и сколько места они съедают
Скачанные модели не удаляются сами и не чистятся при обновлении Ollama. Три-четыре забытых эксперимента по 7–17 ГБ — это полсотни гигабайт, которые обычно обнаруживаются в самый неподходящий момент.
Посмотреть, что скачано и сколько занимает:
ollama list
Удалить лишнее:
ollama rm gemma4:26b-it-qat
Полезная привычка: держать одну рабочую модель и одну лёгкую про запас, а остальное сносить сразу после пробы. Скачать обратно — это минуты, а место на ноутбуке кончается быстрее, чем терпение.
Отдельно про Mac: единая память означает, что модель и система делят один пул. Формально свободные гигабайты — не то же самое, что доступные модели, и запас в пару гигабайт здесь не роскошь, а условие работы.
Что выбрать под вашу задачу
Первая проба, ноутбук без видеокарты. granite4.1:3b — 2,1 ГБ, ставится за минуту, умеет инструменты.
Повседневный помощник, 8–16 ГБ. gemma4:12b-it-qat — 7,2 ГБ, работа с текстом и изображениями.
Мозг для локального агента. muse-glimmer на 30B, если памяти хватает; granite4.1:8b, если нет.
Код. ornith:9b на среднем железе, qwen3.8 на 24 ГБ и выше.
Разбор документов и записей. nemotron3, если есть 24 ГБ и больше.
Железо не тянет вовсе. Гибрид: маленькая локальная модель для приватного и рутинного, облачная — для сложного. Либо облачный режим Ollama, либо API за рубли.
Коротко о главном
- Половина топа каталога — облачные модели с меткой
cloud, локально они не запускаются вообще. - Смотрите на вес файла в гигабайтах, а не на число параметров в имени: у одного размера разброс бывает трёхкратный.
- Модель должна помещаться в память целиком плюс пара гигабайт на контекст. Не помещается — скорость падает в разы.
- Самый лёгкий рабочий вход —
granite4.1:3bна 2,1 ГБ, и он уже умеет инструменты. - Агенту нужна метка
tools. Без неё модель может только разговаривать.
Дальше по теме: установка Ollama, связка Ollama и OpenClaw и Ollama против LM Studio, если нужен интерфейс, а не команда.