Зачем запускать нейросеть локально
Облачные сервисы (ChatGPT, Claude, Gemini) удобны, но имеют три критических ограничения для профессиональной работы:
- Конфиденциальность: Ввод коммерческой тайны, финансовых отчетов, исходного кода или медицинских данных в облако несет риски утечки.
- Зависимость от интернета и санкций: Блокировки IP-адресов, сбои VPN и сложности с зарубежной оплатой делают работу нестабильной.
- Стоимость токенов: При обработке сотен тысяч страниц или постоянной работе автономных агентов счета за API растут в геометрической прогрессии.
Локальный запуск решает все три проблемы: модель работает на вашем железе, не требует интернета и генерирует неограниченное количество ответов бесплатно.
Ниже разобран практический процесс развертывания локальных LLM. Руководство входит в задачный раздел «Как сделать» — для детального изучения архитектуры читайте общий хаб Локального ИИ и инструкцию по запуску DeepSeek R1.
Подбор модели под объем видеопамяти (VRAM)
Главный критерий выбора локальной модели — размер доступной видеопамяти GPU. Для инференса используется формат GGUF с квантованием Q4_K_M (сокращение объема весов в 4 раза почти без потери качества).
| Объем VRAM | Рекомендуемые модели 2026 | Скорость на GPU | Сфера применения |
|---|---|---|---|
| До 4 ГБ / Только CPU | Qwen 2.5 3B, Llama 3.2 3B, DeepSeek R1 1.5B | 15–25 tok/s | Экспресс-ответы, саммари коротких заметок |
| 6–8 ГБ VRAM (RTX 3060/4060) | Qwen 2.5 Coder 7B, Llama 3.3 8B, Mistral 7B | 40–55 tok/s | Написание кода, чат-боты, перевод текстов |
| 12–16 ГБ VRAM (RTX 4070/4080) | DeepSeek R1 14B, Qwen 2.5 14B, Command-R | 35–45 tok/s | Сложная логика, RAG по документам, архитектура |
| 24 ГБ VRAM (RTX 3090/4090 / Mac 36GB) | Qwen 2.5 32B, DeepSeek R1 32B, Codestral 22B | 25–35 tok/s | Экспертный уровень рассуждений и рефакторинга |
Вариант 1: Быстрый запуск через Ollama (консоль и API)
Ollama — стандарт индустрии для фонового запуска LLM на macOS, Linux и Windows.
Шаг 1. Установка и скачивание модели
- Установите Ollama с официального сайта.
- Откройте терминал и выполните команду запуска нужной модели:
# Для кодинга и скриптов (7B)
ollama run qwen2.5-coder:7b
# Для широкого круга задач и текстов (8B)
ollama run llama3.3:8b
# Для сложной логики и математики
ollama run deepseek-r1:14b

Шаг 2. Подключение к Cursor или сторонним приложениям
Ollama автоматически поднимает локальный HTTP-сервер по адресу http://localhost:11434/v1, полностью совместимый с форматом OpenAI API.
Чтобы использовать локальную модель в редакторе Cursor или VS Code:
- Перейдите в настройки моделей редактора.
- В поле Base URL укажите:
http://localhost:11434/v1. - В поле API Key введите любое слово (например,
ollama). - Введите имя модели:
qwen2.5-coder:7b.
Вариант 2: Графический интерфейс LM Studio
Если вы не хотите работать через терминал, LM Studio предлагает полноценный интерфейс с каталогом моделей из Hugging Face.
Шаг 1. Поиск и загрузка квантованных весов
- Откройте вкладку Discover (иконка лупы).
- Введите название модели (например,
qwen2.5-coder). - Выберите файл с суффиксом
Q4_K_M.ggufи нажмите Download.

Шаг 2. Настройка аппаратного ускорения (GPU Offload)
Чтобы инференс работал с максимальной скоростью, все слои нейросети должны быть выгружены в видеопамять.

- В правом сайдбаре настроек найдите блок GPU Acceleration.
- Переведите переключатель в положение Max (полная выгрузка всех 32 слоев в VRAM).
- Увеличьте размер контекстного окна (Context Length) до
16384токенов.
Развертывание красивого веб-интерфейса Open WebUI
Для комфортной работы всей команды разверните браузерный портал Open WebUI через Docker:
docker run -d -p 3000:8080 \
--add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data \
--name open-webui \
--restart always \
ghcr.io/open-webui/open-webui:main

Откройте http://localhost:3000. Вы получите интерфейс уровня ChatGPT Plus с поддержкой темной темы, папок для диалогов, генерации картинок и загрузки документов (RAG) без единого байта внешнего трафика.
4 типичные ошибки новичков
- Попытка запустить 70B модель на 8 ГБ VRAM: Модель не поместится в GPU и уйдет в системный своп на SSD, скорость упадет до 0.5 токена в секунду. Всегда сверяйтесь с таблицей VRAM.
- Квантования ниже Q3: Квантование
Q2_Kзанимает мало места, но модель начинает путать факты и ломать синтаксис кода. Минимальный стандарт качества —Q4_K_M. - Забытые фоновые процессы: Если параллельно запущены тяжелые 3D-игры или рендеринг, VRAM переполнится и драйвер аварийно завершит работу модели (
CUDA out of memory). - Слишком большое контекстное окно на слабой видеокарте: Контекст в 64k токенов сам по себе требует 3–4 ГБ VRAM под KV-кэш. На картах с 8 ГБ VRAM держите контекст на уровне
8192–16384.
Что изучить дальше
- Как запустить флагманскую модель рассуждений — в гайде DeepSeek R1 локально.
- Как подключить свои корпоративные документы к модели — в статье Обучение нейросети на своих данных.
- Как писать скрипты для автоматизации — в руководстве Скрипты на Python с ИИ.
- Все прикладные статьи собраны в разделе «Как сделать».