Самый частый вопрос про агентов после «как поставить» — «а можно, чтобы мои данные никуда не улетали?» С Hermes можно: он работает с любым OpenAI-совместимым эндпоинтом, включая полностью локальные модели через Ollama и LM Studio. Ваши файлы, переписка и память агента остаются на вашей машине. Разбираем, как это настроить и чем придётся заплатить.
Почему это работает из коробки
Hermes поддерживает Ollama и LM Studio как штатные бэкенды — интеграции описаны в документации обоих проектов, а NVIDIA официально показывала связку Hermes + локальные модели на RTX-компьютерах и DGX Spark. То есть это не хак, а поддерживаемый сценарий.
Что понадобится
- Установленный Hermes — по гайду установки.
- Ollama (ollama.com) или LM Studio — менеджеры локальных моделей.
- Железо: для комфортной работы агента нужна модель класса 7–14B — это 8–16 ГБ видеопамяти (или Apple Silicon с 16+ ГБ единой памяти). На CPU запустится, но ответы будут мучительно медленными.
Настройка через Ollama
- Установите Ollama и скачайте модель, например:
ollama pull qwen3:14b
-
Убедитесь, что Ollama запущен (по умолчанию слушает
localhost:11434). -
В настройке Hermes (
hermes setupили правкой конфига) укажите провайдера с OpenAI-совместимым адресом Ollama:
base URL: http://localhost:11434/v1
модель: qwen3:14b
- Запустите
hermesи проверьте ответ. Всё — агент работает без интернета (для языковой части).
С LM Studio аналогично: запустите локальный сервер в приложении и укажите его адрес (localhost:1234/v1 по умолчанию).
Что это значит для вас: честный расклад
Плюсы. Полная приватность — память агента, ваши файлы и переписка не покидают машину. Ноль расходов на токены: гоняйте агента круглосуточно. Нет зависимости от доступности зарубежных API — для России это отдельный аргумент (альтернативы — в гайде по провайдерам).
Минусы. Локальные модели 7–14B заметно слабее облачных флагманов: сложные многошаговые задачи будут получаться хуже, а самообучение навыков — работать грубее. Дизайн Hermes это отчасти компенсирует: субагенты у него — короткоживущие изолированные исполнители с узким контекстом, что как раз дружелюбно к небольшим моделям.
Рабочая стратегия — гибрид: локальная модель для повседневного и приватного, облачная — для сложного. Hermes позволяет переключать провайдера одной командой, так что это не выбор навсегда.
Как попробовать за вечер
Если у вас игровая видеокарта или Mac на Apple Silicon — поставьте Ollama, скачайте модель на 7–8B (быстрее) и подключите к Hermes по шагам выше. Первое ощущение от «свой ИИ без чужих серверов» стоит потраченного часа.
Источник
Интеграции: lmstudio.ai/docs/integrations/hermes и docs.ollama.com/integrations/hermes