Модель LFM2.5-2.6B рассчитана на то, чтобы работать не в дата-центре, а на вашем ноутбуке или телефоне. При этом она умеет главное, что нужно агенту: пользоваться инструментами и вести многошаговые задачи. Данные при таком раскладе не покидают устройство, интернет не нужен, платить за каждый запрос не надо. Разбираем, чего от неё ждать, где она уступает и как понять, потянет ли её ваша техника.
Почему 2.6 миллиарда параметров — это принципиально
Параметры — внутренние настройки модели, по их числу судят о её размере. У облачных гигантов счёт идёт на сотни миллиардов, поэтому им нужны стойки видеокарт.
У LFM2.5-2.6B параметров 2,6 миллиарда. Такая модель помещается в память обычного ноутбука и даже телефона. Раньше это означало «маленькая, а значит, годится только на простые ответы». Здесь другое: модель специально обучали как агентную — не отвечать репликами, а планировать и выполнять последовательность шагов, обращаясь к внешним инструментам.
Чему её учили
Обучение шло на массиве около 34 триллионов слов, а поверх применили обучение с подкреплением внутри агентных сценариев. Проще говоря, модель тренировали не на «правильных ответах», а на успешно доведённых до конца задачах.
Отсюда её сильные стороны: она понимает инструкции, умеет вызывать нужный инструмент и не теряет нить в цепочке «найти информацию — разобрать — собрать результат». Для агента это важнее эрудиции: агент должен доводить дело до конца, а не блистать формулировками.
Насколько быстро она работает
Скорость измеряют в словах в секунду — сколько текста модель выдаёт:
| Устройство | Скорость |
|---|---|
| Ноутбук с Apple M5 Max | 220 слов/сек |
| Обычный процессор AMD | более 100 слов/сек |
| Смартфон | около 30 слов/сек |
Ориентир для понимания: человек читает вслух примерно 2–3 слова в секунду. Даже телефонные 30 слов в секунду — это быстрее, чем вы успеваете читать, то есть ответ появляется без ожидания. На ноутбуке скорость такая, что пауза между вопросом и ответом перестаёт ощущаться.
Где она уступает
Честно про ограничения: в генерации кода крупные модели по-прежнему сильнее. С инструкциями, инструментами, математикой и общими знаниями LFM2.5-2.6B справляется хорошо, а вот сложный код лучше отдавать большой модели.
Отсюда рабочая схема: локальная модель ведёт повседневные задачи и держит данные при себе, а к облачной вы обращаетесь точечно — там, где нужен именно код или разбор чего-то сложного.
Что сделать, чтобы попробовать
Модель поддерживают распространённые способы локального запуска — llama.cpp и ONNX, — поэтому отдельного экзотического софта не нужно.
Порядок такой. Сначала прикиньте железо: подойдёт ноутбук последних лет или телефон, специальная видеокарта не требуется. Затем запустите модель на простой задаче и посмотрите на скорость — цифры выше дают ориентир, но ваша конфигурация может отличаться. И только потом подключайте её к агенту, например к OpenClaw: как это устроено, разобрано в полном гиде.
Главный выигрыш здесь не в скорости и не в экономии, а в приватности: переписка, документы и файлы остаются на устройстве. Если для вас это существенно, посмотрите ещё материал про изоляцию личных чатов с ботом — локальная модель закрывает только часть вопроса, остальное решается настройками агента.
Кому это подойдёт
Локальный агент имеет смысл, если вы работаете с чувствительными данными, часто оказываетесь без интернета или устали от счетов за облачные запросы. В остальных случаях облачная модель проще: ничего не настраивать.
Начните с одной задачи, которую вы сейчас отдаёте в облако и предпочли бы не отдавать. Если LFM2.5-2.6B справляется с ней локально — переносите следующую. Про свежие изменения в агентах — материалы об обновлении OpenClaw 2026.7.2 и улучшениях надёжности.
Источник: Deploy local agents everywhere with LFM2.5-2.6B, Liquid AI, Hugging Face, август 2026.
Соседние разборы про локальные модели: MiniMax-H3 на Mac и NVIDIA Magpie TTS.