Почему обычно при уменьшении модели страдает качество работы
При работе с большими языковыми моделями (LLM, Large Language Models) важна скорость и экономия памяти — их тяжело запускать даже на мощных серверах. Чтобы сделать модель меньше, используют два основных метода: сначала уменьшают саму структуру модели — убирают слои, части нейронов или целые вычислительные блоки. Затем проводят квантование — преобразуют вещественные веса модели с 16 или 32 бит на более короткий формат в 4 бита (bit), чтобы сэкономить память и ускорить вычисления.
Но вместе эти два шага обычно снижают качество модели — она хуже решает задачи, требующие логики, математики и программирования. Поэтому есть дополнительный этап — «исцеление» (healing), когда модель пытаются подстроить под новую форму, вернуть часть утраченных способностей.
Что такое Quantization-Aware Healing (QAH) и чем он отличается
Старые методы «исцеления» при квантовании часто используют дообучение с учётом самой операции квантования — это называется training (QAT). Модель тренируют заново, прожимая данные через наложенную имитацию квантования, чтобы веса привыкли к сжатому формату. Но такой процесс тяжелый, дорогой и иногда нестабильный — слишком долго учить не стоит.
Другой подход — distillation (QAD), где уменьшенную и квантованную модель обучают повторять поведение более точной «учительской» модели, сравнивая её выходы. Это работает, если учитель — такая же модель с полными весами. Но после структурного сжатия архитектура и размер модели меняются, и больше нет оригинала той же структуры. Значит, у «студента» (маленькой модели) нет подходящего эталона, к которому можно точно подстроиться.
Главная идея QAH — вместо обучения на уже сжатой версии модели брать за эталон полную, исходную модель, как есть, с полным размером и точностью. Учитель и ученик тогда не совпадают по структуре, но результаты учителя использовать можно. Студент подстраивается под распределение ответов учителя по всей выборке, а не просто копирует чёткие ответы (label). Это снимает ограничение качества, которое накладывало обучение только на восстановленную, а не оригинальную модель.
Что даёт новая методика по факту? Результаты на примере GPT-OSS
В статье приводят эксперимент на GPT-OSS модели с 120 миллиардами параметров, которую сжали вдвое — до 60 миллиардов. Модель квантовали в 4-битный формат MXFP4. После применения QAH получился не просто компактный и дешёвый в запуске вариант, но и более точный в 7 из 9 тестов, чем исходный 16-битный оригинал той же уменьшенной модели.
Это необычно, ведь обычно при уменьшении и квантовании качество снижается. QAH позволяет получить 4-битную версию, которая не уступает, а в ряде случаев превосходит полную точность.
Как увеличить точность моделей без дополнительных мощностей
Этапы сжатия моделей сейчас — практически стандарт: уменьшение структуры, квантование и «исцеление». QAH меняет только последний шаr. Если раньше берётся уже уменьшенная и немного ухудшенная модель для восстановления, то теперь берут исходник, большую оригинальную модель, и учат меньшую 4-битную модель повторять её поведение.
Это позволяет использовать преимущества сжатия без привычной потери качества. Практически это означает, что большие модели можно запускать на доступном железе, экономить на вычислениях и при этом не жертвовать результатами, например, при программировании, вычислениях или логическом анализе.
Где это пригодится и как попробовать самому
Если вы работаете с крупными моделями — например, для генерации текста, кода, научных расчётов — применение QAH позволит запускать модели на менее мощных серверах и даже на локальных машинах, экономя время и деньги на клауд-сервисах.
Для обычного пользователя это выглядит как возможность использовать продвинутые модели быстрее и дешевле, с меньшей задержкой. Для разработчиков и компаний — прямой путь к масштабированию продуктов на базе ИИ.
В настоящий момент QAH — технология для специалистов и тех, кто собирает свои модели, но с ростом инструментов это может стать частью доступных решений. Следите за релизами открытых моделей и библиотек, которые начнут поддерживать такой подход.
Для начала посмотрите существующие открытые 4-битные модели и попробуйте их на любимых задачах. Далее можно изучить методики distillation (дистилляции) и fine-tuning (тонкой настройки) — наши материалы по OpenClaw помогут ориентироваться среди инструментов и интеграций.
Кому и когда это действительно полезно
Метод QAH стоит использовать тем, кто:
- Разрабатывает или запускает большие языковые модели там, где важна экономия ресурсов.
- Хочет получить лучшие показатели на сложных задачах (математика, код, логика) при уменьшенных размерах моделей.
- Интересуется передовыми методами сжатия ИИ для коммерческих и исследовательских проектов.
Если вы пользователь готовых сервисов без технических задач — пока технология в основном разработка для инженеров. Но знание о таких улучшениях поможет оценивать будущие обновления и возможности ИИ.
Источник: Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original — статья Antonio Tiene и команды MultiverseComputingCAI на Hugging Face