Квантизация — сжатие нейросети, чтобы она занимала меньше памяти и работала быстрее. Термин встречается всем, кто пробует запускать модели локально: в названиях моделей мелькают Q4, Q5, Q8 и подобное.
Аналогия
Представьте фотографию в максимальном качестве и её же в JPEG. Картинка та же, файл в несколько раз меньше, а разница видна только при сильном увеличении.
С моделями похоже: каждый из миллиардов параметров хранится с меньшей точностью. Q8 — «мягкое» сжатие, Q4 — сильное, но всё ещё рабочее.
Что означают цифры
- Q8 — почти оригинальное качество, но занимает много памяти.
- Q5–Q6 — разумный компромисс.
- Q4 — самый популярный вариант: заметная экономия памяти при небольшой потере качества. Обычно именно его скачивают по умолчанию.
- Q2–Q3 — сильное сжатие; модель начинает ощутимо ошибаться, брать стоит только если иначе не помещается.
Что это значит на практике
Главный практический вывод: лучше взять более крупную модель в сильном сжатии, чем маленькую без сжатия. Например, модель на 14B в варианте Q4 обычно даёт лучший результат, чем модель на 7B в Q8 при схожем объёме памяти.
Второе: если модель не помещается в видеопамять целиком, часть вычислений уходит на процессор, и скорость падает в разы. Поэтому выбор квантизации — это по сути подбор «влезет / не влезет». Ориентиры по железу — в таблице подбора моделей.
Нужно ли в это вникать
Хорошая новость: обычно нет. Ollama и подобные менеджеры по умолчанию скачивают разумно сжатый вариант, который подходит большинству. Лезть в настройки стоит, только если модель работает слишком медленно (взять сжатие сильнее) или у вас много видеопамяти и хочется максимума качества (взять Q8).
Другие термины — в глоссарии.