Как NeoMME совмещает обработку текста и изображений в одном трансформере
NeoMME — это семейство моделей с 260 и 800 миллионами параметров, которые работают как с текстовой информацией, так и с изображениями. Важно, что это не набор разных компонентов для текста и для картинок, а единый трансформер — специальная архитектура нейросетей, которая одновременно принимает «токены» текста и маленькие части изображения (патчи).
Это отличие от популярных сейчас моделей с двумя отдельными башнями (одна для изображений, другая для текста) или моделей с автогенеративным языковым декодером. NeoMME не использует отдельный выделенный блок для картинок и не обрабатывает текст по-одиночке слева направо (авторегрессивно). Вместо этого один и тот же трансформер двунаправленно анализирует и текст, и изображения одновременно.
Это даёт сразу несколько преимуществ:
- нет нужды тренировать отдельный визуальный модуль,
- оптимизация эффективнее — легче получить быстрый и компактный вектор для поиска или классификации,
- единая архитектура упрощает перенос знаний между языками и визуальными понятиями.
Подход базируется на технологии Transformer с «скользящим вниманием» и «глобальным вниманием» для длинных последовательностей, что важно для документов высокого разрешения с большим количеством деталей на изображениях.
Масштаб и важные технические особенности NeoMME
eoMME умеет работать с максимальной длиной контекста около 16 тысяч токенов — такой объём помогает одновременно охватить несколько страниц текста высокого разрешения или 4К-изображение целиком. Для сравнения, обычные языковые модели часто ограничены в длине контекста тысячами токенов или меньше.
Обработка изображения осуществляется путём разбиения на патчи 32×32 пикселя, каждый из которых переводится в вектор с помощью небольшой нейросети (MLP). Затем каждый патч становится похож на текстовый токен для трансформера.
В модели реализованы современные улучшения в архитектуре трансформера: группировка запросов, нормализация внимания, позиционное кодирование с учётом 2D структуры изображения и другие решения, повышающие качество и скорость.
Ещё одна особенность — язык в модели многоязычный, с 131-тысячным «токен-вокабуляром» (словами или их частями), созданным с учётом не только текстов, но и машинных транскриптов изображений. Это помогает обрабатывать документы различного происхождения, в том числе с технической и научной точной лексикой.
Что даёт такой подход на практике — эффективность и экономия ресурсов
NeoMME перепрошли до задачи поиск с визуальных документов — например, страниц книг, журналов или технических справочников, где надо находить нужные страницы по тексту или картинкам.
В сравнении с другими передовыми моделями, NeoMME при той же точности на метрике nDCG@10 (оценка качества поиска) работает примерно вдвое быстрее при одинаковом размере входного изображения 2048×2048 пикселей на видеокарте NVIDIA L40S.
Особо стоит выделить технологии снижения размера индекса для поиска:
- использование иерархического объединения токенов по слоям и асимметричного квантования уменьшает объём хранения одного документа в индексе с 1.5 мегабайт до всего 6 килобайт.
- Такая оптимизация сохраняет более 95% точности, что критично для практических приложений, особенно при работе с миллионами страниц.
Модель доступна в библиотеке Hugging Face Transformers с открытой лицензией Apache 2.0, что даёт возможность её использовать и развивать.
Как начать использовать NeoMME для визуального поиска и других задач
Если вы работаете с большими коллекциями документов, где ежедневно приходится быстро находить страницы или заметки по содержимому, NeoMME предлагает готовое эффективное решение:
- Скачать и установить пакет из Hugging Face (https://huggingface.co/blog/Hcompany/neomme), следуя инструкциям на сайте.
- Использовать предобученную модель для преобразования изображений и текста в векторные представления — облегчает поиск, сравнение и кластеризацию контента.
- Попробовать демо визуального поиска, чтобы понять, как модель справляется с реальными задачами.
Для практического внедрения стоит ознакомиться с темами оптимизации индекса, чтобы экономить место и ускорить результаты.
Кому нужен мультимодальный кодировщик NeoMME сегодня и завтра
NeoMME будет полезен компаниям и специалистам, которые работают с большими визуально-текстовыми архивами — например, цифровыми библиотеками, юридическими или медицинскими документами, дизайнерскими и инженерными материалами. Модель позволит снизить затраты на инфраструктуру за счёт объединения обработки текста и картинки в одном блоке, повысить скорость поиска и качество понимания данных.
Если вы только начинаете знакомиться с мультимодальными ИИ, NeoMME — хороший пример современных подходов, освобождающий от необходимости делать сложные совмещённые системы из разных моделей.
Если же вам пока хватает классических текстовых моделей или простого OCR — можно пока не спешить, но держать в уме, что подобные универсальные энкодеры станут стандартом спустя пару лет.
Чтобы глубже понять механизм современных мультимодальных моделей, рекомендуем прочитать разборы, связанные со способами общения ИИ и роботов, как в статье Google или про Claude Fable, доступные на нашем портале.