Почему простого текста недостаточно в XR и зачем нужны живые жесты рук
Современные ИИ-ассистенты выходят за пределы чата и для более естественного общения включают голос, видео и многомодальные возможности. В XR (Extended Reality — расширенной или смешанной реальности) люди взаимодействуют с виртуальным миром в трёх измерениях, а значит, интерфейс в виде плоских рамок и кнопок работает плохо. Для полноценного погружения и понимания друг друга виртуальному агенту нужно не только говорить, но и «жестикулировать», как это делает человек.
В живом общении жесты рук помогают подчеркнуть важное, показать форму предмета или направление. Появляется дополнительный, невербальный слой коммуникации, который помогает легче понять друг друга, особенно когда речь идёт о вещах в физическом пространстве вокруг. Google представил исследовательский прототип AgentHands, который как раз про создание таких «разумных рук» для XR-агентов.
Что такое AgentHands и как устроена система жестов в XR
AgentHands — это экспериментальная система, которая расширяет работу больших языковых моделей (LLM, large language models, например, GPT) для создания синхронизированных с речью, осмысленных и выразительных движений рук виртуального ассистента в XR. Она переводит слова и команды в конкретные жесты, которые укладываются в трехмерное пространство вокруг пользователя.
Категории жестов и их пространственные особенности
Разработчики выделили шесть важных параметров для формирования «языка» жестов:
- Пальцы и форма рук: выбрать одну или две руки и подобрать форму — раскрытая ладонь, сжатый кулак, имитация захвата предмета и так далее.
- Местоположение в пространстве: руки могут висеть в воздухе (для универсального общения), указываться на конкретные объекты (закреплённые за ними) или находиться относительно самого пользователя (для социальных сигналов).
- Временные изменения и анимация: жесты не статичны, они включают движения — наливание, обводка контура, запечатлённые в движении.
- Визуальные эффекты: в XR можно усилить коммуникацию цветом и подсветкой, например, красное свечение для предупреждения о жаре.
- Интерактивность: жесты могут реагировать на изменения окружения и поведение пользователя.
Таким образом, жесты в AgentHands не просто красивые позы — это динамичный и осмысленный язык взаимодействия в пространстве пользователя.
Как AgentHands понимает, на что показывать жестами — регистрация и анализ окружения
В XR вокруг вас находится много предметов, и чтобы жест был понятен, система должна знать, какой именно объект вы обсуждаете. Для этого AgentHands использует технологию регистрации объектов:
- Пользователь с помощью взгляда и движений быстро отмечает объекты в окружении, например, растение или ноутбук.
- Эти объекты сохраняются в памяти с координатами и размерами (3D-боксами).
- Затем агент точно указывает на объект в ответах, синхронизируя жесты с голосом и текстом.
Это позволяет исключить двусмысленность и создавать более естественный диалог, словно ассистент стоит рядом и показывает рукой.
Генерация жестов на основе текста: как LLM управляет движениями в XR
Когда вы задаёте вопрос ассистенту, система сначала формирует ответ текстом, затем в тексте встраиваются специальные команды для жестов (GestureEvents). Каждая команда содержит информацию, какой именно жест нужно сделать, где и когда.
После этого подсистема AgentHands преобразует команды в реальные движения рук и визуальные эффекты в XR-пространстве. В итоге речь и жесты идут синхронно и создают цельное впечатление.
Такое совместное описание и запуск речи с жестами — ключ к тому, чтобы разговор с виртуальным помощником перестал быть сухим и монотонным, а стал похож на общение с настоящим человеком.
Где и как это использовать уже сегодня: инструкция для начинающих
Если у вас есть Android XR устройство или другой шлем расширенной реальности с поддержкой приложений на базе LLM, можно попробовать простой опыт взаимодействия с виртуальным агентом, поддерживающим жесты рук.
Первый шаг — установить приложение с поддержкой XR и LLM, которое может регистрировать объекты вашего физического окружения (например, через камеру и отслеживание взгляда).
Дальше:
- Определите несколько объектов в комнате с помощью встроенного инструмента.
- Поговорите с виртуальным ассистентом о чем-то в вашей среде — покажите на эти объекты взглядом или командой.
- Обратите внимание, как ассистент начинает поддерживать речь жестами рук, указывая или имитируя действия на предметах.
Так можно понять, насколько естественнее становится общение и быстрее усваивается информация.
Кому сейчас полезно и кому можно пока отложить тему
Пока такие технологии нуждаются в специализированном оборудовании и настройках с трекингом глаз и сцены, они меньше актуальны для тех, кто пользуется ИИ через телефон или ПК. Но для профессионалов в области XR, разработчиков интерфейсов и исследователей, а также для пользователей шлемов виртуальной и дополненной реальности — это направление даст новые возможности для работы, обучения и развлечений.
Со временем, когда управление жестами и регистрация объектов упростятся, это станет полезным для всех, кто хочет получить живое, визуально насыщенное взаимодействие с AI в своём физическом окружении.
Если вы хотите больше узнать о том, как устроены современные ИИ с расширенным разумом и способами интеграции, советуем прочитать наш гид по Granite 4.2, а чтобы понять, как строить эффективные компактные модели — посмотрите разбор Quantization-Aware Healing. С практической точки зрения, важно следить за развитием технологий, которые помогут вам точнее и быстрее получать нужную информацию от ассистентов в пространстве вокруг вас.
Источник: research.google/blog/agenthands по материалам Xun Qian и Ruofei Du