NVIDIA AVO решает сложную задачу ARC-AGI-3 с максимальным результатом
ARC-AGI-3 — это публичный набор тестов, где ИИ должен решать 183 уровня в 25 различных средах без подсказок и правил. Здесь главный герой — NVIDIA AVO, агент с нейросетью Claude Opus 5 внутри. Без агента Claude показывает около 30% прохождения, а с AVO — ровно 100%. Это необычно: прирост не из-за увеличения силы самой модели, а благодаря особенностям системного дизайна.
Как это устроено? AVO работает циклом, который можно назвать “agentic variation loop”. Он включает четыре шага: внимательное исследование текущего контекста, планирование изменений, их внедрение, а потом оценку результата через функцию оценки. Если вариант неудачный, агент сам диагностирует ошибки и пытается исправить. Решения, которые принимаются, сохраняются для дальнейшего использования.
Кроме этого, агент ведёт постоянную память — хранит промежуточные данные, результаты вычислений и логику, чтобы не начинать с нуля после перезапуска. Есть переменный контролёр, который следит, чтобы агент не застрял в бесконечном цикле и может перенаправить его работу при необходимости.
Почему это полезно? Опыт NVIDIA подтверждает: эффективный дизайн агента способен сделать из относительно базовой нейросети полноценного решателя сложных задач, улучшая точность и эффективность. Такой подход важен для создания универсально сильных ИИ-инструментов.
TrueFoundry открывает TrueForge — универсальную платформу для создания ИИ-агентов
TrueForge — это готовый к использованию фреймворк, открытый с лицензией MIT, который превращает любую большую языковую модель (LLM, Large Language Model) в полноценно рабочего агента.
Что уже включено в TrueForge? Там есть менеджер композиций (MCP tools) для управления задачами, реестр навыков, изолированное (песочница) исполнение команд, механизмы подтверждения чувствительных действий с участием человека, возможность создавать под-агентов, надёжное хранение данных для длительной работы и пошаговое слежение за выполнением.
Почему это важно? TrueForge не привязан к конкретной модели или провайдеру. Его можно запустить на собственной инфраструктуре с любым коммерческим или открытым ИИ-моделям и переключаться между ними по задаче. TrueFoundry утверждает, что такой подход снижает стоимость на 30% с тем же уровнем качества и до 75%, если использовать свободное ПО.
Кому это пригодится? Разработчикам, которые хотят быстро создавать надёжных ИИ-агентов под свои задачи без пожертвований независимости от провайдеров. Для пользователей это значит расширение выбора ИИ-инструментов и снижение цены сервиса.
Самоулучшение ИИ-агентов: что происходит с идеей самостоятельного роста?
Самоулучшение — возможность ИИ улучшать себя без внешнего вмешательства — в последние годы приковало внимание исследователей и пользователей. В обзоре фигурирует опыт с Ornith-1.5, агентом, достигшим уровня Opus, и другие тесты.
Но интересный эффект: когда порядок элементов обучения меняют случайным образом (reshuffled), эффект самоулучшения исчезает. Это говорит о том, что не самоучение работает бесконтрольно, а важна правильная структура и порядок обновлений.
Это коррелирует с идеями о том, что “рекурсивное самоулучшение” лучше понимать как управляемый процесс, в котором ИИ-агент действует по заранее заданным правилам и рамкам, а не как некий магический рост. Подробнее о работе такого подхода можно почитать в нашем разборе Рекурсивное самоулучшение ИИ-агентов.
Практические аспекты: что можно сделать уже сегодня
Если вы хотите проверить на практике, как работает системный дизайн в ИИ-агентах, попробуйте использовать TrueForge. Репозиторий открытый и быстро развивается — оно позволяет взять любую языковую модель и создать агента с базовыми функциями управления задачами и памяти.
Можно запустить даже на бесплатных или условно свободных моделях и увидеть, как устроена работа агентов с отдельными компонентами: планирование, исполнение с прогоном по шагам, управление состоянием.
Для желающих глубже вникнуть полезны статьи из нашего архива по темам памяти агента, безопасности и созданию надёжных цепочек рассуждений (например, разбор про встраиваемый водяной знак модели Claude Как работает встраиваемый водяной знак в тексте от модели Claude — разбор на доступном языке).
Кому полезно отслеживать такие новости и почему
- Разработчикам и ИТ-специалистам, которые создают ИИ-инструменты, важно понять, что успех агентов не только в силе базовой нейросети, а в грамотном дизайне процесса и архитектуре системы.
- Пользователям, внедряющим ИИ в бизнес или исследования, стоит следить за расширением возможностей и снижением стоимости через открытые платформы вроде TrueForge.
- Новичкам, которые только знакомятся с ИИ, сейчас нет смысла пытаться внедрять сложные агенты в работу самостоятельно, но полезно понять тенденции, чтобы выбирать эффективные решения в будущем.
Если вы хотите освоить ИИ-агентов, начните с простых платформ и изучите идею циклического планирования, памяти и оценки своих действий. Это фундамент, который поможет не потеряться в сложных технологиях.
Источник: https://nlp.elvissaravia.com/p/ai-agents-weekly-nvidia-avo-trueforge, автор — Elvis Saravia