Почему средний процент успеха ложно даёт чувство стабильности
Типичная оценка эффективности ИИ-агентов — средний процент успешных выполнений задач (Mean@k). Например, если агент на базе GPT-4.1 решил 77.4% заданий при пяти попытках, это выглядит убедительно. Однако это усредняет все повторные прогоны и скрывает ситуацию: как часто агент стабильно выполняет одну и ту же задачу несколько раз подряд без сбоев? Именно этот показатель жизненно важен, когда вы доверяете ИИ критичные операции — от финансовых транзакций до проверки договоров.
IBM Research показали, что, хотя GPT-4.1 успешно решает 77.4% задач в среднем, по-настоящему стабильный результат — успех во всех 5 повторных запусках подряд на одну и ту же задачу (Pass^5) — случается лишь в 53% случаев. Это означает, что почти четверть задач в реальных условиях агент может выполнить с большой вариативностью — то справится, то нет.
Что такое «consistency gap» и почему он важен
Разница между средним успехом (Mean@k) и стабильным успехом (Pass^k) названа «consistency gap» — разрывом последовательности. В нашем примере он составляет 24.4 процентных пункта (пп). Для сложных заданий эта разница достигает даже 30 пп. Это серьёзная проблема, которую новые бенчмарки обычно игнорируют, скрывая сложность задачи за усреднёнными цифрами.
Вывод: высокая средняя точность — не гарантия предсказуемого результата.
Как выявить причины нерешительности ИИ-агента
Решение ИИ-агента — это выбор следующего шага, основанный на вероятностях вариантов в выдаче языковой модели. Иногда выбор однозначен (острая вероятность — «sharp distribution»), иногда — расплывчат (плоская — «flat distribution»), когда модель «колеблется» между разными вариантами.
IBM разработала диагностический инструмент Consistency Analyzer. Он не запускает задачу полностью заново. Вместо этого программа пересматривает отдельные решения агента и достраивает возможные варианты с помощью повторных выборок (например, 5 раз). Если при этом часто появляются варианты с разным выбором — это «flip-prone» места, точки критической нестабильности.
Такой анализ позволяет точно локализовать, где и почему агент принимает неустойчивые решения, даже если по итоговому результату задача иногда решается успешно.
Как повысить стабильность работы ИИ с помощью consistency guidelines
Раньше IBM предлагала ALTK-Evolve — систему, которая на основе истории успешных решений агента создаёт рекомендации (guidelines) для будущих попыток, повышая средний успех. В новом подходе вводят consistency guidelines. Это особый тип инструкций, учитывающих результаты Consistency Analyzer для минимизации критичных неустойчивых шагов.
Внедрение таких рекомендаций сокращает «consistency gap» с 24.4 до 12.0 пп — почти вдвое. При этом средний успех не падает, а польза распространяется и на схожие задачи. Это значит — ИИ становится не только точнее, но и стабильнее.
Где это можно применить сейчас и зачем это русскоязычному пользователю
Если вы используете ИИ для повторяющихся и ответственных задач: бухгалтерия, юридический анализ, поддержка клиентов — нестабильность результатов ставит под риск качество и доверие. Теперь есть инструменты аналитики и контроля последовательности, которые можно интегрировать с помощью продвинутых платформ (например, OpenClaw) для повышения устойчивости агентов.
Первый шаг — проверить стабильность выполняемых команд или запросов с помощью повторных запусков, как описывает Pass^k, и использовать технологии, анализирующие альтернативные решения агента.
В будущем подобные подходы позволят создавать более надежных и предсказуемых помощников. Это важно как для бизнес-процессов, так и для личного использования, особенно если вы хотите доверять ИИ-консультанту.
Кому сейчас это важно, а кому — можно пока не заморачиваться
Если вы применяете ИИ эпизодически или в нерискованных задачах, глубоко беспокоиться пока не стоит. Но тем, кто строит на ИИ критичные сервисы или работает с масштабной автоматизацией, стоит следить за развитием подобных методик и подключать инструменты анализа последовательности
Подробнее о системах, похожих на OpenClaw, и работе роботов с реальными данными можно почитать в наших материалах «Асинхронный GRPO с LoRA в Hugging Face Jobs», «Как GPT-6 Astra создает беговые маршруты с OpenStreetMap» и «Как роботы учатся на реальных данных».
Источник: статью «Your Agent Aced the Task. Will It Do It Again?» от IBM Research, опубликованную 15 сентября 2026 года, адаптировали и объяснили для русскоязычной аудитории Infoclaw.ru.