Как Netflix развивает и обновляет систему оценки ИИ-объяснений
Большинство команд один раз создают «судью» — так называют модуль, который оценивает ответы или объяснения больших языковых моделей (LLM, large language models). Затем судью просто запускают в работу и забывают. Netflix показывает другой подход.
Их система проверки объяснений показывает рекомендации сотням миллионов пользователей. Для Netflix важно, чтобы оценка была точной и не ухудшалась со временем. Поэтому они разделили жизнь судьи на четыре стадии:
- Рождение: определяют критерии оценки и собирают данные с человеческими метками и объяснениями.
- Обучение: настраивают систему по этим критериям (рубрике).
- Использование: судья начинает работать в продакшене.
- Мониторинг: следят, не изменилась ли точность (дрейф), и при необходимости перенастраивают.
Перенастройка идёт через особый механизм — метасудью. Это вторая ИИ-система, которая анализирует, как первый судья рассуждает, и помогает понять, где именно рубрика несовместима с человеческими оценками. Так не приходится банально менять формулировки в подсказках, а корректируют именно опорные правила оценки.
Кроме того, судья одновременно выполняет две задачи: контролирует качество генерации объяснений и улучшает их, подавая своё разъяснение как часть нового запроса генератору. Если объяснение не устраивает, модель дорабатывает его вместо того, чтобы просто отбрасывать.
Почему это важно для вас? Пяти недельный опыт Netflix показал: пользователи начали смотреть раньше незамеченный контент и дольше задерживались на платформе благодаря качественным объяснениям. Опыт Netflix — пример, как систематически поддерживать качество ИИ-оценок на миллионах пользователей.
Почему проверка навыков (скиллов) в ИИ-агентах часто не помогает и как это исправить
В корпорациях есть привычка запускать «сканеры» для проверки новых скиллов — маленьких программ или модулей, которые расширяют функциональность ИИ-агентов. Сканер проверяет структуру кода, стиль и безопасность. Но Nvidia выяснили, что высокие оценки сканера практически не связаны с реальным качеством работы скилла.
Они проверили 145 скиллов из разных каталогов и нашли очень слабую корреляцию между структурной оценкой и фактическим качеством, измеренным с помощью ИИ-судьи.
Что делать? Nvidia предлагает метод, который называется Skill Lift. Он сравнивает результат выполнения задачи одним и тем же ИИ-агентом, когда скилл загружен и когда нет, на одних и тех же условиях. Разница показывает, насколько скилл полезен на практике.
Такой подход позволяет переходить от простой проверки к количественному измерению реального улучшения, которое даёт навык. Этот метод поможет понять, за что действительно отвечают скиллы и какие из них стоит содержать в продуктиве.
Новая концепция управления памятью ИИ-агентов как код — пример Alibaba Scroll
Большинство систем памяти для ИИ требуют заранее спроектировать схему хранения информации, потом её менять, если агент начинает работать иначе.
Alibaba предложила Scroll — систему, которая убирает схему полностью и передаёт управление контекстом в код Python, который запускается постоянно и доступен модели.
Вместо того, чтобы постоянно встраивать всё в текст запроса (промпт), состояния, прошлые шаги и результаты инструментов хранятся в постоянном журнале событий и в переменных в Python. Модель пишет код, который обращается к этим данным и изменяет их — а в текст промпта попадают только нужные выводы.
При переполнении памяти устаревшие части убирают из основного просмотра, но они остаются быстро доступны через индекс, который точно указывает на место в журнале, чтобы агент мог к ним вернуться.
Такой подход достигает очень высоких результатов в тестах по памяти и запоминанию, например, 94.8% качества в одной из задач. Главное — он даёт преимущества, которые совместимы со всеми будущими улучшениями в написании кода моделями.
Как это использовать и проверить на практике
-
Начните с понимания, как себя ведут ваши ИИ-оценщики. Простой одноразовый тест недостаточен. Если есть возможность, внедрите мониторинг и периодическую донастройку на основе реальных данных, как у Netflix.
-
Если управляете библиотекой скиллов для ИИ-агентов, стоит перейти от статичной проверки структуры к сравнению эффективности скиллов через нагляды сравнения без и с ними (Skill Lift).
-
Для разработчиков локальных решений с большим контекстом поддержка состояния через код может сильно улучшить работу. Можно поэкспериментировать с логами событий и скриптами управления состоянием в Python, вместо попыток упихнуть всю историю в текст запроса.
Подробнее о практике ИИ-агентов и интеграциях читайте в нашем полном гиде по OpenClaw.
Кому и зачем это сейчас нужно
Если вы работаете с ИИ-агентами или собираетесь масштабировать их бизнес-использование, понимание того, как Netflix подходит к оценке, поможет избежать сюрпризов с качеством и доверить клиенту объяснения и рекомендации.
Если управляете скиллами или расширениями для агента — учитесь измерять не красивость кода, а результат. Это сэкономит время и деньги на поддержку.
Разработчикам пригодится идея управления памятью через код для задач с длинной историей запросов, например, в чатботах с длительными сессиями.
Обычным пользователям эти техники пока не нужны, но полезно знать, как развиваются механизмы качества и надежности ИИ, которыми они пользуются.
Источник: 🥇Top AI Papers of the Week (August 24 - 30) by Elvis Saravia