Как устроен Frontier AEO Tracker: что изучают и зачем
Frontier AEO Tracker — это исследование, где несколько передовых моделей языковых ИИ (Astra, Fable, Opus и другие) по разным категориям продуктов и сервисов отвечают на вопрос: какие инструменты они рекомендуют использовать.
AEO расшифровывается как Answer Extraction and Opinion — методика извлечения ответов и оценки их качества по специальному баллу. В трекере используется шесть вариантов вопросов (промптов), чтобы зафиксировать, какие ответы дают модели в 161 категории продуктов. К ним относятся коды агенты, ИИ-подкасты, базы данных, распознавание речи и даже редкие категории вроде инвесторов и бухгалтерских программ.
Цель — понять, какие продукты сегодня считают лидерами самые продвинутые ИИ, и как они приходят к таким решениям. На основании этого можно прогнозировать тренды и видеть, куда движется развитие ИИ-решений.
Что показывают результаты: лидеры и «мягкие предвзятости» моделей
Выпуск трекера выявил несколько устойчивых лидеров во многих категориях. Среди них есть привычные имена, которые часто встречаются в разговорах об ИИ, и это наводит на вопрос влияния «предвзятости» или «зацикленности» моделей на знакомые продукты и бренды.
Предвзятость называется «мягкой», так как разные модели любимы разные инструменты — например, модель Claude Code предпочитает Fable/Opus, а Codex, Astra и Grok тяготеют к Sol и Astra. Это связано, скорее всего, с тем, что модель обучалась на определённых данных и примерах, где чаще встретилась одна или другая платформа.
Интересно, что некоторые GPT-модели (штука типа чата) рекомендуют конкурирующие модели Claude, показывая, что не всегда присутствует неприязнь к внешним решениям. В целом, есть 28 категорий, где все опрошенные модели единодушны в выборе главного продукта. Тут говорят о четком фаворите.
Новые поколения моделей: изменения в рекомендациях и стратегии поиска
Особенно заметно изменение рекомендаций при переходе от моделей Opus к Fable и от Sol к Astra — эти обновления моделей сделали видимыми крупные сдвиги в предпочтениях инструментов.
Некоторые результаты анализа говорят о том, что новые модели Astra стали гораздо уверенно отвечать, выбирая меньше источников информации для рекомендаций, в отличие от предыдущих, которые опирались на большее число источников (например, Opus с 11, а Fable — с 15).
Это указывает на то, что Astra выбирает более «эффективную» и уверенную стратегию, которая снижает случайность в ответах и повышает полезность рекомендаций для конечных пользователей.
Тем не менее, чем меньше поиск, тем выше риск отсутствия нужной информации. Баланс между достоверностью и скоростью — ключевой вызов.
Что значит для вас: практический смысл и что делать дальше
Если вы занимаетесь выбором ИИ-инструментов, следите за трендами или хотите понять, какое ПО и сервисы стоит интегрировать с ИИ-агентами, этот трекер показывает, на что ориентируются топовые модели.
Например, если вы решаете, какой агент использовать или какая база данных лучше подойдет для вашего проекта — посмотрите на лидеров в трекере и сопоставьте с вашими задачами.
Чтобы попробовать, сравните рекомендации разных моделей на ваши категории и оцените, кто из них выбирает более релевантные для вас сервисы. Это даст отправную точку для тестирования и внедрения.
Полезно также понять, насколько уверены эти модели в своих советах, ведь от этого зависит качество и предсказуемость их работы.
Кто точно заинтересуется и кому сегодня это не пригодится
Этот разбор будет важен руководителям проектов с ИИ-агентами, стартапам в области ИИ и специалистам по интеграции, так как помогает сориентироваться в быстро меняющемся рынке.
Если вы просто пользователь чат-ботов для ежедневных задач, узнать об этом можно для общего развития, но переходить на какие-то товары или услуги уже не обязательно.
Для разработчиков и исследователей — это источник данных для анализа и улучшения собственной модели или продукта.
Источник: оригинальный материал Latent Space, автор — команда проекта Astra, https://www.latent.space/p/aeo