IBM запускает Open Agent Leaderboard: новый стандарт оценки AI-агентов
IBM Research представила открытый фреймворк для оценки полнофункциональных AI-агентов, который учитывает не только качество работы моделей, но и стоимость их использования в реальных задачах.

Оценка возможностей искусственного интеллекта традиционно сводилась к тестированию отдельных языковых моделей на стандартизированных наборах данных. Однако на практике разработчики используют не просто модели, а сложные системы — AI-агенты, которые включают инструменты, память, механизмы планирования и обработки ошибок. IBM Research представила Open Agent Leaderboard — открытую платформу для оценки именно таких комплексных систем.
Суть инициативы заключается в переходе от тестирования моделей к тестированию агентов. Изменение любого компонента системы (например, алгоритма выбора инструментов) может кардинально повлиять на результат и стоимость выполнения задачи, даже если базовая модель остается прежней. Новый рейтинг позволяет увидеть реальную картину: насколько хорошо работает система в целом и сколько это стоит.
Для создания рейтинга исследователи объединили шесть существующих бенчмарков, охватывающих различные сценарии: программирование (SWE-Bench Verified), поиск информации в интернете (BrowseComp+), выполнение личных задач (AppWorld), а также обслуживание клиентов и техническую поддержку (tau2-Bench). Эти тесты были выбраны из-за их разнообразия — они проверяют работу с кодом, открытые исследования, широкие пространства действий и разговоры по правилам.
Главной технической сложностью стала стандартизация. Разные бенчмарки имеют свои форматы и требования. Команда IBM разработала единый протокол Exgentic, который приводит все тесты к общему формату: задача, контекст и доступные действия. Это позволяет агентам взаимодействовать с разными средами без необходимости индивидуальной настройки под каждую из них.
Первые результаты тестирования принесли несколько важных наблюдений. Во-первых, универсальные агенты уже могут конкурировать со специализированными системами. Во многих случаях агенты без специальной настройки под конкретный бенчмарк показывали результаты на уровне систем, созданных специально для этих задач.
Во-вторых, архитектура агента имеет критическое значение. Хотя выбор базовой модели по-прежнему остается главным фактором, определяющим успех, правильная настройка агента может значительно улучшить результаты. Например, предварительный отбор инструментов (tool shortlisting) повысил эффективность всех протестированных моделей и сделал рабочими те конфигурации, которые ранее не справлялись с задачами.



