Архитектура надежных ИИ-агентов: уроки разработки морского помощника Shippy
Институт искусственного интеллекта Аллена (Ai2) раскрыл детали создания Shippy — агента для критически важных морских операций. Главный приоритет системы — надежность и предсказуемость.

Суть
Команда Института искусственного интеллекта Аллена (Ai2) представила технический разбор Shippy — специализированного ИИ-агента для платформы Skylight. Этот инструмент помогает аналитикам отслеживать незаконную рыбную ловлю и защищать морские акватории. Ошибка в такой сфере может отправить патрульное судно за сотни миль в неверном направлении, поэтому ключевым приоритетом при разработке стала абсолютная надежность системы, а не просто возможности базовой нейросети.
Контекст
Разработка агентов для реального сектора сильно отличается от создания чат-ботов общего назначения. Большие языковые модели (LLM) по своей природе недетерминированы — они могут выдавать разные ответы на один и тот же запрос и склонны к ошибкам при работе со сложными структурами данных.
Чтобы преодолеть это ограничение, инженерам пришлось переосмыслить архитектуру взаимодействия модели с внешним миром. Основная работа заключалась не в обучении модели, а в создании среды, которой можно доверять.
Детали
Архитектура Shippy разделена на три логических компонента: «душа» (системный промпт, задающий границы дозволенного), «навыки» (инструкции в формате Markdown для конкретных задач) и конфигурация (выбор LLM, например, Claude Opus 4.6, и фреймворка).
Ключевое инженерное решение — отказ от прямых обращений агента к программному интерфейсу (API). Вместо этого агент использует специально написанный интерфейс командной строки (CLI). В ранних версиях попытки заставить модель самостоятельно формировать сложные API-запросы приводили к скрытым ошибкам: ломалась пагинация, искажались геоданные. CLI берет эту рутину на себя, принимая простые команды и возвращая результаты в виде локальных JSON-файлов, что исключает сбои при передаче больших объемов данных.
Для обеспечения безопасности используется платформа Mothership. Каждый диалог с пользователем запускается в изолированном Kubernetes-контейнере. Это гарантирует, что данные одного аналитика никогда не пересекутся с данными другого, а сам агент работает в жестко ограниченной «песочнице».



