Microsoft представила SkillOpt: оптимизация навыков ИИ-агентов как обучаемых параметров
Новый метод от Microsoft Research превращает редактирование текстовых инструкций агентов в контролируемый процесс обучения, улучшая их работу без изменения весов самой модели.

Суть
Исследовательское подразделение Microsoft Research представило SkillOpt — новый подход к созданию и улучшению навыков для ИИ-агентов. Метод предлагает относиться к текстовым файлам с инструкциями (навыкам) как к обучаемым параметрам, которые существуют отдельно от основной языковой модели. Это позволяет систематически улучшать поведение агента без необходимости изменять веса самой нейросети.
Контекст
Современные большие языковые модели (LLM) все чаще используются в качестве агентов, способных собирать данные, использовать инструменты и выполнять многошаговые задачи. Однако главная проблема сегодня заключается в надежности их работы. Обычно инструкции для таких агентов пишутся вручную экспертами или генерируются самой моделью за один проход.

Figure 1. A frozen target model executes tasks while a separate optimizer model trains the skill layer from trajectory feedback, exporting the reusable skill file best_ skill.md through validation gating.
При попытках улучшить эти инструкции разработчики сталкиваются с тем, что промпты становятся слишком длинными, а их эффективность непредсказуемо меняется — возникает так называемый дрейф промптов (prompt drift). В отличие от классического машинного обучения, здесь нет контроля размера шага, проверки на отложенных данных и памяти о неудачных изменениях.
Детали
SkillOpt решает эту проблему, внедряя цикл оптимизации, похожий на обучение нейросетей, но работающий исключительно с текстом. Процесс состоит из нескольких этапов:






