reymer.ai
Новости
/
Данные
/
Инструменты
/
Знания
reymer.ai

Медиапортал об автономном бизнесе, AI-трансформации и автономизации.

hello@reymer.ai

Новости

  • Все новости
  • AI-дайджесты

Инструменты

  • Каталог
  • Коллекции
  • Сравнения
  • Промпты
  • Поиск для агентов

Данные

  • AI-рынки
  • Value Chain
  • Цены API
  • Калькулятор
  • AI Intelligence: инсайдеры и фонды

Знания

  • Вся база знаний
  • Карта профессий и AI
  • AI-агенты для бизнеса
  • AI для профессий
  • Gartner MQ анализы
  • Оценка автономизации
  • Глоссарий
  • Кейсы внедрения ИИ
  • FAQ

Справочники

  • Автономный бизнес
  • Claude Code Tips
  • Вайб-кодинг
  • MCP Protocol
  • AI-кодинг агенты
  • Agent Frameworks
  • Deep Thinking Prompts
  • Гид по AI-агентам
  • OpenClaw vs NanoClaw
  • Конституция Claude

Курсы

  • Все курсы
  • Основы AI
  • Промпт-инжиниринг
  • Claude 101
  • Claude Code
  • Claude Agent Skills
  • Perplexity Pro 101
  • OpenClaw 101
  • NanoClaw 101
  • PicoClaw 101

© 2026 reymer.ai · СТАТУС СИСТЕМЫ: РАБОТАЕТ

О проектеПолитика конфиденциальности
NousResearch Hermes - Погружение в AI-агента

Открытый AI - другой путь

  • Зачем нужен открытый AI10 мин
  • NousResearch - лаборатория без стен12 мин
  • Эволюция Hermes - от 7B до агента13 мин

От чата к агенту

  • Чат vs агент - в чем разница12 мин
  • Анатомия AI-агента15 мин
  • Рынок AI-агентов в 202613 мин

Hermes Agent - знакомство

  • Что такое Hermes Agent10 мин
  • Hermes vs OpenClaw - два подхода15 мин
  • Установка Hermes Agent15 мин
  • Первая сессия10 мин

Инструменты и интеграции

  • 50 встроенных инструментов14 мин
  • Мессенджер-адаптеры14 мин
  • MCP-клиент и внешние серверы12 мин

Память и самоулучшение

  • Система памяти Hermes14 мин
  • Цикл самоулучшения14 мин
  • Создание кастомных навыков12 мин

Рассуждение и планирование

  • XML-теги рассуждения14 мин
  • Гибридное рассуждение Hermes 413 мин
  • Планирование сложных задач13 мин

Практические сценарии

  • Автоматизация повседневных задач13 мин
  • Hermes для разработки13 мин
  • Мультиагентные системы12 мин
  • Безопасность и ответственное использование12 мин

Мастерство и будущее

  • Экономика AI-агентов12 мин
  • Экосистема и сообщество11 мин
  • Будущее AI-агентов - что дальше12 мин
Урок 15 из 26•14 мин

Цикл самоулучшения

Цели урока

После прохождения этого урока вы сможете:

  • 1Понять цикл самоулучшения AI-агента: выполнение, обратная связь, анализ, обновление
  • 2Узнать о системе Atropos RL в Hermes 4
  • 3Научиться логировать и анализировать ошибки для улучшения навыков
Ваш браузер не поддерживает воспроизведение видео.
Видео-введение к уроку

Что такое самоулучшение агента

Самоулучшение - это способность AI-агента становиться лучше с каждой выполненной задачей. Обычный чат-бот совершает одну и ту же ошибку бесконечно. Агент с циклом самоулучшения анализирует результаты, выявляет паттерны неудач и обновляет свои навыки. Это ключевое отличие инструмента от напарника.

Цикл самоулучшения AI-агента - выполнение, обратная связь, анализ, обновление, применение
Пять этапов цикла самоулучшения Hermes(нажмите для увеличения)

Пять этапов цикла

1

Выполнение - агент получает задачу и выполняет ее, используя текущий набор навыков и инструментов

2

Обратная связь - результат оценивается: автоматически (тесты, метрики) или пользователем (подтверждение, замечания)

3

Анализ ошибок - агент разбирает, что пошло не так: неверный инструмент, неполный контекст, ошибочная логика

4

Обновление навыков - на основе анализа агент корректирует свои инструкции, добавляет новые правила, обновляет библиотеку навыков

5

Применение - обновленные навыки используются в следующей задаче, замыкая цикл

Atropos RL - обучение с подкреплением в Hermes 4

Hermes 4 использует систему Atropos RL - собственный фреймворк NousResearch для обучения с подкреплением. Atropos работает с приблизительно 1000 верификаторов на 60 миллиардах токенов данных. Каждый ответ модели проверяется по множеству критериев: точность, полнота, следование инструкциям, безопасность. На основе этих оценок модель корректирует свое поведение.

Ключевое отличие Atropos от стандартного RLHF (обучения с подкреплением на основе обратной связи от людей) - использование автоматических верификаторов вместо ручной разметки. Это позволяет масштабировать процесс обучения и быстрее итерировать.

Статистика самоулучшения

МетрикаЗначениеИсточник
Ускорение задач после 20+ навыков40% быстрееNousResearch benchmarks
Снижение ошибок после 50 сессийНа 35-50%Данные сообщества
Верификаторов в Atropos RL~1000NousResearch документация
Объем обучающих данных Atropos~60 миллиардов токеновNousResearch отчет
Время создания нового навыка5-15 минутСредний пользователь

Autonomous Curator - автоматическая оценка навыков

Начиная с версии 0.12, Hermes Agent включает модуль Autonomous Curator. Это встроенная система, которая автоматически оценивает качество библиотеки навыков агента. Curator анализирует частоту использования навыков, процент успешных выполнений, среднее время и ресурсоемкость. На основе этих данных система предлагает: удалить неиспользуемые навыки, объединить дублирующие, оптимизировать часто используемые.

Лог самоулучшения - практический пример

yaml
# Пример лога самоулучшения Hermes Agent
# Файл: data/improvement-log.yaml

session: "2026-06-09-001"
task: "Сгенерировать отчет о продажах за май"
result: partial_success
duration: 45s

feedback:
  user_rating: 3/5
  issues:
    - "Не включил данные по возвратам"
    - "Формат таблицы неудобный"

analysis:
  root_cause: "Навык report_generator не запрашивает данные о возвратах"
  missing_context: "Пользователь ожидает формат с группировкой по категориям"
  similar_past_errors: 2

improvement:
  action: "update_skill"
  skill: "report_generator"
  changes:
    - "Добавить запрос данных о возвратах в шаблон"
    - "Использовать группировку по категориям по умолчанию"
    - "Спрашивать формат, если не указан явно"
  applied: true
  verified: true

# Следующая сессия:
# session: "2026-06-09-002"
# task: "Отчет по продажам за апрель"
# result: success
# user_rating: 5/5
# note: "Автоматически включил возвраты и группировку"

Статический бот и самоулучшающийся агент

Статический чат-бот
Одни и те же ошибки повторяются. Не учитывает прошлый опыт. Качество ответов не меняется со временем. Пользователь вынужден каждый раз корректировать вручную. Через месяц работает так же, как в первый день.
Самоулучшающийся агент Hermes
Каждая ошибка анализируется и фиксируется. Навыки обновляются автоматически. Качество растет с каждой сессией. Через месяц агент знает ваши предпочтения и типичные задачи. Экономия времени увеличивается нелинейно.

Цикл самоулучшения может зациклиться: агент пытается исправить ошибку, создает новую, пытается исправить ее и так далее. Всегда устанавливайте лимит итераций (обычно 3-5) и порог качества, при достижении которого цикл останавливается. В конфигурации это параметры max_improvement_iterations и quality_threshold.

Главный вывод

Самоулучшение - это не магия, а системный процесс. Агенты с 20+ настроенными навыками выполняют задачи на 40% быстрее, чем в начале работы. Инвестиция в первые 10-20 сессий окупается многократно: вы обучаете напарника, который потом экономит часы вашего времени каждую неделю.

Тест для самопроверки
Что происходит после выполнения задачи в цикле самоулучшения?

Вопросы для размышления

  • •Какие повторяющиеся ошибки в вашей работе мог бы исправить цикл самоулучшения?
  • •Сколько навыков понадобилось бы вашему агенту для покрытия 80% ежедневных задач?
Система памяти HermesСоздание кастомных навыков

Источник: Reymer AI. © 2026 Reymer AI