Как сохранение истории рассуждений утроило результаты GPT-5.6 в тесте ARC-AGI-3
Исследователи выяснили, что низкие результаты передовых ИИ-моделей в бенчмарках часто связаны не с их внутренними ограничениями, а с потерей контекста и истории прошлых действий в тестовой среде.

Суть
Недавние тесты модели GPT-5.6 Sol в бенчмарке ARC-AGI-3 показали неожиданно низкие результаты. Однако исследователи выяснили, что проблема крылась не в способностях самой модели, а в настройках тестовой среды. Включение всего двух параметров — сохранения рассуждений (retained reasoning) и сжатия контекста (compaction) — позволило утроить итоговый балл и сократить количество генерируемых токенов в шесть раз. Это событие наглядно демонстрирует, как сильно техническая «обвязка» влияет на производительность искусственного интеллекта.
Контекст
Бенчмарк ARC-AGI-3 создан для оценки того, как агенты обучаются и мыслят. В нем искусственному интеллекту предлагается исследовать незнакомые 2D-головоломки и понимать их правила без явных инструкций. Изначально GPT-5.6 Sol набрал в этом тесте лишь 7,8%, хотя ранее успешно справлялся с более сложными задачами, включая математические гипотезы и прохождение игр вроде Pokémon FireRed.
Причина столь низкого результата крылась в архитектуре официальной тестовой среды (harness) ARC-AGI-3. Она была намеренно сделана максимально простой и универсальной. После каждого действия среда удаляла все скрытые рассуждения модели, заставляя ее каждый раз анализировать игру с нуля. Кроме того, использовалось скользящее усечение (rolling truncation) — по мере роста истории старые действия просто стирались из памяти.

Diagram showing how model reasoning, tool calls, conversation history, and context compaction work together across a long-running task.






