Содержание
Память AI-агента нужно настраивать под конкретную модель
IBM Research опубликовала результаты тестирования ALTK-Evolve — системы, которая превращает успешные и неудачные действия AI-агента в набор повторно используемых правил. Исследователи проверили подход на восьми моделях: агент учился на собственном опыте без дообучения весов и ручной разметки.
Больше памяти — не всегда лучше
Главный вывод исследования: объём памяти нужно подбирать под возможности модели. Сильные модели с запасом по качеству лучше используют полный набор накопленных правил. Более слабые модели, наоборот, могут теряться в длинном контексте — для них эффективнее компактная база самых надёжных инструкций и несколько подсказок, найденных под конкретную задачу.
На тестах AppWorld выборочная память дала gpt-oss-120b прирост выполнения задач на 16,1 процентного пункта, а расход токенов увеличился только на 5%. DeepSeek-V3.2 с полным набором правил прибавила 9,5 п.п., Claude Opus 4.6 — 4,1 п.п., а GPT-5.5 — 2,9 п.п. Для GLM-5 улучшения не зафиксировали: модель уже находилась около потолка этого теста.
Что это меняет для бизнеса
Компаниям не обязательно хранить в промпте всю историю работы агента. Практичнее выделять устойчивые правила, ошибки и удачные стратегии, а затем измерять, какой объём контекста даёт лучший результат конкретной модели. Для небольших моделей такой отбор может одновременно повысить надёжность и сократить стоимость запросов.
Полный набор правил тоже можно сделать дешевле с помощью кэширования промптов: неизменяемая часть контекста повторно используется на каждом шаге агента. Это особенно важно для длинных процессов — работы с календарями, сообщениями, платежами и другими многошаговыми задачами.
Ограничения исследования
Результаты получены на одном специализированном бенчмарке из 585 задач в девяти симулированных приложениях. IBM Research продолжит проверку подхода в других сценариях, но уже сейчас вывод полезен для разработчиков: память AI-агента стоит проектировать как настраиваемый слой, а не как бесконечный архив всех прошлых действий.