Нейролюб
НовостьНейросетиAI-агентыHugging Face

IBM выяснила, сколько памяти нужно AI-агентам: качество выросло на 16 п.п.

IBM Research протестировала память AI-агентов на восьми моделях. Правильно подобранный контекст повысил выполнение задач до 16,1 процентного пункта при росте расхода токенов всего на 5%.

Кирилл Киреев

18.08.2026 · 3 минут чтения · Нейросети

ALTK-Evolve — память и обучение AI-агентов на опыте

Содержание

Память AI-агента нужно настраивать под конкретную модель

IBM Research опубликовала результаты тестирования ALTK-Evolve — системы, которая превращает успешные и неудачные действия AI-агента в набор повторно используемых правил. Исследователи проверили подход на восьми моделях: агент учился на собственном опыте без дообучения весов и ручной разметки.

Больше памяти — не всегда лучше

Главный вывод исследования: объём памяти нужно подбирать под возможности модели. Сильные модели с запасом по качеству лучше используют полный набор накопленных правил. Более слабые модели, наоборот, могут теряться в длинном контексте — для них эффективнее компактная база самых надёжных инструкций и несколько подсказок, найденных под конкретную задачу.

На тестах AppWorld выборочная память дала gpt-oss-120b прирост выполнения задач на 16,1 процентного пункта, а расход токенов увеличился только на 5%. DeepSeek-V3.2 с полным набором правил прибавила 9,5 п.п., Claude Opus 4.6 — 4,1 п.п., а GPT-5.5 — 2,9 п.п. Для GLM-5 улучшения не зафиксировали: модель уже находилась около потолка этого теста.

Что это меняет для бизнеса

Компаниям не обязательно хранить в промпте всю историю работы агента. Практичнее выделять устойчивые правила, ошибки и удачные стратегии, а затем измерять, какой объём контекста даёт лучший результат конкретной модели. Для небольших моделей такой отбор может одновременно повысить надёжность и сократить стоимость запросов.

Полный набор правил тоже можно сделать дешевле с помощью кэширования промптов: неизменяемая часть контекста повторно используется на каждом шаге агента. Это особенно важно для длинных процессов — работы с календарями, сообщениями, платежами и другими многошаговыми задачами.

Ограничения исследования

Результаты получены на одном специализированном бенчмарке из 585 задач в девяти симулированных приложениях. IBM Research продолжит проверку подхода в других сценариях, но уже сейчас вывод полезен для разработчиков: память AI-агента стоит проектировать как настраиваемый слой, а не как бесконечный архив всех прошлых действий.

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Перейти в Телеграм

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Чиби Новости