Содержание
Как экономить токены в Claude Code: рекомендации Anthropic
Anthropic опубликовала практическое руководство по эффективной работе с Claude Code. Компания объяснила, почему одна и та же задача может стоить по-разному, и назвала конкретные приёмы, которые помогают не расходовать токены на лишний контекст.
Главное — не переносить старый контекст в новую задачу
Основная рекомендация — запускать команду /clear при переходе к другой задаче. Всё, что Claude прочитал или получил из вывода команд, остаётся в контексте и повторно отправляется модели на каждом следующем ходе. Поэтому длинная сессия со множеством несвязанных задач постепенно становится дороже и менее сфокусированной.
Anthropic также советует заранее выбрать модель и уровень усилий через /model и /effort. Переключение этих настроек в середине разговора может сбросить кэш промпта: тогда весь накопленный контекст придётся обработать заново по полной цене.
Шесть способов сократить расход токенов
- использовать
/clearмежду разными задачами; - выбирать модель и уровень усилий до начала работы;
- прикреплять нужные файлы через @-упоминание, чтобы Claude не тратил отдельный вызов на поиск и чтение;
- добавлять тихие флаги к «шумным» тестам и командам или запускать их в субагенте;
- выполнить
/contextв новой сессии и убрать ненужные инструкции, MCP-инструменты и содержимое CLAUDE.md; - делать
/compactперед длинным перерывом, пока кэш ещё не истёк.
Почему это влияет на стоимость
Claude Code автоматически использует prompt caching. Чтение уже закэшированного контекста обходится примерно в десять раз дешевле обычного ввода, но кэш работает только пока начало запроса остаётся неизменным. Смена модели, уровня усилий или истечение времени жизни кэша заставляют систему заново обработать историю сессии.
Практический вывод для разработчиков и команд простой: короткие тематические сессии выгоднее одного бесконечного диалога. А большие логи, результаты тестов и другие объёмные промежуточные данные лучше отдавать отдельному субагенту — в основной контекст вернётся только его итоговый ответ.
Для бизнеса эти рекомендации означают более предсказуемые расходы на агентное программирование. Экономия достигается не за счёт отказа от сильной модели, а благодаря тому, что оплачиваемые токены используются на текущую задачу, а не на повторную обработку устаревшей истории.