Нейролюб
НовостьНейросетиAnthropicClaude

Anthropic объяснила, как тратить меньше токенов в Claude Code — 6 практических приёмов

Anthropic выпустила практическое руководство по Claude Code: как уменьшить расход токенов, не ломать prompt cache и получать больше пользы от каждой сессии.

Кирилл Киреев

14.08.2026 · 3 минут чтения · Нейросети

Как экономить токены при работе с Claude Code

Содержание

Как экономить токены в Claude Code: рекомендации Anthropic

Anthropic опубликовала практическое руководство по эффективной работе с Claude Code. Компания объяснила, почему одна и та же задача может стоить по-разному, и назвала конкретные приёмы, которые помогают не расходовать токены на лишний контекст.

Главное — не переносить старый контекст в новую задачу

Основная рекомендация — запускать команду /clear при переходе к другой задаче. Всё, что Claude прочитал или получил из вывода команд, остаётся в контексте и повторно отправляется модели на каждом следующем ходе. Поэтому длинная сессия со множеством несвязанных задач постепенно становится дороже и менее сфокусированной.

Anthropic также советует заранее выбрать модель и уровень усилий через /model и /effort. Переключение этих настроек в середине разговора может сбросить кэш промпта: тогда весь накопленный контекст придётся обработать заново по полной цене.

Шесть способов сократить расход токенов

  • использовать /clear между разными задачами;
  • выбирать модель и уровень усилий до начала работы;
  • прикреплять нужные файлы через @-упоминание, чтобы Claude не тратил отдельный вызов на поиск и чтение;
  • добавлять тихие флаги к «шумным» тестам и командам или запускать их в субагенте;
  • выполнить /context в новой сессии и убрать ненужные инструкции, MCP-инструменты и содержимое CLAUDE.md;
  • делать /compact перед длинным перерывом, пока кэш ещё не истёк.

Почему это влияет на стоимость

Claude Code автоматически использует prompt caching. Чтение уже закэшированного контекста обходится примерно в десять раз дешевле обычного ввода, но кэш работает только пока начало запроса остаётся неизменным. Смена модели, уровня усилий или истечение времени жизни кэша заставляют систему заново обработать историю сессии.

Практический вывод для разработчиков и команд простой: короткие тематические сессии выгоднее одного бесконечного диалога. А большие логи, результаты тестов и другие объёмные промежуточные данные лучше отдавать отдельному субагенту — в основной контекст вернётся только его итоговый ответ.

Для бизнеса эти рекомендации означают более предсказуемые расходы на агентное программирование. Экономия достигается не за счёт отказа от сильной модели, а благодаря тому, что оплачиваемые токены используются на текущую задачу, а не на повторную обработку устаревшей истории.

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Перейти в Телеграм

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Чиби Новости