В каждом руководстве по сокращению затрат на LLM говорится одно и то же: включите оперативное кэширование. Почти никто из них не упоминает, что кеширование может увеличить ваш счет. У него есть точка безубыточности, она вычислима, и большинство команд никогда не проверяет, на чьей стороне...
В каждом руководстве по сокращению затрат на LLM говорится одно и то же: включите оперативное кэширование. Почти никто из них не упоминает, что кеширование может увеличить ваш счет.
У него есть точка безубыточности, она поддается вычислению, и большинство команд никогда не проверяют, на чьей стороне они находятся.
Сначала два слова, потому что в них живет весь аргумент. Токен составляет примерно ¾ слова; модели выставляют счета за миллион из них. Кэширование подсказок сохраняет переднюю часть подсказки — системную подсказку, определения инструментов, документы, которые вы каждый раз повторно отправляете, — поэтому модель не обрабатывает ее повторно при следующем запросе. Он соответствует точному префиксу: изменение одного байта в любом месте рядом с началом и все, что после него, является промахом.
Запись в кэш стоит дороже, чем обычные токены
Вот та часть, которая пропускается. У кэширования не одна цена, у него две, и одна из них — штраф.
В API Anthropic относительно обычной входной цены за токен:
Операция
Множитель
Обычный входной токен
1,0×
Запись в кэш, TTL 5 минут
1,25×
Запись в кэш, TTL 1 час
2,0×
Чтение кэша
0,1×
TTL — это срок жизни: как долго запись сохраняется после последнего касания. Пять минут по умолчанию.
Таким образом, попадание в кэш — это скидка 90 %, а промах в кэше — надбавка в 25 %.