Вы отправили агента. Токенов в месяц взорвалось. Вы перешли на «более дешевую» модель, а счет почти не сдвинулся. Вот что никто не печатает на странице цен: в цикле цена модели часто представляет собой ошибку округления рядом с повторным налогом — и…
Вы отправили агента. Токенов в месяц взорвалось. Вы перешли на «более дешевую» модель, а счет почти не сдвинулся.
Вот что никто не печатает на странице цен: в цикле цена модели часто представляет собой ошибку округления рядом с повторным налогом, а повторный налог, по своей сути, является проблемой сродства кэша.
Это практическое продолжение того, почему агентные системы должны заботиться о ценах при попадании в кэш. В этом посте утверждается, что стоимость зависит от поведения кэша, а не от цены исходной модели. Речь идет о том, что вы на самом деле можете с этим сделать.
Что на самом деле вознаграждает кэширование префиксов
Большинство провайдеров (OpenAI, Gemini, Anthropic и шлюзы, совместимые с OpenAI) предлагают автоматическое кэширование префиксов: если начало вашего приглашения побайтно идентично предыдущему запросу, кэшированные токены стоят лишь часть нового входного токена.
Ключевое слово идентично побайтно, и оно помогает только в том случае, если идентичная часть находится в начале подсказки. Измените порядок одной строки, добавьте временную метку над системным приглашением или повторно сериализуйте историю с новым UUID, и вы удалите свой собственный кеш. Модель никогда не становится хитом — вы просто платите полную стоимость за каждый шаг.
Таким образом, «более дешевая модель» оптимизирует неправильное число. Уровень