Как я сократил расходы на LLM на 95% — заметки бэкэнд-инженера на 2025 год Я буду с вами честен: когда я впервые посмотрел на наш законопроект об инфраструктуре искусственного интеллекта, я чуть не подавился кофе. Команда использовала GPT-4o для всего, включая гло...
Как я сократил расходы на LLM на 95% — заметки бэкэнд-инженера на 2025 год
Я буду с вами честен: когда я впервые посмотрел на наш законопроект об инфраструктуре искусственного интеллекта, я чуть не подавился кофе. Команда использовала GPT-4o для всего, включая прославленного бота для часто задаваемых вопросов, который в основном отвечал на вопросы: «Какое у вас окно возврата?» десять разных способов. Мы говорим о тысячах долларов в месяц за то, что по сути было string.contains() с дополнительными шагами.
Это история о том, как я перешел от «что, черт возьми, за эти расходы» к использованию многоуровневой системы маршрутизации, которая обрабатывает 85% запросов по модели $0,01/M. Кстати, я ничего из этого не изобретал — я просто украл идеи из руководства по оптимизатору запросов к базе данных и применил их к вызовам LLM. Если вы когда-либо настраивали реплику чтения или CDN, вы уже понимаете 80% того, что будет дальше.
Позвольте мне рассказать вам о семи шагах, которые привели нас от безрассудного сжигания бюджета к бюджету, который я бы фактически защищал в обзоре планирования.
Неудобная правда о выборе модели
Большинство команд, с которыми я общаюсь, выбирают свою модель по умолчанию так же, как они выбирают текстовый редактор по умолчанию — один раз, на ранней стадии и никогда не возвращаются к ней. Затем кто-то подключает его к двенадцати службам, и стоимость растет линейно с увеличением использования.