Итак, вот что произошло: хватит сжигать деньги на графических процессорах: честное руководство по AI API с открытым исходным кодом Ладно, мне нужно кое в чем признаться. В прошлом году я потратил примерно 4200 долларов на аренду серверов с графическим процессором, чтобы самостоятельно разместить LLM с открытым исходным кодом для побочного проекта. Четыре месяца...
Итак, вот что произошло: хватит сжигать деньги на графических процессорах: честное руководство по AI API с открытым исходным кодом
Ладно, мне нужно кое в чем признаться. В прошлом году я потратил примерно 4200 долларов на аренду серверов с графическим процессором, чтобы самостоятельно разместить LLM с открытым исходным кодом для побочного проекта. Четыре месяца спустя я закрыл экземпляр, переключился на API и больше не оглядывался назад. Именно из-за этого опыта я пишу это руководство — потому что экосистема искусственного интеллекта с открытым исходным кодом стала странной в самом лучшем смысле, а большинство советов по затратам, которые циркулируют вокруг, прямо устарели.
Позвольте мне показать вам, что я имею в виду.
То, что вам никто не говорит о программах LLM с открытым исходным кодом
Вот в чем дело: модели с открытым весом догнали конкурентов. Я не говорю, что они превосходят GPT-4o или Claude по всем тестам — это не так, — но разрыв достаточно мал, чтобы для 80% реальных производственных задач все было в порядке. Команда Qwen, DeepSeek, ByteDance, люди, стоящие за GLM и Hunyuan, — все они выпустили действительно функциональные модели, которые вы можете загрузить и запустить уже сегодня.
Таким образом, возникает вопрос: стоит ли вам вообще запускать их самостоятельно?
Я тяжело спустился в эту кроличью нору. Потратил недели на бенчмаркинг. Читал темы на форуме до крови. Настроил vLLM, поборолся с форматами квантования, ругался на CUDA dri