Если вы использовали модели DeepSeek для побочного проекта или производственной нагрузки, последние несколько месяцев, вероятно, оставили у вас больше вопросов, чем ответов. Появилось новое семейство моделей с большими претензиями, затем распространился слух, что цены...
Если вы использовали модели DeepSeek для побочного проекта или производственной нагрузки, последние несколько месяцев, вероятно, оставили у вас больше вопросов, чем ответов. Появилось новое семейство моделей с большими претензиями, затем распространился слух о том, что цены вот-вот изменятся, а затем всплыла история финансирования, которая вообще не имела никакого отношения к моделям. Очень многое нужно отслеживать, если вы просто пытаетесь решить, стоит ли продолжать развивать их API.
Этот пост объединяет эти темы в одном месте. Никаких спекуляций, выдаваемых за факты, никаких цифр, повторяемых только потому, что они циркулируют в Интернете. Только то, что сообщалось, что DeepSeek подтвердил напрямую, и что это означает, если вы действительно поставляете что-то поверх их моделей.
DeepSeek-V4 и V4-Flash
В этом году компания DeepSeek выпустила предварительную версию семейства моделей V4, вслед за серией V3.
Что известно о релизе на данный момент.
DeepSeek-V4-Pro — это смешанная экспертная модель с примерно 1,6 триллионами общих параметров и около 49 миллиардами активных параметров на один прямой проход.
DeepSeek-V4-Flash — это меньший вариант, имеющий около 284 миллиардов общих параметров и около 13 миллиардов активных.
Обе модели поддерживают контекстное окно на 1 миллион токенов.
