Прошлой зимой я поставил на свой стол NVIDIA DGX Spark. Чип GB10 Grace Blackwell, 128 ГБ унифицированной памяти, около 4700 евро, размером примерно с две стопки книг в мягкой обложке. Я занимаюсь консультированием по автоматизации, мои клиенты немцы, и у них аллергия на отправку...
Прошлой зимой я поставил на свой стол NVIDIA DGX Spark. Чип GB10 Grace Blackwell, 128 ГБ унифицированной памяти, около 4700 евро, размером примерно с две стопки книг в мягкой обложке. Я управляю консалтинговой компанией по автоматизации, мои клиенты — немцы, и у них аллергия на отправку документов в облака США, поэтому «модель работает в моем офисе» — это функция, которую я могу буквально продать.
Это описание, которое я не смог найти перед покупкой: чем на самом деле хорош этот блок, почему технические характеристики ввели меня в заблуждение на целый вечер и конфигурация, которая превратила его из разочарования в машину, которая теперь справляется с большинством моих производственных задач.
Важное число отсутствует на маркетинговой странице.
Вот ловушка. Заголовок характеристик кричит о емкости: 128 ГБ унифицированной памяти, петафлопс вычислений FP4. Емкость определяет, что подходит. Ничего не говорится о том, что можно использовать.
Генерация токенов ограничена пропускной способностью памяти. Для каждого отдельного токена движок передает практически все веса активной модели через чип. Итак, ваш потолок представляет собой простое деление:
текст
Макс. токенов/сек ≈ пропускная способность памяти / байты активных весов
Пропускная способность DGX Spark: ~273 ГБ/с.
Dense 70B @ Q4 (~42 ГБ): потолок 273/42 ≈ 6,5 ток/с
Плотный 70B @ FP8 (~70 ГБ): 273/70 ≈ 3,9 ток/с