Мастер-класс по инженерному выводу — Филип Кили и Али Таха, Baseten Одна и та же модель открытых весов, обслуживаемая разными провайдерами, может отличаться по скорости в 4–10 раз. Так что «какая модель» отвечает только на половину вопроса. Другая половина - чья...
Мастер-класс по инженерному выводу — Филип Кили и Али Таха, Baseten
Одна и та же модель открытых весов, обслуживаемая разными провайдерами, может отличаться по скорости в 4–10 раз. Так что «какая модель» отвечает только на половину вопроса. Другая половина — чьи выводы.
Филип Кили и Али Таха из Baseten просмотрели весь стек на «Latent Space». Несколько вещей, которые стоит украсть:
Что на самом деле происходит с запросом на 200 тысяч токенов
Первый вопрос не в том, «какой графический процессор». Это «вы присылали мне это раньше?» Маршрутизация с учетом кэша ищет реплику со свободными исполнителями предварительного заполнения и некоторыми из ваших входных данных, которые уже кэшированы, поэтому можно пропустить часть предварительного заполнения. Затем предварительное заполнение и декодирование выполняются на отдельных наборах графических процессоров. Модель спекулянта находится впереди, и если она была обучена с учетом того, что вы пишете код, ваш уровень принятия токенов проекта высок. Вместо этого попросите его суммировать каждую книгу о Гарри Поттере, и он замедлится.
Противоречивый
Здравый смысл отрасли подсказывает, что квантование происходит с потерями, поэтому более сильное сжатие строго хуже. Исследование Бастена показывает, что ошибки квантования могут компенсировать друг друга, и вы можете предсказать, какие слои будут компенсировать друг друга. Квантуйте их. Модель с квантованными слоями 1, 5 и 10 может превзойти модель, имеющую только слои 1 и 2.