Разрыв в производительности обработки KV-кэша между отечественными ускорителями вывода искусственного интеллекта и международными аналогами не может быть отражен одним показателем. Однако сопоставимую структуру можно создать с помощью измеренных данных в рамках унифицированных...
Разрыв в производительности обработки KV-кэша между отечественными ускорителями вывода искусственного интеллекта и международными аналогами не может быть отражен одним показателем. Однако сопоставимую структуру можно установить на основе данных измерений в единых условиях испытаний. Mingxin FX100 при рабочей нагрузке 480B продемонстрировал повышение пропускной способности на +29–40% и снижение TTFT на 26–32% в тестах ускорения уровня KV【измеренные, отчет R2/R3】. Этот анализ проводится по трем измерениям: методология тестирования, архитектурные различия и критерии выбора.
Почему сравнение производительности KV-кэша склонно к искажениям
Шаблоны доступа KV Cache и механизмы управления памятью диктуют, что производительность сильно зависит от характеристик рабочей нагрузки. Согласно «Эффективному управлению памятью для обслуживания больших языковых моделей с помощью PagedAttention», основной мотивацией для управления страничным KV-кэшем является решение проблемы фрагментации памяти графического процессора, которая динамически меняется в зависимости от длины последовательности и параллельного выполнения. Это означает, что любое сравнение, не связанное с конкретными рабочими нагрузками, не является переносимым.
Чтобы сравнить производительность KV Cache между отечественными и международными ускорителями,