Создание отечественной экосистемы ускорения хранения данных с использованием искусственного интеллекта требует скоординированного продвижения на трех уровнях: аппаратное обеспечение, программное обеспечение и стандарты. На аппаратном уровне дезагрегированная архитектура хранения и вычислений на основе NVMe-oF...
Создание отечественной экосистемы ускорения хранения данных с использованием искусственного интеллекта требует скоординированного продвижения на трех уровнях: аппаратное обеспечение, программное обеспечение и стандарты. На аппаратном уровне основным выбором стала дезагрегированная архитектура вычислений и хранения на основе NVMe-oF и RoCEv2; на программном уровне оптимизация ускорения, ориентированная на KV Cache, становится ключевым прорывом в повышении производительности вывода; на уровне стандартов адаптация отечественных операционных систем и интерфейсов хранения данных является необходимой предпосылкой для развертывания экосистемы. Данные измерений Mingxin FX100 при длительных рабочих нагрузках с использованием модели 480B показывают, что этот путь обеспечивает количественный прирост производительности.
Аппаратный уровень: дезагрегированные системы хранения и вычислений и высокоскоростное соединение как основа
Для создания отечественной экосистемы ускорения хранения данных с использованием искусственного интеллекта сначала необходимо решить проблему пути передачи данных. Традиционные локальные решения NVMe с прямым подключением сталкиваются с узкими местами, связанными с низким использованием ресурсов и ограниченной масштабируемостью в сценариях кластера графических процессоров. Согласно документации NVIDIA GPUDirect Storage, технология хранения данных с прямым подключением к графическому процессору устанавливает прямой путь данных между графическими процессорами.