Бессерверный вывод масштабируется до нуля между запросами и счетами с точностью до миллисекунды, что звучит как очевидный стандарт по умолчанию для прерывистой рабочей нагрузки. Для языковых моделей это обычно не так, и причина в единственной строке в функции exc...
Бессерверный вывод масштабируется до нуля между запросами и счетами с точностью до миллисекунды, что звучит как очевидный стандарт по умолчанию для прерывистой рабочей нагрузки. Для языковых моделей это обычно не так, и причина заключается в единственной строке в списке исключенных функций, а не в стоимости.
Сначала прочитайте исключения
AWS документирует определенный список функций реального времени, которые не поддерживаются бессерверными конечными точками. Его стоит прочитать прежде всего, потому что он дает ответы на большинство вопросов, которые люди задают на этой странице:
графические процессоры. Бессерверная технология работает только с процессором. Уже одно это исключает возможность размещения большинства языковых моделей с открытым весом с приемлемой задержкой, и это единственная наиболее распространенная причина, по которой план ее использования терпит крах.
Конфигурация VPC и изоляция сети. Если модель должна попасть в частную базу данных или для вашего соответствия требованиям требуется конечная точка внутри VPC, бессерверные технологии не смогут этого сделать.
Многомодельные конечные точки, конвейеры вывода и несколько производственных вариантов. Никаких канарейок по весу вариантов и никакого размещения пятидесяти небольших моделей за одной конечной точкой.
Сбор данных и монитор модели. Мониторинг сноса приходится строить самостоятельно.
Пакеты моделей AWS Marketplace и частные реестры Docker. че