Развертывание LLM на мобильных устройствах создает уникальное противоречие между локальным реагированием и возможностями облачного масштаба. Вывод на устройстве позволяет избежать задержек в сети и сохраняет конфиденциальность, но процессоры телефонов быстро достигают ограничений по температуре и памяти, когда...
Развертывание LLM на мобильных устройствах создает уникальное противоречие между локальным реагированием и возможностями облачного масштаба. Вывод на устройстве позволяет избежать задержек в сети и сохраняет конфиденциальность, но SoC телефонов быстро достигают ограничений по температуре и памяти при запуске моделей с числом параметров, превышающим несколько миллиардов. Для производственных приложений прагматичная архитектура обычно является гибридной: запускайте небольшие дистиллированные модели на телефоне для защиты с малой задержкой или автозаполнения и переносите тяжелые рассуждения, обобщение длинного контекста и использование агентских инструментов на размещенный API. Затем задача смещается от трюков с квантованием к контролю затрат, поскольку мобильные сеансы непредсказуемы, контексты растут с каждым поворотом, а выставление счетов на основе токенов может резко увеличиться, когда пользователи вставляют длинные документы или запускают многоэтапные циклы агентов.
Разделение рабочих нагрузок между Edge и облаком
Первое решение в мобильной архитектуре LLM — где выполнять каждую задачу. Выполнение на устройстве хорошо подходит для автономного автозаполнения, классификации намерений или конфиденциальной предварительной обработки, которая должна оставаться на телефоне. Все, что требует глубоких рассуждений, больших контекстных окон или мультимодального понимания, должно быть перенесено на размещенный бэкэнд.
Oxlo.ai поддерживает это разделение с помощью Op.