Разговоры о MCP в сообществах разработчиков сейчас в основном сосредоточены на моделях управления предприятием и разрешениях. Это реальные проблемы. Но есть более насущное ограничение, которому уделяется меньше внимания: для тех, кто работает с меньшими объемами...
Разговоры о MCP в сообществах разработчиков сейчас в основном сосредоточены на моделях управления предприятием и разрешениях. Это реальные проблемы. Но есть более насущное ограничение, которому уделяется меньше внимания: для тех, кто использует локальные модели меньшего размера, структура потребления токенов MCP является структурной проблемой, а не просто неудобством.
Вот форма проблемы.
Контекстные окна не равны
Облачная модель с контекстом 128 тыс. может поглощать подробные описания инструментов с трех или четырех серверов MCP и при этом сохранять пространство для реального разговора. Локально выполняемая модель 7B с контекстом 8k не может этого сделать. Когда один сервер MCP помещает в ваш контекст 30 описаний инструментов, вы израсходовали значительную часть своего бюджета до первого сообщения пользователя.
Это не гипотетически. Описания инструментов на практике являются подробными, потому что они должны быть такими — модель использует их, чтобы решить, когда и как вызывать каждый инструмент. Краткое описание экономит токены, но ухудшает точность маршрутизации. Подробное описание стоит жетонов, но работает лучше. Компромисс реален, и бесплатного решения не существует.
Команды, работающие над этим, остановились на нескольких подходах: свести описания к минимуму и принять некоторые ошибки.