Три режима скрытых сбоев, которые пропускает стандартный APM, и уровень инструментирования, который выявляет их раньше, чем это сделают ваши пользователи. Ваша функция искусственного интеллекта проходит нагрузочное тестирование. Задержка менее двух секунд, уровень ошибок менее одного процента, демо-версия продукта...
Три режима скрытых сбоев, которые пропускает стандартный APM, и уровень инструментирования, который выявляет их раньше, чем это сделают ваши пользователи.
Ваша функция искусственного интеллекта проходит нагрузочное тестирование. Задержка составляет менее двух секунд, уровень ошибок — менее одного процента, демо-версия продукта работает без проблем. Вы отправляете это. Три недели спустя клиент сообщает, что вывод на основе искусственного интеллекта «перестал иметь смысл». Ваша приборная панель не показывает ничего плохого. Конечная точка возвращает 200. Журналы молчат.
Это пробел в наблюдаемости в производственных серверах искусственного интеллекта. Он отличается от всего, для чего были созданы традиционные инструменты мониторинга.
Почему стандартный APM не подходит для услуг, поддерживаемых LLM
Коды ответов HTTP, задержка p95 и частота ошибок описывают транспортный уровень. Для конечной точки REST, обслуживающей кэшированные данные или отправляющей запросы к реляционной базе данных, этого достаточно. Для функции, поддерживаемой LLM, ответ 200 почти ничего не говорит о том, правильно ли работает система.
200 от OpenAI или Anthropic может означать: модель вернула действительный ответ. Это также может означать: модель молча обрезала ваш ввод, поскольку он вышел за рамки контекстного окна и вернул связный, но неполный ответ. Или: ответ синтаксически правильный, но качество вывода h.