Проблема с полностью автономным исправлением Каждая команда разработчиков платформы в конечном итоге задает один и тот же вопрос: можем ли мы позволить чему-то автоматически исправлять работу, когда оно выходит из строя? Инстинкт говорить «да» понятен: инциденты в 3 часа ночи обходятся дорого…
Проблема с полностью автономным исправлением
Каждая команда разработчиков платформы в конечном итоге задает один и тот же вопрос: можем ли мы позволить чему-то автоматически исправлять работу, когда оно выходит из строя? Инстинкт говорить «да» понятен: инциденты в 3 часа ночи обходятся дорого, и многие сбои Kubernetes следуют узнаваемым закономерностям. Но у полностью автономного исправления есть плохой режим отказа: когда агент ошибается, он ошибается быстро и неправильно в масштабе.
Агенты AIOps для Kubernetes решают эту проблему, разделив проблему на две части: пусть агент выполняет работу по обнаружению, корреляции и предложению тех частей, в которых люди медлительны и непоследовательны, и оставляет человека окончательным лицом, принимающим решения для всего, что имеет реальные последствия. Это модель «человек в цикле» (HITL), и в Google Cloud она четко сопоставляется с существующими примитивами: GKE для среды выполнения, Cloud Monitoring/Logging для сигналов, IAM и Kubernetes RBAC для ограждений, а также Vertex AI или самостоятельная модель для уровня обоснования.
Что на самом деле делает агент
Уберите модные словечки, и агент AIOps для Kubernetes в цикле сделает четыре вещи:
Наблюдайте — используйте события, метрики и журналы из кластера и окружающих сервисов GCP.
Коррелировать — соединить симпт
