Самая страшная и самая механическая часть дежурства — это первый час анализа первопричин. Оказывается, именно такой работой сегодня может заниматься команда агентов ИИ. Итак, мы создали его, направили на кластер Kubernetes и наблюдали, как он работает...
Самая страшная и самая механическая часть дежурства — это первый час анализа первопричин. Оказывается, именно такой работой сегодня может заниматься команда агентов ИИ. Итак, мы создали один, направили его на кластер Kubernetes и наблюдали, как он спорит сам с собой.
ТЛ;ДР
Первый час почти каждого происшествия — это тяжелый труд. Найдите сервис, проверьте последний деплой, почитайте логи, сформулируйте гипотезу, угадайте, насколько вы уверены. Одни и те же движения, каждый раз, обычно в 2 часа ночи, обычно когда кто-то важный не спит.
Мы создали систему, в которой оповещение запускает команду ИИ-агентов, доступных только для чтения, которые проводят расследования так же, как это делал бы SRE. Затем агент-скептик, вся личность которого сомневается в других, пытается разорвать вывод на части. Доверие достигается благодаря соглашению, а не объявлению.
При обнаружении дефекта кода с высокой степенью достоверности он открывает настоящий объединяемый запрос на включение с исправлением и передает всю историю в Teams. Только для чтения. Эфемерный. Консультативный, так человек все равно сливается.
Это не чат-бот, прикрепленный к Runbook. Это то, что люди начинают называть AI SRE, и это предварительный обзор того, куда на самом деле движется корпоративный ИИ. Агенты, которые выполняют скучную и дорогостоящую работу в первый час, чтобы люди начали с интересного.
