Качество RCA напрямую зависит от количества и достоверности доступной информации. Одного сообщения пользователя о том, что сервис перестал работать, обычно недостаточно. Необходимо собрать контекст: когда появилась проблема, какие системы были затронуты, что происходило непосредственно перед сбоем и какие изменения выполнялись в этот период.
Источниками данных могут быть логи приложений и серверов, журналы событий, метрики мониторинга, алерты, трассировки запросов, сведения о производительности, история заявок и предыдущих инцидентов. Полезна информация об изменениях конфигурации, установке обновлений, релизах, изменении прав доступа и состоянии связанных компонентов.
При анализе важно установить временную последовательность событий. Специалисты сопоставляют данные из разных источников, чтобы определить связи между изменениями, ошибками и последующей недоступностью сервиса.
Для RCA важна связка мониторинга, логов, заявок, конфигурационных данных и истории изменений. Чем полнее картина, тем меньше вероятность сделать вывод на основании одного симптома.