Как работать с инцидентами мониторинга: от первого сбоя до восстановления
Инцидент объединяет последовательные неуспешные проверки в одну связанную историю. Разберите, когда началась проблема, сколько ошибок произошло, когда сервис восстановился и какие данные нужны команде для диагностики.

Краткий ответ
Инцидент нужен, чтобы не рассматривать каждую ошибку как отдельную проблему. Первый неуспешный запуск открывает инцидент, следующие ошибки продолжают его, а успешная проверка фиксирует восстановление.
В карточке инцидента важно смотреть не только на открытый или закрытый статус. Для разбора нужны время начала, последняя ошибка, время восстановления, длительность, число неуспешных проверок, причина последнего сбоя и список запусков внутри инцидента.
UpWatch показывает внешние симптомы и историю доставки email-уведомлений, но не читает внутренние логи приложения и не определяет первопричину автоматически. Окончательный вывод команда делает по данным мониторинга вместе с серверными логами, метриками и изменениями инфраструктуры.