Reading view

Каскад из одной аварии: как схлопнуть шторм алертов в одну карточку инцидента

Падает один шлюз - и дежурному прилетает пачка уведомлений: молчат хосты за ним, гаснет uptime-монитор, срабатывают метрические пороги, горит SLO. Событие одно, уведомлений десятки. Разбираю, как собрать такой каскад в одну карточку инцидента и почему наивная реализация ломается: почему группировать надо по верхнему упавшему предку, а не по прямому родителю; что делать, когда события приходят в обратном порядке; почему “молчит, потому что за него сказал корень” и “не эскалируется, потому что родитель лежит” - это два разных состояния, которые нельзя склеивать; и где в такой системе обязательно выбирать шум вместо тишины. С кодом обхода графа, схемой таблиц и списком граблей.

Читать далее
  •  

Два года я был прав — и это ничего не меняло

Есть положение, в котором у вас есть всё, кроме возможности что-либо изменить. Вы видите, что проект идёт не туда. Вы можете это доказать — цифры, переписка, уехавшие вехи. Вы говорите об этом на каждом статусе. И не происходит ничего.

Это не про плохих людей и не про слабого руководителя. Это устойчивая конструкция, у неё есть условия возникновения и предсказуемое поведение. Складывается она везде, где отвечать приходится одному, работу делает другой, и другого нельзя заменить.

Обычно это подряд. Но не обязательно: если вы отвечаете за результат программы, а люди, которые её делают, вам не подчиняются, — конструкция ровно та же, только без договора.

Дальше — из чего она состоит, почему из неё не выйти доказательствами и что оказалось единственным работающим. Одна моя попытка выбраться провалилась; про неё тоже.

Читать далее
  •  
❌