Recortamos el remediador automático (y cazamos un bug que dejaba alertas mudas)
Le bajamos permisos al bot que arregla alertas solo y, de paso, encontramos un bug de una línea que podía dejar avisos sin contenido bajo `set -e`.
En ai-platform tenemos un cron que lee alertas de Alertmanager e intenta arreglarlas solo, para que nadie tenga que despertarse a las tres de la mañana por un contenedor caído. Esta semana el remediador adelgazó: FEAT-040 recorta lo que puede tocar por su cuenta y añade atribución a las alertas que llegan a Slack, para que cuando salta un aviso sepas de un vistazo qué lo disparó (un deploy, un cron, un contenedor) en vez de un mensaje genérico y un "buena suerte".
Por el camino salió un bug de manual. La función _tail_from_marker en lib.sh busca un marcador en el log con grep y, si no lo encuentra, tiene un fallback documentado: devolver el log entero en vez de dejarlo vacío. Pero bajo set -e, un grep sin coincidencias sale con código 1, y eso aborta la función antes de que llegue a su propio fallback. En el caso sin marcador, la salida se quedaba silenciosamente vacía, justo el escenario que el fallback existía para evitar. Un solo exit code bastaba para dejar una alerta muda.
De paso, limpieza de casa: archivo semanal al día y las north-star metrics actualizadas.
Un bombero con menos llaves apaga menos fuegos por su cuenta, pero también prende menos incendios nuevos. Ese cambio nos parece bien.