Solution
Supervision remise en main
Une supervision bruyante perd ses destinataires. Le travail utile relie chaque signal à un service, un seuil, une fenêtre de couverture, une action et une revue, et il ne confond pas santé opérationnelle et détection de sécurité.
Une alerte qui veut dire quelque chose
Les services critiques sont surveillés
Le service que le client utilise, pas seulement le processeur du serveur. Une machine en pleine forme qui ne rend plus le service est le cas classique.
L’alerte a un destinataire
Chaque signal retenu a un destinataire testé, un canal, une fenêtre de couverture et une escalade. Le comportement hors couverture est déclaré, pas supposé.
Chaque alerte sait quoi faire
Une procédure d’une page par alerte : sa signification, les vérifications à faire, et qui appeler si elles ne suffisent pas.
Le bruit baisse au lieu d’augmenter
Je corrige ou je supprime toute alerte qui ne conduit à aucune action. Les destinataires continuent ainsi de prêter attention aux signaux utiles.
Concrètement
- Supervision par service rendu, en plus des mesures de machine
- Contrôles de bout en bout : la page répond, la sauvegarde a fini, le fichier est arrivé
- Seuils fixés sur l’historique observé plutôt que sur des valeurs par défaut
- Acheminement des alertes vers une personne nommée, sur un canal qu’elle regarde
- Une procédure d’une page par alerte, écrite en même temps que l’alerte
- Revue des alertes déclenchées, pour retirer celles qui n’ont mené à aucune action
Les systèmes concernés
- Serveurs, hyperviseurs et bases de données en place
- Microsoft 365 et services cloud, par leurs états de service
- Systèmes de sauvegarde, pour l’état réel des travaux
- Messagerie, SMS et outils de discussion interne
- Applications métier, quand elles exposent un point de contrôle
Ligne de serviceServeurs et hébergement →
Les systèmes surveillés
Le même travail, avec les contraintes du secteur. Chaque carte ouvre le secteur complet.
Logistique et chaîne d’approvisionnement
Surveillance des échanges avec les partenaires
Un contrôle par flux attendu : le fichier est arrivé, il est lisible, il est complet. L’alerte part vers une personne nommée avec sa procédure.
Distribution et e-commerce
Les heures critiques sont déclarées
Caisse, réseau et terminal de paiement sont suivis du point de vue du magasin. Chaque signal a un destinataire, une procédure et une couverture horaire explicitement souscrite ; la surveillance ne promet pas une intervention hors contrat.
Déroulement
Les services qui doivent rester disponibles
La liste des services dont l’arrêt ne passe pas inaperçu, et le délai au bout duquel cet arrêt devient un problème.
Contrôles
Un contrôle par service, écrit du point de vue de l’utilisateur plutôt que de la machine.
Acheminement
Qui reçoit quoi, sur quel canal, et le traitement en dehors des heures ouvrables. Je dis ce cadre franchement, sans promesse de veille permanente.
Suppression des alertes inutiles
Après quelques semaines, je retire les alertes qui n’ont conduit à aucune action. Une supervision trop bruyante finit par être ignorée.
Vérifier l’adéquation : Supervision remise en main
Décrivez le contexte, les contraintes et la décision attendue. Le premier échange sert à qualifier le périmètre, les limites et la prochaine étape utile.
Décrire la situation