Aller au contenu principal

Alertes de panne

Votre instance Kuploy vérifie en continu sa propre santé — sa base de données de plan de contrôle, l'archivage de ses sauvegardes et leur fraîcheur — et en rend compte à kuploy.app tant que tout va bien. Si ces comptes rendus s'interrompent plus d'un quart d'heure environ, kuploy.app écrit automatiquement à votre équipe.

Comme c'est le silence qui déclenche l'alerte, celle-ci fonctionne même quand la panne est totale : une plateforme plantée, un cluster mort ou un réseau coupé donnent le même signal. Le courriel part de l'infrastructure de kuploy.app : il ne dépend donc de rien de ce qui tourne dans votre cluster — votre propre serveur de messagerie compris.

Qui reçoit les alertes​

Les courriels d'alerte partent vers tous les responsables de l'instance, de part et d'autre : votre compte kuploy.app et l'instance elle-même.

  • Votre compte kuploy.app : le propriétaire de l'exploitant, et tous les membres du compte ayant le rôle d'administrateur.
  • Les Platform Admins de votre instance : toutes les personnes listées sous Admin → Platform Admins avec le rôle Owner ou Operator.

Les deux listes sont fusionnées et dédoublonnées ; chacun reçoit son propre exemplaire.

Désigner qui est d'astreinte​

Pour ajouter quelqu'un à la liste d'alerte, ajoutez-le comme Platform Admin sur votre instance (Admin → Platform Admins → Add Platform Admin), avec l'un ou l'autre rôle — Operator conviendra aux personnes d'astreinte, qui doivent réagir aux pannes sans avoir besoin d'accéder à la configuration de la plateforme. Le changement prend effet en une heure environ.

Pour retirer quelqu'un, supprimez son entrée de Platform Admin — ou son appartenance comme administrateur sur kuploy.app.

À quoi ressemble une alerte​

  • Objet : [kuploy] <votre instance>: "pg-email-health" has gone silent
  • Délai : environ un quart d'heure après que votre instance s'est tue.
  • Une seule alerte par panne — vous ne serez pas submergé ; lorsque l'instance se rétablit, les comptes rendus reprennent tout seuls, et la panne suivante alertera de nouveau.

La santé est rapportée par catégorie — Email, Platform et Infrastructure ont chacune son contrôle — de sorte que l'objet du message vous dit quelle partie de la plateforme a cessé de rendre compte, et pas seulement que quelque chose s'est tu. Ces mêmes catégories apparaissent sous forme de bandeaux d'état sur la page de licence de votre instance, sur kuploy.app, aux côtés d'une vue de disponibilité sur 30 jours ; voir Sauvegarde continue et restauration à l'instant près pour ce que montre chaque bandeau.

La couverture commence dès la naissance : votre instance enregistre ses contrôles auprès de kuploy.app automatiquement, à sa première synchronisation. Un déploiement tout neuf dont les comptes rendus ne démarrent jamais lève donc une alerte, exactement comme une instance établie qui s'est arrêtée.

Si vous en recevez une, tenez-la pour réelle : l'instance a échoué à ses propres contrôles de santé, est hors service, ou est injoignable — trois raisons de s'y pencher sans attendre.