PROJET PUBLIC / TERMINÉ
Reprise de service avec Prometheus
Un outil Node.js qui surveille les journaux Linux, applique un seuil de redémarrage et expose des métriques de reprise.
Le besoin
Un service qui tourne peut quand même nécessiter une intervention. Dans l’exploitation de nœuds, un message d’erreur précis constitue un signal utile, mais le rechercher manuellement à répétition est peu pratique. J’ai créé un utilitaire qui examine les journaux récents et redémarre le service lorsque le nombre de correspondances atteint un seuil configuré.
Approche
L’application fonctionne sous Linux avec systemd. La configuration définit le service, la fenêtre des journaux, l’expression recherchée, le seuil et l’intervalle de vérification. Node.js coordonne les contrôles et les commandes système correspondantes.
Prometheus rend la détection et la reprise observables. L’outil expose le nombre de correspondances et les redémarrages pour qu’ils soient suivis avec les autres signaux de santé.
Contribution et périmètre
J’ai relié détection, reprise et observabilité dans un outil compact. La règle est configurable : l’opérateur choisit le signal et le nombre de constats nécessaire avant toute action, puis peut enquêter sur le problème sous-jacent.
La source et le README publics expliquent la configuration et les métriques de cet utilitaire ciblé sur les journaux de service.