公開專案 / 已完成
Prometheus 服務復原工具
一款精簡的 Node.js 工具,用於監看 Linux 服務日誌、依閾值觸發重啟,並提供復原指標。
挑戰
服務持續執行時仍可能需要介入。節點維運中的特定日誌錯誤可以成為判斷訊號,但人工反覆查看並不是理想的維運流程。我為此建立一個精簡工具:檢查近期服務日誌,計算指定字串出現次數,達到設定閾值後重啟服務。
做法
應用程式在 Linux 與 systemd 環境執行。設定值包括服務名稱、日誌範圍、比對字串、觸發閾值與檢查間隔。Node.js 負責協調檢查及呼叫相關系統指令。
Prometheus 指標讓偵測與復原行為可供觀察。工具提供日誌符合事件與服務重啟計數器,便於與其他服務健康訊號一同監控。
我的貢獻與範疇
我將偵測、復原與可觀測性連結成小型工具。由維運者明確設定規則、訊號與觸發門檻,可了解工具觀察到什麼以及採取了什麼行動,並繼續調查根本問題。
這是一款專注於服務日誌的工具;公開原始碼與 README 說明其設定及指標。