结论:主机层用 Node Exporter + Prometheus + Grafana,应用层再补一个存活检测,两层结合基本够用。
① 先装 node_exporter 采集 CPU、内存、磁盘、网络,Prometheus 定时拉取,Grafana 做面板,重点盯磁盘使用率和负载,论坛挂掉十有八九是磁盘满了或数据库拖垮的。
② 应用层用 Uptime Kuma 或黑盒探测,每分钟请求一次首页和登录接口,返回码不是 200 或超时就告警,能第一时间发现 PHP 进程假死这种主机指标看不出来的问题。
③ 告警走钉钉、飞书或邮件都行,但阈值别设太敏感,CPU 偶尔冲高是正常的,建议连续 5 分钟超过 85% 再报,否则告警疲劳后没人看。
④ 日志也要监控,用 Loki 或简单的日志轮转加关键字告警,比如 error、Fatal 出现频率突增,往往比指标更早暴露问题。