给小服务加监控:Prometheus + Grafana 最小上手
不用一上来就搞整套可观测性。先用 client 库暴露 /metrics,Prometheus 定时抓取,Grafana 画 QPS、延迟 P99、错误率三张图,就能覆盖 80% 的「服务到底健不健康」问题。
后端开发 · Linux 运维 · 网络协议 · 数据库 · 容器与自动化,偶尔写点折腾笔记。
不用一上来就搞整套可观测性。先用 client 库暴露 /metrics,Prometheus 定时抓取,Grafana 画 QPS、延迟 P99、错误率三张图,就能覆盖 80% 的「服务到底健不健康」问题。
默认 shell 遇到错误会继续往下跑,变量拼错变成空字符串,管道中间失败还发现不了。加上 set -e(出错即退)、-u(未定义变量报错)、-o pipefail(管道任一段失败即失败),能挡掉大量运维事故。