先说结论:站点监控至少要覆盖四层:用户能否访问、页面/API是否正确、服务器资源是否健康、备份和证书等关键任务是否成功。新手不需要一开始搭建复杂平台,但必须做到“故障发生后几分钟内有人收到可行动的告警”,而不是等客户反馈网站打不开。

监控分四层
| 层级 | 监控对象 | 关键指标 |
|---|---|---|
| 外部可用性 | 首页、登录、关键接口 | 状态码、响应时间、证书和DNS |
| 应用 | Web、API、队列、数据库 | 错误率、P95、吞吐、慢查询和积压 |
| 主机 | CPU、内存、磁盘、网络 | 负载、可用内存、IO、空间、连接和流量 |
| 关键任务 | 备份、同步、证书、定时任务 | 成功时间、持续时间、恢复验证和到期日 |
第一阶段:先做最小可用监控
- 每1至5分钟从服务器外部访问首页和一个关键URL;
- 验证期望状态码和页面关键字,避免只收到“200空白页”;
- 监控HTTPS证书剩余天数和DNS解析;
- 在主机监控CPU、内存、磁盘空间和服务状态;
- 备份任务每次成功或失败都上报;
- 告警发送到至少两个可用渠道,并明确责任人。
告警阈值怎么设置?
阈值需要结合基线,而不是照抄一个百分比。可以从下面的初始规则开始观察并调整:
- 外部探测连续2至3次失败才触发严重告警,减少单点网络误报;
- 磁盘使用率达到70%预警、85%严重,同时监控增长速度;
- CPU、内存和IO应要求持续数分钟并结合业务响应;
- API同时监控错误率和P95,不只看平均响应;
- 备份超过预期时间未成功,必须告警;
- 证书提前30天提醒,避免自动续期失败后才发现。

网站只监控首页够吗?
不够。首页静态缓存可能正常,但登录、搜索、表单、支付回调或API已经失败。至少选择一条代表核心业务的低风险合成检查:
- 企业官网:主页、联系表单测试和证书;
- 内容站:主页、文章页、搜索和数据库连接;
- SaaS/API:健康检查、登录依赖、核心只读接口;
- 电商:商品页、购物车、库存接口和支付回调健康状态。
自动检查不要真实扣款、发送垃圾表单或修改生产数据,应使用专用测试账号和可清理数据。
主机指标怎么判断?
- CPU:看持续使用率、负载与虚拟机steal;
- 内存:看可用内存、Swap、OOM和进程趋势;
- 磁盘:看空间、inode、IO等待、延迟与错误;
- 网络:看带宽、连接数、重传和异常出站;
- 进程:看Web、数据库、队列和监控代理是否运行。
服务器卡顿时可结合终端、网络、主机和应用四层诊断定位。
告警消息必须可行动
一条有效告警应包含:发生时间、环境、主机或URL、指标当前值、持续时间、最近变更、仪表盘或日志入口、值班人和初步处置步骤。只写“CPU高”会让处理者重新调查上下文。
避免告警疲劳
- 合并同一根因造成的多个告警;
- 使用持续时间和连续失败过滤瞬时波动;
- 预警与严重告警使用不同渠道;
- 每月删除无人处理、无行动价值的规则;
- 变更或维护窗口要有静默,但结束后自动恢复。
备份监控不能只看“任务成功”
还要检查备份大小是否异常、是否包含数据库和上传文件、是否能在隔离环境恢复,以及恢复时间是否满足目标。快照与生产位于同一账号或区域时,还应保留独立副本。长期运维可参考备份、监控和变更管理方案。
30天落地计划
- 第1周:外部HTTP、证书、CPU、内存和磁盘告警;
- 第2周:加入应用错误率、API P95、数据库和备份任务;
- 第3周:编写每类告警的处置手册和升级联系人;
- 第4周:模拟站点停止、磁盘阈值和备份失败,验证告警与恢复。
监控数据也用于判断是否真的需要升配。按升配前检查清单确认瓶颈后,再在萤光云VPS节点与套餐评估扩容或迁移;不要用升配掩盖应用和数据库问题。







