使用场景 · VPS 云服务器
监控与告警用什么 VPS
推荐 远航 2(YH-2),洛杉矶节点,月付 $12。下面是需求拆解、可选机房,以及这个场景最容易多花的钱。
推荐配置
YH-2
月付
$12/月
首选机房
洛杉矶 145 ms
月流量
4 TB
直接回答
监控与告警用什么 VPS?
Prometheus + Grafana + Alertmanager 监控几十个目标,远航 2(YH-2,2 核 / 4 GB / 80 GB NVMe)月付 12 美元够用,节点选洛杉矶或法兰克福。最重要的一条与配置无关:监控机必须放在被监控系统之外,最好是另一个机房——放在同一台机器上,机器挂了告警也一起挂,你会从客户那里得知故障。数据保留期是磁盘杀手,默认 15 天没问题,改成 180 天之前先按每条时间序列的字节数算一遍。
常见搜法:prometheus grafana 监控服务器 配置 推荐
需求拆解
这个场景实际需要多少资源
| 项目 | 要求与理由 |
|---|---|
| CPU | 2 核;查询面板与告警评估是主要消耗,采集本身很轻 |
| 内存 | 4 GB;Prometheus 的内存占用随活跃时间序列数量线性增长 |
| 磁盘 | 80 GB NVMe;保留期每延长一倍,磁盘需求就翻一倍 |
| 位置 | 与被监控系统不同机房,避免同一故障域 |
| 告警通道 | 至少两条互不依赖的通道,其中一条不应依赖被监控的网络 |
选型理由
为什么是 远航 2 配洛杉矶
- 监控系统的负载是稳定的小写入,2 核 4 GB 能覆盖几十台机器的指标采集。
- 80 GB NVMe 的随机写性能对时序数据库友好,机械盘在压缩合并时会明显拖慢。
- 把监控放在与生产不同的机房,是“告警系统本身不能与故障共存”的唯一实现方式。
- 洛杉矶回程好,便于从大陆随时打开面板查看;法兰克福价格更低,适合纯后台的长期保留。
- 月付即可,监控机不需要跟随生产环境的采购周期。
可选机房
这个场景推荐的 3 个机房
| 机房 | 电信 | 联通 | 移动 | 最低延迟 | |
|---|---|---|---|---|---|
| 香港 HKG | CN2 GIA 精品线路 | AS9929 精品线路 | CMI 精品线路 | 38 ms | 选购 → |
| 洛杉矶 LAX 首选 | CN2 GIA 精品线路 | AS9929 精品线路 | CMI 优化线路 | 145 ms | 选购 → |
| 法兰克福 FRA | 163 骨干 普通线路 | AS4837 普通线路 | CMI 普通线路 | 255 ms | 选购 → |
以上机房均可直接下单 远航 2(YH-2)。延迟为中位往返值, 请在 Looking Glass 从你自己的网络实测。
配置误区
这个场景最常见的几种买错
- 把监控装在生产机器上:宿主宕机时监控与告警一起消失,等于没有监控。
- 把保留期直接设成一年:时序数据的增长是线性的,磁盘写满时 Prometheus 会静默停止写入。
- 只配告警不配静默规则:维护窗口里刷屏的告警会让人学会忽略所有告警。
- 监控了 CPU 与内存却没监控磁盘剩余空间与证书有效期——这两项才是最常见的真实故障。
- 告警只发一个渠道,而那个渠道恰好托管在被监控的服务器上。
本页的边界
这页不保证什么
- 本页的配置是同类负载的经验值,不是性能承诺。够不够用取决于你的程序、数据量与并发,建议在 7 天退款窗口内用真实负载压一遍。
- 页面上的延迟是中位往返值,晚高峰(北京时间 20:00–24:00)普遍上浮 20–40 ms,这是国际出口的共性,不是单一机房的问题。
- 本页的选型基于 VPS 与独立服务器,它们不带显卡:依赖 CUDA、NVENC 或 QSV 的方案跑不了。需要显卡请看 GPU 显卡服务器(/gpu),按小时计费,RTX 4090 至 H100。
- 洛杉矶节点的已知限制:距离欧洲用户较远,若主要访客在欧洲请选择法兰克福或阿姆斯特丹。
相关教程
部署时会用到
用 netdata 做实时监控,并把流量用量看住
netdata 装完即用,秒级采集 CPU、内存、磁盘与网络指标。默认监听 19999 端口,务必改成只绑定 127.0.0.1 并通过 SSH 端口转发访问,否则等于把主机的全部运行细节公开在互联网上。再配一个 vnstat 按月统计流量,就能在超出套餐流量额度之前发现问题。
进阶 · 约 20 分钟
安装 Docker 与 Compose,并写第一份 compose.yaml
Docker 的官方仓库安装法适用于 Debian 与 Ubuntu:写入官方 GPG 密钥与 apt 源,再安装 docker-ce 与 docker-compose-plugin,之后用 docker compose(中间是空格,不是连字符)管理服务。端口映射务必写成 127.0.0.1:8080:80 —— 直接写 8080:80 时 Docker 会绕过 ufw,把端口暴露到公网。
入门 · 约 20 分钟
用 Nginx 反向代理后端应用(含 WebSocket 与真实 IP)
反向代理让 Nginx 在 80/443 上接收请求,再转发给只监听 127.0.0.1 的后端应用。关键是四个 proxy_set_header:Host、X-Real-IP、X-Forwarded-For、X-Forwarded-Proto,WebSocket 还需要 Upgrade 与 Connection 两个头。后端只绑回环地址,公网就无法绕过代理直连。
进阶 · 约 20 分钟
线路慢在哪一跳:用 mtr 诊断三网回程
判断跨境线路问题要分清去程与回程:去程是从中国大陆的机器 mtr 到服务器 IP,回程是从服务器 mtr 到大陆的 IP,两个方向常常走完全不同的路径,只测一个方向得出的结论多半是错的。mtr -zbrw 会同时打印 AS 号与主机名,据此可以判断回程走的是电信 CN2、联通 AS9929 还是移动 CMI。
高级 · 约 25 分钟
常见问题
关于监控与告警
监控与告警用什么 VPS?
Prometheus + Grafana + Alertmanager 监控几十个目标,远航 2(YH-2,2 核 / 4 GB / 80 GB NVMe)月付 12 美元够用,节点选洛杉矶或法兰克福。最重要的一条与配置无关:监控机必须放在被监控系统之外,最好是另一个机房——放在同一台机器上,机器挂了告警也一起挂,你会从客户那里得知故障。数据保留期是磁盘杀手,默认 15 天没问题,改成 180 天之前先按每条时间序列的字节数算一遍。
监控与告警对 CPU、内存和磁盘的要求分别是什么?
CPU:2 核;查询面板与告警评估是主要消耗,采集本身很轻。内存:4 GB;Prometheus 的内存占用随活跃时间序列数量线性增长。磁盘:80 GB NVMe;保留期每延长一倍,磁盘需求就翻一倍。位置:与被监控系统不同机房,避免同一故障域。告警通道:至少两条互不依赖的通道,其中一条不应依赖被监控的网络。
监控与告警应该放在哪个机房?
推荐洛杉矶、法兰克福、香港,远航 2(YH-2)在这几个机房都可以直接下单。首选洛杉矶(LAX),电信走CN2 GIA(约 145 ms)、联通走AS9929(约 152 ms)、移动走CMI(约 168 ms)。距离欧洲用户较远,若主要访客在欧洲请选择法兰克福或阿姆斯特丹。
监控与告警最容易买错什么?
把监控装在生产机器上:宿主宕机时监控与告警一起消失,等于没有监控。 把保留期直接设成一年:时序数据的增长是线性的,磁盘写满时 Prometheus 会静默停止写入。
有快照吗?快照等于备份吗?
提供快照,可以在升级配置、换内核或大改服务前做一次,出问题直接回滚,具体可保留的数量以面板显示为准。但必须说清楚:快照不是备份。快照与你的实例存放在同一套存储、同一个机房,宿主级故障会同时带走两者,账户被暂停时你也拿不到它。真正的备份意味着数据在另一台机器、另一个机房;用巨舱系列的大容量机型作为异地备份目标是常见做法,成本远低于丢数据。
面向中国大陆访客,应该选哪个机房?
按三网延迟从低到高:香港最优,电信 CN2 GIA、联通 AS9929、移动 CMI 均在 50 ms 以内,代价是带宽贵、同价位流量额度少、热门配置常年紧张;其次是首尔(联通方向极佳,适合北方用户)与东京(三网均衡,带宽比香港便宜);洛杉矶电信方向约 145 ms,胜在价格、流量额度与美国原生 IP,是建站的常见默认选择。法兰克福、阿姆斯特丹、伦敦对大陆延迟都在 250 ms 以上,只适合面向欧洲的访客或大容量存储用途。服务器在境外,因此不需要 ICP 备案。
流量额度用完会怎样?
每台机型带固定的月流量额度(例如 远航 2 为 4 TB,巨舱 4 为 30 TB),按月重置,重置日为开通日。额度用尽不会产生意外账单:端口会被限速或暂停出网,你可以购买追加流量,或等待下一个周期自动恢复。计量方式(单向或双向)以订单页标注为准。香港节点带宽成本高,同价位的流量额度明显低于美国与欧洲节点,这是港区的固有代价,不是我们在克扣。