使用场景 · VPS 云服务器
小模型 CPU 推理用什么服务器
推荐 远航 8(YH-8),法兰克福节点,月付 $46。下面是需求拆解、可选机房,以及这个场景最容易多花的钱。
推荐配置
YH-8
月付
$46/月
首选机房
法兰克福 255 ms
月流量
16 TB
直接回答
小模型 CPU 推理用什么服务器?
本页讨论的是 CPU 推理 —— 如果你要用显卡跑推理,请直接看 GPU 显卡服务器(/gpu,按小时计费,RTX 4090 起)。CPU 方案的思路是:用 llama.cpp 跑 4-bit 量化的小模型,远航 8(YH-8,8 核 / 16 GB / 320 GB NVMe)月付 46 美元可以带动 7B 级别的模型,节点选法兰克福或洛杉矶。内存决定你能加载多大的模型,核心数决定每秒吐多少 token,两者都不够时调参补不回来。需要更大内存装更大的模型时看磐石 64(DJ-64,16 核 / 64 GB,月付 159 美元);如果场景要求接近实时的交互响应,CPU 推理不是合适的方案,请直接使用带 GPU 的算力平台。
常见搜法:服务器 cpu 跑大模型 推理 7b 够吗 配置
需求拆解
这个场景实际需要多少资源
| 项目 | 要求与理由 |
|---|---|
| CPU | 8 核起;token 生成速度与核心数大致成正比,且受内存带宽限制 |
| 内存 | 16 GB;7B 的 4-bit 量化权重通常约占数 GB,加上上下文缓存后建议留一倍余量 |
| 磁盘 | 320 GB NVMe;模型权重动辄数 GB,多版本共存时增长很快 |
| 延迟预期 | CPU 推理适合批处理与低频调用,不适合逐字流式的交互体验 |
| 硬件说明 | 本页方案基于 CPU;需要显卡请看 GPU 显卡服务器(/gpu) |
选型理由
为什么是 远航 8 配法兰克福
- 批处理类任务(离线摘要、分类、向量化)对单次延迟不敏感,CPU 推理在成本上反而合理。
- 16 GB 内存是运行 7B 级量化模型并留出上下文缓存的现实下限。
- 320 GB NVMe 放得下多个模型权重文件,权重加载速度直接影响冷启动时间。
- 法兰克福单价最低,适合长期常驻的批处理;洛杉矶回程更好,便于从大陆调试。
- 独立服务器磐石 64 提供 64 GB 内存,是不上 GPU 前提下能装下更大模型的唯一路径。
可选机房
这个场景推荐的 3 个机房
| 机房 | 电信 | 联通 | 移动 | 最低延迟 | |
|---|---|---|---|---|---|
| 东京 NRT | CN2 GIA 精品线路 | AS9929 精品线路 | CMI 优化线路 | 62 ms | 选购 → |
| 洛杉矶 LAX | CN2 GIA 精品线路 | AS9929 精品线路 | CMI 优化线路 | 145 ms | 选购 → |
| 法兰克福 FRA 首选 | 163 骨干 普通线路 | AS4837 普通线路 | CMI 普通线路 | 255 ms | 选购 → |
以上机房均可直接下单 远航 8(YH-8)。延迟为中位往返值, 请在 Looking Glass 从你自己的网络实测。
配置误区
这个场景最常见的几种买错
- 以为加核心能换来实时体验:CPU 推理受内存带宽制约,速度提升很快就到顶。
- 不做量化直接加载全精度权重:内存立刻不够,先量化再谈配置。
- 把推理服务和网站放同一台机器:一次推理请求就能把 CPU 吃满,网站随之无响应。
- 为“跑大模型”买最贵的 VPS:没有 GPU 的前提下,超过某个点再加钱的收益极小。
本页的边界
这页不保证什么
- 本页的配置是同类负载的经验值,不是性能承诺。够不够用取决于你的程序、数据量与并发,建议在 7 天退款窗口内用真实负载压一遍。
- 页面上的延迟是中位往返值,晚高峰(北京时间 20:00–24:00)普遍上浮 20–40 ms,这是国际出口的共性,不是单一机房的问题。
- 本页的选型基于 VPS 与独立服务器,它们不带显卡:依赖 CUDA、NVENC 或 QSV 的方案跑不了。需要显卡请看 GPU 显卡服务器(/gpu),按小时计费,RTX 4090 至 H100。
- 法兰克福节点的已知限制:距离中国大陆远,回程走普通国际骨干,延迟 250 ms 以上,不适合面向大陆访客的业务。
相关教程
部署时会用到
安装 Docker 与 Compose,并写第一份 compose.yaml
Docker 的官方仓库安装法适用于 Debian 与 Ubuntu:写入官方 GPG 密钥与 apt 源,再安装 docker-ce 与 docker-compose-plugin,之后用 docker compose(中间是空格,不是连字符)管理服务。端口映射务必写成 127.0.0.1:8080:80 —— 直接写 8080:80 时 Docker 会绕过 ufw,把端口暴露到公网。
入门 · 约 20 分钟
用 Nginx 反向代理后端应用(含 WebSocket 与真实 IP)
反向代理让 Nginx 在 80/443 上接收请求,再转发给只监听 127.0.0.1 的后端应用。关键是四个 proxy_set_header:Host、X-Real-IP、X-Forwarded-For、X-Forwarded-Proto,WebSocket 还需要 Upgrade 与 Connection 两个头。后端只绑回环地址,公网就无法绕过代理直连。
进阶 · 约 20 分钟
给新机器跑分:磁盘、CPU 与网络基准测试
新机器到手先做三项测量:fio 测磁盘随机读写、sysbench 测 CPU、iperf3 或大文件下载测网络带宽。测试时留意 top 里的 %st(steal time)—— 它反映宿主机是否超售,比任何单项跑分更能说明这台机器长期是否稳定。
入门 · 约 20 分钟
用 netdata 做实时监控,并把流量用量看住
netdata 装完即用,秒级采集 CPU、内存、磁盘与网络指标。默认监听 19999 端口,务必改成只绑定 127.0.0.1 并通过 SSH 端口转发访问,否则等于把主机的全部运行细节公开在互联网上。再配一个 vnstat 按月统计流量,就能在超出套餐流量额度之前发现问题。
进阶 · 约 20 分钟
常见问题
关于小模型 CPU 推理
小模型 CPU 推理用什么服务器?
本页讨论的是 CPU 推理 —— 如果你要用显卡跑推理,请直接看 GPU 显卡服务器(/gpu,按小时计费,RTX 4090 起)。CPU 方案的思路是:用 llama.cpp 跑 4-bit 量化的小模型,远航 8(YH-8,8 核 / 16 GB / 320 GB NVMe)月付 46 美元可以带动 7B 级别的模型,节点选法兰克福或洛杉矶。内存决定你能加载多大的模型,核心数决定每秒吐多少 token,两者都不够时调参补不回来。需要更大内存装更大的模型时看磐石 64(DJ-64,16 核 / 64 GB,月付 159 美元);如果场景要求接近实时的交互响应,CPU 推理不是合适的方案,请直接使用带 GPU 的算力平台。
小模型 CPU 推理对 CPU、内存和磁盘的要求分别是什么?
CPU:8 核起;token 生成速度与核心数大致成正比,且受内存带宽限制。内存:16 GB;7B 的 4-bit 量化权重通常约占数 GB,加上上下文缓存后建议留一倍余量。磁盘:320 GB NVMe;模型权重动辄数 GB,多版本共存时增长很快。延迟预期:CPU 推理适合批处理与低频调用,不适合逐字流式的交互体验。硬件说明:本页方案基于 CPU;需要显卡请看 GPU 显卡服务器(/gpu)。
小模型 CPU 推理应该放在哪个机房?
推荐法兰克福、洛杉矶、东京,远航 8(YH-8)在这几个机房都可以直接下单。首选法兰克福(FRA),电信走163 骨干(约 265 ms)、联通走AS4837(约 255 ms)、移动走CMI(约 280 ms)。距离中国大陆远,回程走普通国际骨干,延迟 250 ms 以上,不适合面向大陆访客的业务。
小模型 CPU 推理最容易买错什么?
以为加核心能换来实时体验:CPU 推理受内存带宽制约,速度提升很快就到顶。 不做量化直接加载全精度权重:内存立刻不够,先量化再谈配置。
你们用 KVM 还是 OpenVZ?为什么这很重要?
VPS(轻装、远航)与大容量存储机型(巨舱)全部使用 KVM,没有 OpenVZ 机型;独立服务器(磐石)不涉及虚拟化,交付的是整台物理机,没有宿主层,也没有邻居。KVM 是完整的硬件虚拟化,每台实例有独立内核,可以自行更换内核、加载模块、调整内核参数、跑 Docker 与嵌套虚拟化,内存也是真实分配而不是共享统计出来的。OpenVZ 共享宿主内核,无法自定义内核,宿主还能严重超售内存,“标称 4 GB 实际抢不到”是这类机型最常见的抱怨。无论虚拟机还是物理机,你都拥有完整 root 权限,我们不会在实例内部安装任何监控代理。
提供哪些操作系统?能装 Windows 吗?
面板内置 Debian 12 与 13、Ubuntu 22.04 LTS 与 24.04 LTS、Rocky Linux 9、AlmaLinux 9、Fedora 41、Alpine Linux 3.20 以及 Arch Linux,一键重装,几分钟完成。Windows Server 2022 可以安装,但需要额外授权,且对内存有实际要求:1 GB 的轻装 1 跑不动,建议至少从 远航 2 起步。重装会清空磁盘上的全部数据,执行前请确认已经备份。
可以升级 CPU、内存或磁盘吗?能降配吗?
可以升级:在面板中选择更高一档的机型,补足差价后重启生效,数据保留。磁盘只能扩大不能缩小,这是文件系统层面的限制而不是计费策略;因此降配只有在目标机型磁盘不小于当前已分配磁盘时才能直接完成,否则需要重装。跨机房迁移相当于新开一台机器再迁数据,IP 会变化,请提前规划 DNS 与相关配置。
注册和下单需要实名认证吗?
不需要。安云主机 只要求一个能收信的邮箱地址,用于发送开通信息、到期提醒和工单通知,不索取身份证、护照、手机号或人脸验证。服务器全部位于中国大陆境外,因此不涉及 ICP 备案与实名登记流程,这是境外机房的常规做法而不是特殊待遇。需要说清楚的是,免实名指的是我们不收集你的身份信息,不等于服务器上的行为不受机房所在地法律约束。