跳到主要内容
注册无需实名认证
安云主机 AnYun VPS

术语表 · GPU 与算力

算力

Compute Power (FLOPS)

又写作

suanliFLOPSTFLOPS浮点算力算力租赁

要点

什么是算力?

算力指 GPU 每秒能完成的浮点运算次数,通常以 TFLOPS 标注,它决定模型跑得多快;算力与显存是两个互不替代的维度——显存决定能不能跑,算力决定跑得快不快。

在中文语境里,「算力」也被用作整台机器计算资源的统称,「算力租赁」就是按小时租用 GPU 服务器这门生意的通称。两种用法都常见,看上下文区分即可。

比较标称算力时有一个前提经常被忽略:数字只在同一精度下可比。同一张卡的 FP32、FP16/BF16、FP8、INT8 算力可以相差数倍,带稀疏加速的标称值又比稠密值高一档。把不同精度的数字并排比较,得出的结论没有意义。

还有一个实践上的反直觉之处:大模型推理很多时候受限于显存带宽而不是算力,也就是所谓 memory-bound。这解释了为什么换一张算力高得多的卡,推理速度却没有按比例提升。

常见误解

产品页上的 TFLOPS 是理论峰值,真实吞吐取决于模型、批大小、框架版本与卡间互联,通常达不到峰值。要判断一张卡对你的任务够不够,跑一次你自己的真实负载比看任何标称数字都准。

相关术语

和「算力」一起看 4 条

显存 VRAM (Video Memory)

显存是显卡上独立于系统内存的高速存储,模型权重、激活值与缓存都必须放进显存,因此显存容量决定一块 GPU 能不能跑某个模型——放不下就完全跑不起来,而算力不足只是跑得慢。

推理 Inference

推理指用已经训练好的模型产生结果的过程——生成文本、出图、语音转写、目标检测都属于推理,它是 GPU 租用中最常见的用途,显存要求由模型大小决定,速度要求由并发量决定。

NVLink NVLink Interconnect

NVLink 是 NVIDIA 的显卡间高速互联通道,带宽显著高于 PCIe,作用是让多张卡在切分同一个模型时快速交换中间结果;消费级的 RTX 4090 与 5090 不提供 NVLink,专业卡与数据中心卡才有。

大模型 Large Language Model (LLM)

大模型是参数量在十亿级以上的深度学习模型的统称,中文语境下通常特指大语言模型(LLM);模型名字里的 7B、13B、70B 指的就是参数量,它直接决定了运行所需的显存。

联系 工单
扫码
手机访问

扫码在手机上打开