GPU卡全解析:国际厂商 vs 国产厂商,选型指南看这篇就够了
一块 H100 GPU,现在多少钱?答案是——30 万人民币起步。而且有钱还不一定能买到。这就是 2026 年 AI 时代的残酷现实。
你可能听说过"算力就是新石油"这句话。但我想告诉你的是:算力不是石油,石油你还能囤着,算力买到手就开始贬值。因为 AI 模型越来越大,GPU 更新换代的速度远超你的想象——去年买的 A100,今年就变成"上一代"了。
但更让人头疼的不是贵,而是选错。我见过太多团队花了冤枉钱:训练用错了卡,推理效率低得可怜;或者图便宜买了"性价比神卡",结果连模型都跑不起来。今天这篇文章,就是来解决这个问题的。
我会从以下几个维度彻底讲透 GPU 选型:国际厂商 vs 国产厂商、训练 vs 推理、大卡 vs 小卡、量化技术、集群部署……最后还会给你一张选型决策表,让你对号入座。
准备好了吗?我们开始。
一、GPU市场格局:为什么一块显卡比黄金还贵?
要理解 GPU 为什么这么贵,你得先明白 AI 训练到底在干什么。
想象一下你在教一个学生参加考试。传统编程是你直接给他一本《五年高考三年模拟》,告诉他"看到这个题型就套这个公式"。但 AI 训练不是——你是给他喂了 1000 万道题目和答案,让他自己去找规律。
这个"找规律"的过程,就是矩阵乘法。而 GPU,恰恰是世界上做矩阵乘法最快的东西。
CPU 就像一个大学教授,一个问题一个问题地处理,擅长复杂的逻辑推理。GPU 则像是一万个小学生,每人算一点点,最后汇总结果。一个教授再聪明,也不如一万个小学生同时算加减乘除快——这就是为什么深度学习必须用 GPU。
2023 年之前,这个市场几乎是 NVIDIA 的一言堂。AMD 只能在旁边喝汤,Intel 更是连汤都喝不上。但 2022 年的出口管制彻底改变了游戏规则——中国无法获得高端 AI 芯片,这反而催生了国产 GPU 的黄金时代。
现在的格局是:国际厂商(NVIDIA/AMD/Intel)+ 国产厂商(华为昇腾/海光/燧原/摩尔线程),两大阵营正在激烈交锋。到底选哪个?看完这篇文章你就有答案。
二、国际厂商三剑客:NVIDIA、AMD、Intel
先说国际厂商。如果你没有被"卡脖子"的问题,国际厂商依然是首选。原因很简单——生态太完善了。CUDA 这个东西,真是 NVIDIA 的"核武器"。
1. NVIDIA:绝对霸主,但越来越贵
NVIDIA 在 AI 领域的地位,某种程度上比 Apple 在手机领域还要稳。因为它不是卖硬件的,它是卖完整生态的。
CUDA——这个让无数开发者又爱又恨的东西,是 NVIDIA 的护城河。全球 95% 以上的 AI 框架、模型、工具,都是基于 CUDA 开发的。你说换个 GPU?先问问这些框架答不答应。
来,看看 NVIDIA 当前的 产品线:
| 型号 | 显存 | 算力 (FP32) | 适用场景 | 参考价格 |
|---|---|---|---|---|
| H100 | 80GB HBM3 | 51 TFLOPS | 大规模训练旗舰 | ¥30万+ |
| H200 | 141GB HBM3e | 51 TFLOPS | 大模型训练 | ¥40万+ |
| A100 | 40/80GB HBM2 | 19.5 TFLOPS | 训练/推理主力 | ¥15万+ |
| A6000 | 48GB GDDR6 | 38.7 TFLOPS | 可视化/中小训练 | ¥6万+ |
| L40S | 48GB GDDR6 | 46 TFLOPS | 推理/推理+训练 | ¥5万+ |
| RTX 4090 | 24GB GDDR6X | 82.6 TFLOPS | 个人开发者/小规模 | ¥2万+ |
H100 为什么这么强?两个关键技术创新:Transformer Engine(专门加速 Transformer 模型)+ NVLink(超高速卡间互联,后面会详细说)。可以说,H100 就是为 LLM 量身定制的"核弹"。
2. AMD:性价比之选,但生态是硬伤
AMD 的 GPU,论技术指标其实不差。MI300X 的 HBM3E 显存高达 192GB,比 H200 还能打。但为什么卖不过 NVIDIA?
答案就两个字:生态。
ROCm 是 AMD 的计算平台,但说实话,用起来比 CUDA 难受太多。PyTorch 支持不稳定,TensorFlow 更是基本不支持。很多模型你得自己手动调优,有时候为了跑通一个开源项目,要花比在 NVIDIA 上多 3 倍的时间。
| 型号 | 显存 | 算力 (FP32) | 优势 | 劣势 |
|---|---|---|---|---|
| MI300X | 192GB HBM3E | 163 TFLOPS | 显存大、价格相对便宜 | 生态弱、驱动不稳定 |
| MI250X | 128GB HBM2e | 95.7 TFLOPS | 性价比尚可 | 生态较弱 |
我的建议是:如果你预算有限,且有耐心折腾,AMD MI300X 可以考虑。但如果你要的是稳定产出,还是老实用 NVIDIA 吧。
3. Intel:数据中心的新玩家
Intel 进军 GPU 市场的故事挺有意思。之前它一直做 CPU,AI 浪潮来了之后,发现自己的 Xe 架构可以改造成 GPU。
Gaudi 系列是 Intel 的 AI 加速器。Gaudi 3 的纸面数据很漂亮——BF16 算力 1835 TFLOPS,比 H100 还高。但实际性能嘛……
Intel 的优势是价格和CPU 协同。如果你已经是 Intel 系的服务器,买 Gaudi 可以降低运维复杂度。但对于大多数团队,我的建议是:等 Intel 生态成熟了再说。
小结国际厂商:NVIDIA 是绝对首选,有预算无脑上;AMD 适合预算有限且愿意折腾的;Intel 暂时观望。
三、国产厂商崛起:华为昇腾、海光、燧原、摩尔线程
如果说国际厂商是"富二代",那国产厂商就是"创业者"——起点低、起步晚,但增长速度惊人。
2022 年的出口管制让中国无法购买 A100、H100 等高端芯片,但这反而成了国产 GPU 的"神助攻"。政府投钱、市场有需求、厂商有动力——天时地利人和全占了。
1. 华为昇腾:国产一哥
昇腾(Ascend)是华为的 AI 计算品牌。910B 是目前最成熟的国产 AI 芯片,没有之一。
| 型号 | 显存 | 算力 (FP16) | 生态 | 特点 |
|---|---|---|---|---|
| Ascend 910B | 64GB HBM | 400 TFLOPS | CANN + MindSpore | 国产最强,生态较完善 |
| Ascend 910A | 32GB HBM | 256 TFLOPS | CANN + MindSpore | 910B 降配版 |
昇腾的最大优势是生态。华为自己做了完整的软件栈:CANN(异构计算架构)+ MindSpore(深度学习框架)+ ModelArts(云平台)。虽然跟 CUDA 比还有差距,但已经能跑通大多数主流模型了。
但昇腾也有硬伤:产能。由于被制裁,华为的芯片产能一直上不去。有时候你有钱也买不到,这是最头疼的。
2. 海光:兼容 CUDA 的务实派
海光(Hygon)可能是最"聪明"的国产厂商。它的策略是——兼容 CUDA。
海光 DCU 深算系列基于 AMD 的 CDNA 架构(当年 AMD 授权的技术),所以理论上可以跑 CUDA 程序。虽然性能跟 AMD 原厂有差距,但迁移成本低啊!
| 型号 | 显存 | 算力 (FP32) | 特点 |
|---|---|---|---|
| DCU Z100 | 64GB HBM2 | 22 TFLOPS | 兼容 CUDA,生态较好 | 32GB HBM2 | 11 TFLOPS | 性价比版 |
海光的目标用户是——不想重写代码的团队。买一块海光卡,把代码从 A100 迁移过来,改动量可能是最小的。
3. 燧原:专注训练的低调玩家
燧原(Enflame)是这几个厂商里最"专注"的——它只做 AI 训练芯片,不碰其他业务。
云燧 T20/T21 是他们的旗舰产品。虽然纸面数据不如昇腾,但稳定性和功耗控制做得不错。
4. 摩尔线程:全功能 GPU 的野心家
摩尔线程(Moore Threads)是这几家里最年轻的,但也最野心勃勃。它不只想做 AI 芯片,还想做真正的 GPU——既能跑 AI,又能玩游戏、做渲染。
MTT X400 是他们的 AI 加速卡,定位有点类似 NVIDIA 的 A100。但说实话,现在还处于"追赶者"阶段,软件生态还需要时间完善。
小结国产厂商:昇腾是综合最强的,海光是最务实的(兼容 CUDA),燧原是专注训练的,摩尔线程是潜力股但尚需时日。
四、训练 vs 推理:场景不同,GPU选择大不同
很多人以为 GPU 就是 GPU,其实训练和推理对 GPU 的需求完全不同。这就像跑车和卡车都是车,但设计理念完全不同——一个追求速度,一个追求载重。
训练:烧显存就是烧钱
训练是一个"反向传播"的过程。简单说,就是模型看完数据后说"我猜错了",然后所有参数都调整一点。这个过程需要:
- 巨大的显存:模型参数、梯度、优化器状态都要放在显存里。70B 的模型,光参数就要 140GB 显存(FP16),加上梯度、优化器状态,没 200GB 根本跑不起来。
- 高速互联:多卡训练时,卡之间要频繁同步数据。NVLink 是刚需。
- 长时间稳定运行:训练一个大模型可能要跑几周甚至几个月,稳定性比性能更重要。
推理:响应速度是生命线
推理是"正向传播"——模型已经训练好了,输入数据直接出结果。跟训练完全不同:
- 显存要求低:只存模型参数,不需要梯度。7B 模型 FP16 只要 14GB。
- 延迟要求高:用户输入一个 query,你要在几百毫秒内返回结果。
- 吞吐量重要:一个模型服务成千上万的用户,并发能力决定成本。
推理场景的性价比之王是 L40S 或者 RTX 4090(个人开发者)。国产的昇腾、海光做推理也完全没问题。
| 场景 | 推荐 GPU | 关键指标 | 理由 |
|---|---|---|---|
| 大模型训练 (70B+) | H100/H200 | 显存>80GB, NVLink | Transformer Engine 加速 |
| 中模型训练 (7B-70B) | A100 80GB | 80GB HBM2e | 性价比最优 |
| 小模型训练 (<7B) | A100 40GB / RTX 4090 | 40GB+ 显存 | 够用即可 |
| 大规模推理 | L40S / H100 | INT8 性能 | 吞吐量大 |
| 中小规模推理 | RTX 4090 / 昇腾 910B | 算力/价格比 | 成本优先 |
这里有个关键概念——Batch Size。训练时你希望 batch 越大越好(收敛更快),但推理时 batch 可以很小(甚至 1),追求的是延迟。理解这一点,你就知道为什么训练和推理的 GPU 选型逻辑完全不同了。
五、大卡 vs 小卡:什么时候该上"核弹"?
"大卡"和"小卡"的区别,不只是显存大小,而是计算架构的差异。
大卡(H100、A100、昇腾 910B)用的是 HBM(High Bandwidth Memory)——这种显存直接封装在 GPU 芯片旁边,带宽能达到 2TB/s 以上。小卡(RTX 4090、L40S)用的是 GDDR,带宽只有 HBM 的 1/3 到 1/4。
但 GDDR 便宜啊!这就是为什么 L40S 性价比高的原因——用相对低价的 GDDR,达到了 HBM 80% 的性能,价格却只要 1/3。
什么时候选大卡?
- 模型太大:70B 以上的模型,FP16 就要 140GB 显存,小卡根本装不下。
- 多卡训练:NVLink 只能在 H 系列/A 系列上用,小卡只能用 PCIe,互联带宽差 5-10 倍。
- 延迟敏感:H100 的 Transformer Engine 对 Transformer 模型有特殊加速,推理延迟可以降低 2-3 倍。
什么时候选小卡?
- 预算有限:L40S 只要 5 万,A100 要 15 万,性能差距没那么大。
- 模型较小:7B、13B 的模型,24GB 显存完全够用。
- 推理为主:推理对显存带宽要求没训练那么高,小卡完全够用。
我的经验公式:显存需求 ≈ 模型参数 × 4(FP16 下)。7B 模型需要 28GB,13B 需要 52GB,70B 需要 280GB——70B 就必须上多卡了。
六、量化部署:INT8、FP16、FP8 带来的成本革命
如果你觉得 GPU 太贵,有一个办法可以让你用同样的卡跑更大的模型——这就是量化。
量化本质上是用精度换显存。就像照片压缩——从 RAW 变成 JPEG,画面质量稍有损失,但文件大小小了几十倍。模型量化后,参数从 32 位浮点(FP32)变成 16 位(FP16)、8 位(INT8)甚至 4 位(INT4)。
主流量化精度对比
| 精度 | 显存占用 | 性能损失 | 适用场景 | 支持 GPU |
|---|---|---|---|---|
| FP32 (全精度) | 1x | 无 | 训练/高精度推理 | 所有 |
| FP16 (半精度) | 1/2x | 极小 | 训练/推理通用 | 所有 |
| BF16 | 1/2x | 比 FP16 更稳定 | 训练首选 | H100/A100/昇腾 |
| FP8 | 1/4x | 可接受 | H100 推理 | H100/H200 |
| INT8 | 1/4x | 5-10% | 推理首选 | 所有 |
| INT4 | 1/8x | 10-20% | 大模型推理 | 部分支持 |
不同量化格式对 GPU 的影响
FP16:所有现代 GPU 都支持,性能损失几乎为零。训练和推理都可以用,是现在的默认选择。
BF16:Google 提出的格式,比 FP16 更"安全"——FP16 的动态范围窄,训练时容易溢出。BF16 增加了指数位,解决了这个问题。H100 和昇腾 910B 都原生支持 BF16。
FP8:NVIDIA H100 独占的格式。它把精度做到 8 位,但用特殊的表示方法让它能达到接近 FP16 的效果。这是 H100 最大的技术优势之一。
INT8/INT4:这是"有损压缩",需要专门的 Tensor Core 加速。所有 Tensor Core GPU 都支持 INT8,但 INT4 的支持比较有限。
量化带来的选型启示:买能支持更多量化格式的 GPU,就是买未来。H100 支持 FP8,这是一个巨大的优势。国产 GPU 里,昇腾 910B 对 BF16 的支持也比较完善。
七、集群部署:NVLink、PCIe、多卡互联那些事儿
当一块 GPU 不够用的时候,你就要考虑多卡集群。这时候,显卡之间的互联方式就变得至关重要。
NVLink:卡间互联的"高速公路"
NVLink 是 NVIDIA 的私有协议,带宽能达到 900GB/s(H100 的第四代 NVLink)。这是什么概念?PCIe 5.0 x16 只有 128GB/s,NVLink 是它的 7 倍。
为什么带宽这么重要?因为多卡训练时,卡之间要频繁同步梯度。一个 70B 的模型,一次前向传播产生的梯度数据是巨大的——如果带宽不够,卡就在"等数据",利用率上不去。
NVSwitch:8 卡全互联
NVLink 解决了"两卡互联"的问题,但如果要 8 卡全互联呢?这时候就需要 NVSwitch——一个类似"交换机"的东西,让 8 块 H100 可以两两之间都以 900GB/s 带宽通信。
DGX H100 服务器就是用了 8 块 H100 + NVSwitch。这东西是"富人的玩具",一台服务器要 200 多万。但对于大模型训练来说,这是必需品。
国产集群方案
国产厂商也在做自己的互联方案。华为的 HCCS(华为集合通信库)+ 超节点,海光的 HDC,都在试图解决多卡互联问题。但客观说,跟 NVIDIA 的 NVLink/NVSwitch 比,还有代际差距。
集群选型建议
- 8 卡以内:有 NVLink 上 NVLink,没有就用 PCIe 凑合(会有性能损失)
- 8 卡以上:必须上 NVSwitch,或者用 InfiniBand 互联
- 国产方案:华为昇腾超节点是目前最成熟的国产集群方案
八、选型总结:一张表帮你做决定
好,铺垫了这么多,是时候给出选型决策表了。对号入座,看看你的场景应该选什么卡。
| 你的场景 | 推荐 GPU | 预算参考 | 备注 |
|---|---|---|---|
| 大模型训练 (70B+) | H100 80GB x 8 + NVSwitch | ¥200万+ | Transformer Engine 加速 |
| 中模型训练 (7B-70B) | A100 80GB x 8 | ¥120万+ | 性价比最优 |
| 小模型训练 (<7B) | A100 40GB / RTX 4090 | ¥5-15万 | 单卡或双卡 |
| 大规模推理 (API服务) | H100 / L40S | ¥5-30万 | INT8/FP8 优化 |
| 小规模推理 (自用) | RTX 4090 / 昇腾 910B | ¥2-6万 | 个人开发者首选 |
| 国产替代/自主可控 | 昇腾 910B / 海光 DCU | ¥10-20万 | 生态逐步完善 |
| 预算极其有限 | RTX 4090 x 4 | ¥10万 | 消费级卡集群 |
最后说几点我的肺腑之言:
- 别超前消费:GPU 贬值速度超乎你的想象。今年买的 H100,明年可能就变成"上一代"。够用就好。
- 先小后大:从小规模开始跑通,再逐步扩展。大规模采购前,先租云资源验证。
- 关注生态:买卡只是开始,驱动、框架、优化、运维都是成本。NVIDIA 的贵,有一部分是贵在生态上。
- 考虑量化:同样的卡,量化后能跑大一倍的模型。这是性价比最高的"升级"方式。
GPU 选型没有标准答案,只有适合不适合。希望这篇文章能帮你做出更明智的选择。
如果还有具体问题,欢迎评论区聊。