TECH ARTICLES
GPU AI 硬件选型

GPU卡全解析:国际厂商 vs 国产厂商,选型指南看这篇就够了

Jackie Zhan 2026-07-11
目录
一、GPU市场格局:为什么一块显卡比黄金还贵? 二、国际厂商三剑客:NVIDIA、AMD、Intel 三、国产厂商崛起:华为昇腾、海光、燧原、摩尔线程 四、训练 vs 推理:场景不同,GPU选择大不同 五、大卡 vs 小卡:什么时候该上"核弹"? 六、量化部署:INT8、FP16、FP8 带来的成本革命 七、集群部署:NVLink、PCIe、多卡互联那些事儿 八、选型总结:一张表帮你做决定

一块 H100 GPU,现在多少钱?答案是——30 万人民币起步。而且有钱还不一定能买到。这就是 2026 年 AI 时代的残酷现实。

你可能听说过"算力就是新石油"这句话。但我想告诉你的是:算力不是石油,石油你还能囤着,算力买到手就开始贬值。因为 AI 模型越来越大,GPU 更新换代的速度远超你的想象——去年买的 A100,今年就变成"上一代"了。

但更让人头疼的不是贵,而是选错。我见过太多团队花了冤枉钱:训练用错了卡,推理效率低得可怜;或者图便宜买了"性价比神卡",结果连模型都跑不起来。今天这篇文章,就是来解决这个问题的。

我会从以下几个维度彻底讲透 GPU 选型:国际厂商 vs 国产厂商、训练 vs 推理、大卡 vs 小卡、量化技术、集群部署……最后还会给你一张选型决策表,让你对号入座。

准备好了吗?我们开始。


一、GPU市场格局:为什么一块显卡比黄金还贵?

要理解 GPU 为什么这么贵,你得先明白 AI 训练到底在干什么。

想象一下你在教一个学生参加考试。传统编程是你直接给他一本《五年高考三年模拟》,告诉他"看到这个题型就套这个公式"。但 AI 训练不是——你是给他喂了 1000 万道题目和答案,让他自己去找规律。

这个"找规律"的过程,就是矩阵乘法。而 GPU,恰恰是世界上做矩阵乘法最快的东西。

CPU 就像一个大学教授,一个问题一个问题地处理,擅长复杂的逻辑推理。GPU 则像是一万个小学生,每人算一点点,最后汇总结果。一个教授再聪明,也不如一万个小学生同时算加减乘除快——这就是为什么深度学习必须用 GPU。

数据说话
训练一个 GPT-4 级别的模型,需要消耗约 2.5 亿美元 的算力成本。其中 GPU 采购费用占了 60% 以上。这就是为什么各大厂都在疯狂囤卡——OpenAI 估计拥有超过 10 万块 H100。

2023 年之前,这个市场几乎是 NVIDIA 的一言堂。AMD 只能在旁边喝汤,Intel 更是连汤都喝不上。但 2022 年的出口管制彻底改变了游戏规则——中国无法获得高端 AI 芯片,这反而催生了国产 GPU 的黄金时代。

现在的格局是:国际厂商(NVIDIA/AMD/Intel)+ 国产厂商(华为昇腾/海光/燧原/摩尔线程),两大阵营正在激烈交锋。到底选哪个?看完这篇文章你就有答案。


二、国际厂商三剑客:NVIDIA、AMD、Intel

先说国际厂商。如果你没有被"卡脖子"的问题,国际厂商依然是首选。原因很简单——生态太完善了。CUDA 这个东西,真是 NVIDIA 的"核武器"。

1. NVIDIA:绝对霸主,但越来越贵

NVIDIA 在 AI 领域的地位,某种程度上比 Apple 在手机领域还要稳。因为它不是卖硬件的,它是卖完整生态的。

CUDA——这个让无数开发者又爱又恨的东西,是 NVIDIA 的护城河。全球 95% 以上的 AI 框架、模型、工具,都是基于 CUDA 开发的。你说换个 GPU?先问问这些框架答不答应。

来,看看 NVIDIA 当前的 产品线:

型号显存算力 (FP32)适用场景参考价格
H10080GB HBM351 TFLOPS大规模训练旗舰¥30万+
H200141GB HBM3e51 TFLOPS大模型训练¥40万+
A10040/80GB HBM219.5 TFLOPS训练/推理主力¥15万+
A600048GB GDDR638.7 TFLOPS可视化/中小训练¥6万+
L40S48GB GDDR646 TFLOPS推理/推理+训练¥5万+
RTX 409024GB GDDR6X82.6 TFLOPS个人开发者/小规模¥2万+
实战案例
如果你训练的是 70B 以上的模型,H100 是标配。但如果你只是跑 7B、13B 的小模型,A100 甚至 RTX 4090 都够用。记住一句话:够用就好,别被营销带节奏

H100 为什么这么强?两个关键技术创新:Transformer Engine(专门加速 Transformer 模型)+ NVLink(超高速卡间互联,后面会详细说)。可以说,H100 就是为 LLM 量身定制的"核弹"。

2. AMD:性价比之选,但生态是硬伤

AMD 的 GPU,论技术指标其实不差。MI300X 的 HBM3E 显存高达 192GB,比 H200 还能打。但为什么卖不过 NVIDIA?

答案就两个字:生态。

ROCm 是 AMD 的计算平台,但说实话,用起来比 CUDA 难受太多。PyTorch 支持不稳定,TensorFlow 更是基本不支持。很多模型你得自己手动调优,有时候为了跑通一个开源项目,要花比在 NVIDIA 上多 3 倍的时间。

型号显存算力 (FP32)优势劣势
MI300X192GB HBM3E163 TFLOPS显存大、价格相对便宜生态弱、驱动不稳定
MI250X128GB HBM2e95.7 TFLOPS性价比尚可生态较弱

我的建议是:如果你预算有限,且有耐心折腾,AMD MI300X 可以考虑。但如果你要的是稳定产出,还是老实用 NVIDIA 吧。

3. Intel:数据中心的新玩家

Intel 进军 GPU 市场的故事挺有意思。之前它一直做 CPU,AI 浪潮来了之后,发现自己的 Xe 架构可以改造成 GPU。

Gaudi 系列是 Intel 的 AI 加速器。Gaudi 3 的纸面数据很漂亮——BF16 算力 1835 TFLOPS,比 H100 还高。但实际性能嘛……

反例警示
Intel Gaudi 在某些特定 benchmark 上确实很强,但实际应用中的软件栈成熟度远不如 NVIDIA。很多客户买了 Gaudi 之后,发现适配工作量太大,最后又回头买 NVIDIA。

Intel 的优势是价格CPU 协同。如果你已经是 Intel 系的服务器,买 Gaudi 可以降低运维复杂度。但对于大多数团队,我的建议是:等 Intel 生态成熟了再说

小结国际厂商:NVIDIA 是绝对首选,有预算无脑上;AMD 适合预算有限且愿意折腾的;Intel 暂时观望。


三、国产厂商崛起:华为昇腾、海光、燧原、摩尔线程

如果说国际厂商是"富二代",那国产厂商就是"创业者"——起点低、起步晚,但增长速度惊人。

2022 年的出口管制让中国无法购买 A100、H100 等高端芯片,但这反而成了国产 GPU 的"神助攻"。政府投钱、市场有需求、厂商有动力——天时地利人和全占了。

1. 华为昇腾:国产一哥

昇腾(Ascend)是华为的 AI 计算品牌。910B 是目前最成熟的国产 AI 芯片,没有之一。

型号显存算力 (FP16)生态特点
Ascend 910B64GB HBM400 TFLOPSCANN + MindSpore国产最强,生态较完善
Ascend 910A32GB HBM256 TFLOPSCANN + MindSpore910B 降配版

昇腾的最大优势是生态。华为自己做了完整的软件栈:CANN(异构计算架构)+ MindSpore(深度学习框架)+ ModelArts(云平台)。虽然跟 CUDA 比还有差距,但已经能跑通大多数主流模型了。

实战案例
科大讯飞、百度等大厂都在用昇腾做推理。它的优势是功耗控制国产替代。如果你需要"自主可控",昇腾是首选。

但昇腾也有硬伤:产能。由于被制裁,华为的芯片产能一直上不去。有时候你有钱也买不到,这是最头疼的。

2. 海光:兼容 CUDA 的务实派

海光(Hygon)可能是最"聪明"的国产厂商。它的策略是——兼容 CUDA

海光 DCU 深算系列基于 AMD 的 CDNA 架构(当年 AMD 授权的技术),所以理论上可以跑 CUDA 程序。虽然性能跟 AMD 原厂有差距,但迁移成本低啊!

DCU Z100L
型号显存算力 (FP32)特点
DCU Z10064GB HBM222 TFLOPS兼容 CUDA,生态较好
32GB HBM211 TFLOPS性价比版

海光的目标用户是——不想重写代码的团队。买一块海光卡,把代码从 A100 迁移过来,改动量可能是最小的。

3. 燧原:专注训练的低调玩家

燧原(Enflame)是这几个厂商里最"专注"的——它只做 AI 训练芯片,不碰其他业务。

云燧 T20/T21 是他们的旗舰产品。虽然纸面数据不如昇腾,但稳定性功耗控制做得不错。

insider 视角
燧原的团队很多来自 AMD 和 NVIDIA,技术底子不错。它的问题是知名度低,很多客户没听说过。但实际上它在某些政企项目里用得挺好的。

4. 摩尔线程:全功能 GPU 的野心家

摩尔线程(Moore Threads)是这几家里最年轻的,但也最野心勃勃。它不只想做 AI 芯片,还想做真正的 GPU——既能跑 AI,又能玩游戏、做渲染。

MTT X400 是他们的 AI 加速卡,定位有点类似 NVIDIA 的 A100。但说实话,现在还处于"追赶者"阶段,软件生态还需要时间完善。

小结国产厂商:昇腾是综合最强的,海光是最务实的(兼容 CUDA),燧原是专注训练的,摩尔线程是潜力股但尚需时日。

国际厂商 NVIDIA AI霸主·生态最强 AMD 性价比·生态较弱 Intel 新玩家·待成熟 出口管制 国产厂商 华为昇腾 国产一哥·生态较完善 海光 兼容CUDA·务实之选 燧原 专注训练·低调务实 摩尔线程 全功能GPU·潜力股 选型维度 生态成熟度 NVIDIA > 昇腾 > 海光 算力性价比 AMD > 国产 > NVIDIA 采购难度 昇腾 < 海光 < NVIDIA 适用场景 训练→NVIDIA/昇腾 推理→L40S/国产 推荐指数 ★★★★★ NVIDIA
GPU 厂商格局与选型维度对比

四、训练 vs 推理:场景不同,GPU选择大不同

很多人以为 GPU 就是 GPU,其实训练和推理对 GPU 的需求完全不同。这就像跑车和卡车都是车,但设计理念完全不同——一个追求速度,一个追求载重。

训练:烧显存就是烧钱

训练是一个"反向传播"的过程。简单说,就是模型看完数据后说"我猜错了",然后所有参数都调整一点。这个过程需要:

选型建议
训练场景首选 H100/H200(大模型)或 A100(中模型)。国产可以选 昇腾 910B。预算有限?用 A100 40GB + ZeRO-3 分布式,也能跑 70B 模型。

推理:响应速度是生命线

推理是"正向传播"——模型已经训练好了,输入数据直接出结果。跟训练完全不同:

关键洞察
推理卡的选择不是算力越强越好,而是算力/价格比INT8/FP8 推理性能最重要。这也就是为什么 L40S 在推理场景比 A100 更受欢迎——便宜、性能也不错。

推理场景的性价比之王是 L40S 或者 RTX 4090(个人开发者)。国产的昇腾、海光做推理也完全没问题。

场景推荐 GPU关键指标理由
大模型训练 (70B+)H100/H200显存>80GB, NVLinkTransformer Engine 加速
中模型训练 (7B-70B)A100 80GB80GB HBM2e性价比最优
小模型训练 (<7B)A100 40GB / RTX 409040GB+ 显存够用即可
大规模推理L40S / H100INT8 性能吞吐量大
中小规模推理RTX 4090 / 昇腾 910B算力/价格比成本优先

这里有个关键概念——Batch Size。训练时你希望 batch 越大越好(收敛更快),但推理时 batch 可以很小(甚至 1),追求的是延迟。理解这一点,你就知道为什么训练和推理的 GPU 选型逻辑完全不同了。


五、大卡 vs 小卡:什么时候该上"核弹"?

"大卡"和"小卡"的区别,不只是显存大小,而是计算架构的差异。

大卡(H100、A100、昇腾 910B)用的是 HBM(High Bandwidth Memory)——这种显存直接封装在 GPU 芯片旁边,带宽能达到 2TB/s 以上。小卡(RTX 4090、L40S)用的是 GDDR,带宽只有 HBM 的 1/3 到 1/4。

但 GDDR 便宜啊!这就是为什么 L40S 性价比高的原因——用相对低价的 GDDR,达到了 HBM 80% 的性能,价格却只要 1/3。

什么时候选大卡?

什么时候选小卡?

常见误区
很多人以为"买最贵的准没错"。其实对于 7B 模型,RTX 4090 和 H100 的训练速度差距不到 30%,但价格差了 15 倍。记住:够用就好,过度配置是最大的浪费
大卡 (H100/A100) HBM 显存 NVLink 互联 ¥15万+ 适用场景 70B+ 大模型训练 多卡互联训练 延迟敏感场景 自主可控需求 小卡 (4090/L40S) GDDR 显存 PCIe 互联 ¥2-5万 选型原则:模型规模决定卡的大小,场景需求决定卡的类型
大卡 vs 小卡选型决策

我的经验公式:显存需求 ≈ 模型参数 × 4(FP16 下)。7B 模型需要 28GB,13B 需要 52GB,70B 需要 280GB——70B 就必须上多卡了。


六、量化部署:INT8、FP16、FP8 带来的成本革命

如果你觉得 GPU 太贵,有一个办法可以让你用同样的卡跑更大的模型——这就是量化。

量化本质上是用精度换显存。就像照片压缩——从 RAW 变成 JPEG,画面质量稍有损失,但文件大小小了几十倍。模型量化后,参数从 32 位浮点(FP32)变成 16 位(FP16)、8 位(INT8)甚至 4 位(INT4)。

主流量化精度对比

精度显存占用性能损失适用场景支持 GPU
FP32 (全精度)1x训练/高精度推理所有
FP16 (半精度)1/2x极小训练/推理通用所有
BF161/2x比 FP16 更稳定训练首选H100/A100/昇腾
FP81/4x可接受H100 推理H100/H200
INT81/4x5-10%推理首选所有
INT41/8x10-20%大模型推理部分支持
量化实战
用 INT8 量化,一个 70B 模型可以从 140GB 显存降到 35GB——一张 A100 40GB 就能跑!这也是为什么现在"消费级 GPU 跑大模型"变成可能的原因。

不同量化格式对 GPU 的影响

FP16:所有现代 GPU 都支持,性能损失几乎为零。训练和推理都可以用,是现在的默认选择

BF16:Google 提出的格式,比 FP16 更"安全"——FP16 的动态范围窄,训练时容易溢出。BF16 增加了指数位,解决了这个问题。H100 和昇腾 910B 都原生支持 BF16

FP8:NVIDIA H100 独占的格式。它把精度做到 8 位,但用特殊的表示方法让它能达到接近 FP16 的效果。这是 H100 最大的技术优势之一

INT8/INT4:这是"有损压缩",需要专门的 Tensor Core 加速。所有 Tensor Core GPU 都支持 INT8,但 INT4 的支持比较有限。

insider 视角
量化不是万能的。有些模型对量化敏感(比如某些数学相关的模型),量化后效果会明显下降。最佳实践是:先量化跑通,再测试效果,效果不好就换精度

量化带来的选型启示:买能支持更多量化格式的 GPU,就是买未来。H100 支持 FP8,这是一个巨大的优势。国产 GPU 里,昇腾 910B 对 BF16 的支持也比较完善。


七、集群部署:NVLink、PCIe、多卡互联那些事儿

当一块 GPU 不够用的时候,你就要考虑多卡集群。这时候,显卡之间的互联方式就变得至关重要。

NVLink:卡间互联的"高速公路"

NVLink 是 NVIDIA 的私有协议,带宽能达到 900GB/s(H100 的第四代 NVLink)。这是什么概念?PCIe 5.0 x16 只有 128GB/s,NVLink 是它的 7 倍

为什么带宽这么重要?因为多卡训练时,卡之间要频繁同步梯度。一个 70B 的模型,一次前向传播产生的梯度数据是巨大的——如果带宽不够,卡就在"等数据",利用率上不去。

NVLink (H100) 900 GB/s · 私有协议 PCIe 5.0 x16 128 GB/s · 开放标准 带宽差距 7x 实际影响 多卡训练:NVLink 比 PCIe 快 2-5 倍 推理:NVLink 优势不明显,PCIe 够用
NVLink vs PCIe 带宽对比

NVSwitch:8 卡全互联

NVLink 解决了"两卡互联"的问题,但如果要 8 卡全互联呢?这时候就需要 NVSwitch——一个类似"交换机"的东西,让 8 块 H100 可以两两之间都以 900GB/s 带宽通信

DGX H100 服务器就是用了 8 块 H100 + NVSwitch。这东西是"富人的玩具",一台服务器要 200 多万。但对于大模型训练来说,这是必需品

国产集群方案

国产厂商也在做自己的互联方案。华为的 HCCS(华为集合通信库)+ 超节点,海光的 HDC,都在试图解决多卡互联问题。但客观说,跟 NVIDIA 的 NVLink/NVSwitch 比,还有代际差距。

踩坑记录 有团队买了 8 块 A100 做训练,结果发现只用 PCIe 互联,训练速度比单卡快不了多少——因为卡间同步成了瓶颈。教训:多卡训练必须上 NVLink,否则就是浪费钱

集群选型建议

  • 8 卡以内:有 NVLink 上 NVLink,没有就用 PCIe 凑合(会有性能损失)
  • 8 卡以上:必须上 NVSwitch,或者用 InfiniBand 互联
  • 国产方案:华为昇腾超节点是目前最成熟的国产集群方案

八、选型总结:一张表帮你做决定

好,铺垫了这么多,是时候给出选型决策表了。对号入座,看看你的场景应该选什么卡。

你的场景推荐 GPU预算参考备注
大模型训练 (70B+)H100 80GB x 8 + NVSwitch¥200万+Transformer Engine 加速
中模型训练 (7B-70B)A100 80GB x 8¥120万+性价比最优
小模型训练 (<7B)A100 40GB / RTX 4090¥5-15万单卡或双卡
大规模推理 (API服务)H100 / L40S¥5-30万INT8/FP8 优化
小规模推理 (自用)RTX 4090 / 昇腾 910B¥2-6万个人开发者首选
国产替代/自主可控昇腾 910B / 海光 DCU¥10-20万生态逐步完善
预算极其有限RTX 4090 x 4¥10万消费级卡集群
一句话总结
训练用 H/A 系列,推理用 L40S/RTX 4090,国产替代选昇腾,量化部署能省一半。

最后说几点我的肺腑之言

  1. 别超前消费:GPU 贬值速度超乎你的想象。今年买的 H100,明年可能就变成"上一代"。够用就好。
  2. 先小后大:从小规模开始跑通,再逐步扩展。大规模采购前,先租云资源验证。
  3. 关注生态:买卡只是开始,驱动、框架、优化、运维都是成本。NVIDIA 的贵,有一部分是贵在生态上。
  4. 考虑量化:同样的卡,量化后能跑大一倍的模型。这是性价比最高的"升级"方式。

GPU 选型没有标准答案,只有适合不适合。希望这篇文章能帮你做出更明智的选择。

如果还有具体问题,欢迎评论区聊。

© 2026 元初AI · ORIGIN OF INTELLIGENCE