ZWZixi Wang
笔记

笔记 / GPU

NVIDIA GPU 产品谱系

从 Fermi 到 Rubin,区分消费级、专业级、数据中心 GPU 与系统级产品,并整理 Ampere 以来适合 AI 训练的 PCIe 卡。

本文将 GPU / 显卡产品嵌入式 SoC / 模块CPU-GPU Superchip服务器 / 机架系统 分层整理。主 GPU 表遵循一条严格规则:同一行只列采用同一 GPU 架构的产品

1. 先说明名称层级

层级典型名称含义
消费级 GPU 品牌GeForce、GeForce GTX、GeForce RTX游戏、个人创作和个人 AI 计算
旗舰消费 / 开发者子线TITAN2013-2018 年间的超旗舰产品线;停止独立更新后,其市场定位部分由 GeForce RTX 90 级承接
专业 GPU 品牌Quadro、Quadro RTX、RTX A、RTX Ada、RTX PROCAD、DCC、专业可视化、企业 AI 和工作站
数据中心 GPU 品牌Tesla、A 系列、H 系列、B 系列、Rubin GPUAI 训练、推理、HPC 和数据中心加速

RTX 并不是与 GeForce、Quadro、Tesla 完全平级的单一品牌。 GeForce RTX 是消费级产品;Quadro RTX、RTX A、RTX Ada 和 RTX PRO 是专业产品。

2. 2010 年后的独立 GPU 产品演化

表中只放 独立 GPU 或加速卡产品。GH200、GB200、GB300、NVL72、DGX、TITAN 等不放入本表。

年份 / GPU 架构GeForce 消费级Quadro / NVIDIA RTX 专业卡Tesla / Data Center GPU
2010-2011 · FermiGeForce GTX 480
GeForce GTX 580
Quadro 4000
Quadro 5000
Quadro 6000
Tesla C2050
Tesla C2070
Tesla M2090
2012-2014 · KeplerGeForce GTX 680
GeForce GTX 780 Ti
Quadro K5000
Quadro K6000
Tesla K10
Tesla K20
Tesla K40
2014-2016 · MaxwellGeForce GTX 980
GeForce GTX 980 Ti
Quadro M4000
Quadro M5000
Quadro M6000
Tesla M4
Tesla M40
Tesla M60
2016-2017 · PascalGeForce GTX 1080
GeForce GTX 1080 Ti
Quadro P5000
Quadro P6000
Tesla P4
Tesla P40
Tesla P100
2017-2018 · Volta-Quadro GV100Tesla V100
2018-2020 · TuringGeForce RTX 2060
GeForce RTX 2080 Ti
Quadro RTX 4000
Quadro RTX 5000
Quadro RTX 6000
Quadro RTX 8000
NVIDIA Tesla T4
2020-2022 · AmpereGeForce RTX 3060
GeForce RTX 3080
GeForce RTX 3090
GeForce RTX 3090 Ti
NVIDIA RTX A2000
RTX A4000
RTX A4500
RTX A5000
RTX A5500
RTX A6000
NVIDIA A2
A10
A16
A30
A40
A100
2022-2024 · Hopper--NVIDIA H100
NVIDIA H200
2022-2024 · Ada LovelaceGeForce RTX 4060
GeForce RTX 4070
GeForce RTX 4080
GeForce RTX 4090
NVIDIA RTX 2000 Ada
RTX 4000 Ada
RTX 4500 Ada
RTX 5000 Ada
RTX 6000 Ada
NVIDIA L4
L40
L40S
2024-2025 · Blackwell--NVIDIA B100
NVIDIA B200
2025-2026 · BlackwellGeForce RTX 5050
GeForce RTX 5060
GeForce RTX 5060 Ti
GeForce RTX 5070
GeForce RTX 5070 Ti
GeForce RTX 5080
GeForce RTX 5090
NVIDIA RTX PRO 2000 Blackwell
RTX PRO 4000 Blackwell
RTX PRO 4500 Blackwell
RTX PRO 5000 Blackwell
RTX PRO 6000 Blackwell Workstation Edition
RTX PRO 6000 Blackwell Max-Q Workstation Edition
RTX PRO 6000 Blackwell Server Edition
2025-2026 · Blackwell Ultra--NVIDIA B300
2026 · Rubin--NVIDIA Rubin GPU
NVIDIA Rubin CPX

3. 最简谱系摘要

早期图形
NV1 -> RIVA
        |
        |- GeForce -> GTX -> GeForce RTX -> RTX 90 级
        |             \- TITAN -----------------^(市场定位部分承接)
        |
        |- Quadro -> Quadro RTX -> RTX A -> RTX Ada -> RTX PRO
        |
        \- CUDA -> Tesla -> A100 -> H100/H200 -> B100/B200
                                                  -> B300 -> Rubin GPU

移动与嵌入式
Tegra -> Jetson / DRIVE / SHIELD

云与虚拟化
GRID -> NVIDIA vGPU -> RTX Virtual Workstation

AI 系统(并行的系统层,不是 GPU 换代)
Data Center GPU --搭载/组合--> DGX / HGX / MGX / NVL

数据中心网络
Mellanox -> ConnectX / BlueField / Spectrum-X / Quantum

4. Ampere 以来可用于 AI 训练的 GPU

本表仅列采用标准 PCIe x16 插卡形态、单颗 GPU 显存严格大于 16GB、支持 CUDA 和 Tensor Core、可用于 AI 训练或微调的主要 NVIDIA GPU。

“计算速度”统一采用 FP32 理论峰值,便于跨产品线比较;实际 AI 训练还应重点考察 BF16、FP16、TF32、FP8 Tensor Core 吞吐和显存带宽。

产品名称显存大小计算速度(FP32)PCIe 版本
GeForce RTX 309024GB GDDR6X≈35.6 TFLOPSPCIe 4.0 x16
GeForce RTX 3090 Ti24GB GDDR6X≈40.0 TFLOPSPCIe 4.0 x16
NVIDIA RTX A450020GB GDDR6 ECC23.7 TFLOPSPCIe 4.0 x16
NVIDIA RTX A500024GB GDDR6 ECC27.8 TFLOPSPCIe 4.0 x16
NVIDIA RTX A550024GB GDDR6 ECC34.1 TFLOPSPCIe 4.0 x16
NVIDIA RTX A600048GB GDDR6 ECC38.7 TFLOPSPCIe 4.0 x16
NVIDIA A1024GB GDDR631.2 TFLOPSPCIe 4.0 x16
NVIDIA A3024GB HBM210.3 TFLOPSPCIe 4.0 x16
NVIDIA A4048GB GDDR6 ECC37.4 TFLOPSPCIe 4.0 x16
NVIDIA A100 PCIe40GB HBM219.5 TFLOPSPCIe 4.0 x16
NVIDIA A100 80GB PCIe80GB HBM2e19.5 TFLOPSPCIe 4.0 x16
GeForce RTX 409024GB GDDR6X83.0 TFLOPSPCIe 4.0 x16
NVIDIA RTX 4000 SFF Ada Generation20GB GDDR6 ECC19.2 TFLOPSPCIe 4.0 x16
NVIDIA RTX 4000 Ada Generation20GB GDDR6 ECC26.7 TFLOPSPCIe 4.0 x16
NVIDIA RTX 4500 Ada Generation24GB GDDR6 ECC39.6 TFLOPSPCIe 4.0 x16
NVIDIA RTX 5000 Ada Generation32GB GDDR6 ECC65.3 TFLOPSPCIe 4.0 x16
NVIDIA RTX 6000 Ada Generation48GB GDDR6 ECC91.1 TFLOPSPCIe 4.0 x16
NVIDIA L424GB GDDR630.3 TFLOPSPCIe 4.0 x16
NVIDIA L4048GB GDDR6 ECC≈90.5 TFLOPSPCIe 4.0 x16
NVIDIA L40S48GB GDDR6 ECC91.6 TFLOPSPCIe 4.0 x16
NVIDIA H100 PCIe80GB HBM2e51.0 TFLOPSPCIe 5.0 x16
NVIDIA H100 NVL94GB HBM360.0 TFLOPSPCIe 5.0 x16
NVIDIA H200 NVL141GB HBM3e60.0 TFLOPSPCIe 5.0 x16
GeForce RTX 509032GB GDDR7≈104.9 TFLOPSPCIe 5.0 x16
NVIDIA RTX PRO 4000 Blackwell SFF Edition24GB GDDR7 ECC24.0 TFLOPSPCIe 5.0 x16
NVIDIA RTX PRO 4000 Blackwell24GB GDDR7 ECC40.0 TFLOPSPCIe 5.0 x16
NVIDIA RTX PRO 4500 Blackwell Server Edition32GB GDDR7 ECC51.0 TFLOPSPCIe 5.0 x16
NVIDIA RTX PRO 5000 Blackwell48GB GDDR7 ECC70.0 TFLOPSPCIe 5.0 x16
NVIDIA RTX PRO 5000 72GB Blackwell72GB GDDR7 ECC70.0 TFLOPSPCIe 5.0 x16
NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition96GB GDDR7 ECC110 TFLOPSPCIe 5.0 x16
NVIDIA RTX PRO 6000 Blackwell Workstation Edition96GB GDDR7 ECC125 TFLOPSPCIe 5.0 x16
NVIDIA RTX PRO 6000 Blackwell Server Edition96GB GDDR7 ECC120 TFLOPSPCIe 5.0 x16

如何使用这份表

架构名称、品牌名称和系统名称经常被混在一起,但它们回答的是不同问题:

  • 架构说明 GPU 属于哪一代设计,例如 Ampere、Hopper 或 Blackwell;
  • 产品线说明它服务的市场与驱动、认证和支持边界;
  • 板卡形态决定它能否直接装入现有主机,以及供电、散热与互连要求;
  • 系统产品则把 GPU、CPU、互连和网络组合成完整计算节点或机架。

选卡时,FP32 峰值只能作为统一口径下的参考。对于训练与推理,显存容量、显存带宽、低精度 Tensor Core 吞吐、互连、功耗以及软件栈支持通常更能决定真实效率。