笔记 / GPU
NVIDIA GPU 产品谱系
从 Fermi 到 Rubin,区分消费级、专业级、数据中心 GPU 与系统级产品,并整理 Ampere 以来适合 AI 训练的 PCIe 卡。
2026-07-27 7 分钟阅读更新于 2026-08-18
本文将 GPU / 显卡产品、嵌入式 SoC / 模块、CPU-GPU Superchip 和 服务器 / 机架系统 分层整理。主 GPU 表遵循一条严格规则:同一行只列采用同一 GPU 架构的产品。
1. 先说明名称层级
| 层级 | 典型名称 | 含义 |
|---|---|---|
| 消费级 GPU 品牌 | GeForce、GeForce GTX、GeForce RTX | 游戏、个人创作和个人 AI 计算 |
| 旗舰消费 / 开发者子线 | TITAN | 2013-2018 年间的超旗舰产品线;停止独立更新后,其市场定位部分由 GeForce RTX 90 级承接 |
| 专业 GPU 品牌 | Quadro、Quadro RTX、RTX A、RTX Ada、RTX PRO | CAD、DCC、专业可视化、企业 AI 和工作站 |
| 数据中心 GPU 品牌 | Tesla、A 系列、H 系列、B 系列、Rubin GPU | AI 训练、推理、HPC 和数据中心加速 |
RTX 并不是与 GeForce、Quadro、Tesla 完全平级的单一品牌。 GeForce RTX 是消费级产品;Quadro RTX、RTX A、RTX Ada 和 RTX PRO 是专业产品。
2. 2010 年后的独立 GPU 产品演化
表中只放 独立 GPU 或加速卡产品。GH200、GB200、GB300、NVL72、DGX、TITAN 等不放入本表。
| 年份 / GPU 架构 | GeForce 消费级 | Quadro / NVIDIA RTX 专业卡 | Tesla / Data Center GPU |
|---|---|---|---|
| 2010-2011 · Fermi | GeForce GTX 480 GeForce GTX 580 | Quadro 4000 Quadro 5000 Quadro 6000 | Tesla C2050 Tesla C2070 Tesla M2090 |
| 2012-2014 · Kepler | GeForce GTX 680 GeForce GTX 780 Ti | Quadro K5000 Quadro K6000 | Tesla K10 Tesla K20 Tesla K40 |
| 2014-2016 · Maxwell | GeForce GTX 980 GeForce GTX 980 Ti | Quadro M4000 Quadro M5000 Quadro M6000 | Tesla M4 Tesla M40 Tesla M60 |
| 2016-2017 · Pascal | GeForce GTX 1080 GeForce GTX 1080 Ti | Quadro P5000 Quadro P6000 | Tesla P4 Tesla P40 Tesla P100 |
| 2017-2018 · Volta | - | Quadro GV100 | Tesla V100 |
| 2018-2020 · Turing | GeForce RTX 2060 GeForce RTX 2080 Ti | Quadro RTX 4000 Quadro RTX 5000 Quadro RTX 6000 Quadro RTX 8000 | NVIDIA Tesla T4 |
| 2020-2022 · Ampere | GeForce RTX 3060 GeForce RTX 3080 GeForce RTX 3090 GeForce RTX 3090 Ti | NVIDIA RTX A2000 RTX A4000 RTX A4500 RTX A5000 RTX A5500 RTX A6000 | NVIDIA A2 A10 A16 A30 A40 A100 |
| 2022-2024 · Hopper | - | - | NVIDIA H100 NVIDIA H200 |
| 2022-2024 · Ada Lovelace | GeForce RTX 4060 GeForce RTX 4070 GeForce RTX 4080 GeForce RTX 4090 | NVIDIA RTX 2000 Ada RTX 4000 Ada RTX 4500 Ada RTX 5000 Ada RTX 6000 Ada | NVIDIA L4 L40 L40S |
| 2024-2025 · Blackwell | - | - | NVIDIA B100 NVIDIA B200 |
| 2025-2026 · Blackwell | GeForce RTX 5050 GeForce RTX 5060 GeForce RTX 5060 Ti GeForce RTX 5070 GeForce RTX 5070 Ti GeForce RTX 5080 GeForce RTX 5090 | NVIDIA RTX PRO 2000 Blackwell RTX PRO 4000 Blackwell RTX PRO 4500 Blackwell RTX PRO 5000 Blackwell RTX PRO 6000 Blackwell Workstation Edition RTX PRO 6000 Blackwell Max-Q Workstation Edition | RTX PRO 6000 Blackwell Server Edition |
| 2025-2026 · Blackwell Ultra | - | - | NVIDIA B300 |
| 2026 · Rubin | - | - | NVIDIA Rubin GPU NVIDIA Rubin CPX |
3. 最简谱系摘要
早期图形
NV1 -> RIVA
|
|- GeForce -> GTX -> GeForce RTX -> RTX 90 级
| \- TITAN -----------------^(市场定位部分承接)
|
|- Quadro -> Quadro RTX -> RTX A -> RTX Ada -> RTX PRO
|
\- CUDA -> Tesla -> A100 -> H100/H200 -> B100/B200
-> B300 -> Rubin GPU
移动与嵌入式
Tegra -> Jetson / DRIVE / SHIELD
云与虚拟化
GRID -> NVIDIA vGPU -> RTX Virtual Workstation
AI 系统(并行的系统层,不是 GPU 换代)
Data Center GPU --搭载/组合--> DGX / HGX / MGX / NVL
数据中心网络
Mellanox -> ConnectX / BlueField / Spectrum-X / Quantum
4. Ampere 以来可用于 AI 训练的 GPU
本表仅列采用标准 PCIe x16 插卡形态、单颗 GPU 显存严格大于 16GB、支持 CUDA 和 Tensor Core、可用于 AI 训练或微调的主要 NVIDIA GPU。
“计算速度”统一采用 FP32 理论峰值,便于跨产品线比较;实际 AI 训练还应重点考察 BF16、FP16、TF32、FP8 Tensor Core 吞吐和显存带宽。
| 产品名称 | 显存大小 | 计算速度(FP32) | PCIe 版本 |
|---|---|---|---|
| GeForce RTX 3090 | 24GB GDDR6X | ≈35.6 TFLOPS | PCIe 4.0 x16 |
| GeForce RTX 3090 Ti | 24GB GDDR6X | ≈40.0 TFLOPS | PCIe 4.0 x16 |
| NVIDIA RTX A4500 | 20GB GDDR6 ECC | 23.7 TFLOPS | PCIe 4.0 x16 |
| NVIDIA RTX A5000 | 24GB GDDR6 ECC | 27.8 TFLOPS | PCIe 4.0 x16 |
| NVIDIA RTX A5500 | 24GB GDDR6 ECC | 34.1 TFLOPS | PCIe 4.0 x16 |
| NVIDIA RTX A6000 | 48GB GDDR6 ECC | 38.7 TFLOPS | PCIe 4.0 x16 |
| NVIDIA A10 | 24GB GDDR6 | 31.2 TFLOPS | PCIe 4.0 x16 |
| NVIDIA A30 | 24GB HBM2 | 10.3 TFLOPS | PCIe 4.0 x16 |
| NVIDIA A40 | 48GB GDDR6 ECC | 37.4 TFLOPS | PCIe 4.0 x16 |
| NVIDIA A100 PCIe | 40GB HBM2 | 19.5 TFLOPS | PCIe 4.0 x16 |
| NVIDIA A100 80GB PCIe | 80GB HBM2e | 19.5 TFLOPS | PCIe 4.0 x16 |
| GeForce RTX 4090 | 24GB GDDR6X | 83.0 TFLOPS | PCIe 4.0 x16 |
| NVIDIA RTX 4000 SFF Ada Generation | 20GB GDDR6 ECC | 19.2 TFLOPS | PCIe 4.0 x16 |
| NVIDIA RTX 4000 Ada Generation | 20GB GDDR6 ECC | 26.7 TFLOPS | PCIe 4.0 x16 |
| NVIDIA RTX 4500 Ada Generation | 24GB GDDR6 ECC | 39.6 TFLOPS | PCIe 4.0 x16 |
| NVIDIA RTX 5000 Ada Generation | 32GB GDDR6 ECC | 65.3 TFLOPS | PCIe 4.0 x16 |
| NVIDIA RTX 6000 Ada Generation | 48GB GDDR6 ECC | 91.1 TFLOPS | PCIe 4.0 x16 |
| NVIDIA L4 | 24GB GDDR6 | 30.3 TFLOPS | PCIe 4.0 x16 |
| NVIDIA L40 | 48GB GDDR6 ECC | ≈90.5 TFLOPS | PCIe 4.0 x16 |
| NVIDIA L40S | 48GB GDDR6 ECC | 91.6 TFLOPS | PCIe 4.0 x16 |
| NVIDIA H100 PCIe | 80GB HBM2e | 51.0 TFLOPS | PCIe 5.0 x16 |
| NVIDIA H100 NVL | 94GB HBM3 | 60.0 TFLOPS | PCIe 5.0 x16 |
| NVIDIA H200 NVL | 141GB HBM3e | 60.0 TFLOPS | PCIe 5.0 x16 |
| GeForce RTX 5090 | 32GB GDDR7 | ≈104.9 TFLOPS | PCIe 5.0 x16 |
| NVIDIA RTX PRO 4000 Blackwell SFF Edition | 24GB GDDR7 ECC | 24.0 TFLOPS | PCIe 5.0 x16 |
| NVIDIA RTX PRO 4000 Blackwell | 24GB GDDR7 ECC | 40.0 TFLOPS | PCIe 5.0 x16 |
| NVIDIA RTX PRO 4500 Blackwell Server Edition | 32GB GDDR7 ECC | 51.0 TFLOPS | PCIe 5.0 x16 |
| NVIDIA RTX PRO 5000 Blackwell | 48GB GDDR7 ECC | 70.0 TFLOPS | PCIe 5.0 x16 |
| NVIDIA RTX PRO 5000 72GB Blackwell | 72GB GDDR7 ECC | 70.0 TFLOPS | PCIe 5.0 x16 |
| NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition | 96GB GDDR7 ECC | 110 TFLOPS | PCIe 5.0 x16 |
| NVIDIA RTX PRO 6000 Blackwell Workstation Edition | 96GB GDDR7 ECC | 125 TFLOPS | PCIe 5.0 x16 |
| NVIDIA RTX PRO 6000 Blackwell Server Edition | 96GB GDDR7 ECC | 120 TFLOPS | PCIe 5.0 x16 |
如何使用这份表
架构名称、品牌名称和系统名称经常被混在一起,但它们回答的是不同问题:
- 架构说明 GPU 属于哪一代设计,例如 Ampere、Hopper 或 Blackwell;
- 产品线说明它服务的市场与驱动、认证和支持边界;
- 板卡形态决定它能否直接装入现有主机,以及供电、散热与互连要求;
- 系统产品则把 GPU、CPU、互连和网络组合成完整计算节点或机架。
选卡时,FP32 峰值只能作为统一口径下的参考。对于训练与推理,显存容量、显存带宽、低精度 Tensor Core 吞吐、互连、功耗以及软件栈支持通常更能决定真实效率。