返回 ELI5 知识库首页 ⚡ HARDWARE & AI COMPUTE
🟩 Parallel Computing · AI Superchip

什么是 Nvidia GPU

CPU 就像 4~8 位满腹经纶的顶级数学教授,精通各种高深微积分;而 Nvidia GPU 则是 上万名接受过特训的小学生方阵 —— 每个人只会算最简单的 1+1,但口令一下,一万人瞬间同时算完!

🧠 CPU(中央处理器):少数天才教授

擅长处理复杂逻辑与串行跳转

拥有强大的单核性能、超大缓存与分支预测能力,专门应付操作系统调度、多分支业务逻辑与复杂的串行任务。

CPU Core #1 👨‍🏫 正在解高阶方程 CPU Core #2 👨‍🏫 调度系统分支 CPU Core #3 👨‍🏫 处理网络 I/O CPU Core #4 👨‍🏫 预测代码分支
  • 🔹 核心数量少:通常 4 ~ 64 个核心,个个能征善战
  • 🔹 执行模式:逐行串行(Serial),一条指令做完做下一条
  • 🔹 擅长场景:运行操作系统、数据库逻辑、网页服务后端
VS
🟩 GPU(图形/AI计算):万人小学生方阵

天生为“千军万马并行”而生

单个核心虽然只能算加乘法,但一张卡集成了数万个 CUDA Core 与 Tensor Core,能够在 1 纳秒内同时处理海量像素与矩阵!

⚡ 16,384+ 个 CUDA 核心齐射
  • 🟢 核心数量极多:数千到上万个计算单元(CUDA Cores)
  • 🟢 执行模式:大规模单指令多线程(SIMT 并行)
  • 🟢 擅长场景:3D游戏光影、4K视频渲染、大模型 Transformer 训练
💡

一句话顿悟:为什么 AI 时代离不开 Nvidia GPU?

大语言模型(如 ChatGPT、Gemini)底层的本质是数以万亿次的矩阵乘法(A × B)。 如果让 CPU 教授一个数字一个数字逐个去乘,需要算到地老天荒;而让 GPU 的上万个核心同时开火,一眨眼就能完成整层神经网络的权重计算!

拆解 Nvidia 算力怪兽的 4 大核心器官

从显存高速路到专用 AI 矩阵外挂,搞懂 GPU 的内部硬件架构

🟩

1. CUDA Core 基础流水线

最基础的算力工蜂。负责执行 FP32 / FP16 浮点加减乘除与游戏像素着色,是并行计算的基石。

2. Tensor Core 矩阵乘法外挂

专为 AI 深度学习定制的硬件单元。能在一周期内完成 D = A × B + C 矩阵混合精度乘加,吞吐量比通用核高数倍!

🏎️

3. HBM 高带宽显存高速路

计算再快,喂不饱数据也是白搭。HBM 显存直接堆叠在芯片旁,提供高达数 TB/s 的吞吐带宽,彻底消除数据拥堵。

🌐

4. NVLink 多卡互联立交桥

单张卡装不下千亿参数?NVLink 打造专用超高速总线,把成千上万张 GPU 无缝拼装成一台巨大的“超级单机”。

🕹️ 算力竞速演练台:CPU 单干 vs GPU 齐射

选择不同的现实工作负载,点击“启动并行竞速”,直观观察两者完成任务的吞吐速度差异:

🧠 CPU (8 个超级核心 · 逐个排队) 待命
C1
C2
C3
C4
C5
C6
C7
C8
进度: 0% 耗时: 0.0s
🟩 Nvidia GPU (10,000+ 核心 · 全员同时开工) 待命
进度: 0% 耗时: 0.0s
🎮 演进历史

从游戏像素到科学计算 (GPGPU)

90 年代,GPU 的唯一使命是在《雷神之锤》《古墓丽影》里画 3D 贴图多边形。

后来计算机科学家顿悟:“图形光影计算的本质不就是矩阵浮点运算吗?” 从此 GPU 正式杀入气象预测、物理模拟与生物制药领域。

🏰 绝对护城河

CUDA:黄仁勋 20 年构筑的软件帝国

单造出芯片并不够。2006 年 Nvidia 推出 CUDA 编程框架,让全球程序员能直接用 C++ 给 GPU 写代码。

今天,PyTorch、TensorFlow 和全球 AI 研究几乎全绑定在 CUDA 生态上,构成了不可逾越的软件壁垒。

🤖 AI 时代基石

算力即权力:大模型军备竞赛

从 A100、H100 到 Blackwell B200,训练一个前沿基础模型需要数万张顶级 GPU 在数据中心昼夜不停协同计算。

Nvidia GPU 已经从电脑机箱里的显卡,进化成了整个人工智能时代的“重工业发电机”