第 20 · 上游 / Upstream
加速芯片与平台
GPU、TPU、NPU 把矩阵运算变成可堆叠的算力商品。
英伟达以 GPU + CUDA 软件栈占据通用 AI 训练与大量推理份额;Google TPU、华为昇腾、AMD、自研 ASIC 等在云与端侧分流。芯片之上必须有驱动、编译器与内核库,否则模型框架无法吃到算力。
依赖
角色
这一层谁在干活
通用 GPU 平台
可训练可推理的默认选择,生态与供货往往比峰值算力更关键。
- NVIDIA 数据中心 GPU
- CUDA / cuDNN / NCCL
云自研加速器
超大云为降本与定制工作负载设计的 ASIC/TPU 路线。
- Google TPU
- AWS Trainium/Inferentia
- Azure Maia(路线)
国产与端侧 NPU
面向可获得算力与设备侧推理的替代路径。
- 华为昇腾
- 寒武纪等
- 手机/PC NPU
馆内机构
可点进档案的公司
NVIDIA以 CUDA 与 GPU 成为现代深度学习默认算力层,并发布 Nemotron、Cosmos 等模型。
华为 / Huawei以盘古大模型与昇腾算力服务政企与行业,强调全栈自主与行业落地。
Google以 Gemini 与 Gemma 覆盖闭源旗舰与开放轻量,并把模型嵌入搜索与云。
Amazon / AWS以 Amazon Nova 自研模型与 Bedrock 多厂商托管平台服务企业生成式 AI。
Microsoft以 Azure、Copilot 与 Phi 小模型把前沿与端侧 AI 写入操作系统与办公套件。
Apple以 Apple Intelligence 与端侧 Foundation Models 把生成式 AI 写入操作系统,强调隐私与设备侧推理。
概念
读懂这一层
专题