第 50 · 中游 / Midstream
AI 软件栈与框架
CUDA、PyTorch、编译器与推理引擎决定算力能不能被模型真正吃掉。
从 CUDA/ROCm 到 PyTorch/JAX、Megatron/DeepSpeed、vLLM/TensorRT-LLM,软件栈把芯片能力翻译成训练吞吐与推理延迟。开源社区与芯片厂商在此争夺“默认开发接口”。
角色
这一层谁在干活
芯片软件平台
驱动、库与图编译,锁住开发者习惯。
- CUDA 生态
- ROCm
- CANN(昇腾)
训练框架
动态图、分布式与检查点,是研究与工业训练的共同语言。
- PyTorch
- JAX
- MindSpore
- Megatron-LM
推理与服务
批处理、分页注意力、量化与路由,直接决定单位 token 成本。
- vLLM
- TensorRT-LLM
- TGI
- SGLang
馆内机构
可点进档案的公司
概念
读懂这一层
专题