50 · 中游 / Midstream

AI 软件栈与框架

CUDA、PyTorch、编译器与推理引擎决定算力能不能被模型真正吃掉。

从 CUDA/ROCm 到 PyTorch/JAX、Megatron/DeepSpeed、vLLM/TensorRT-LLM,软件栈把芯片能力翻译成训练吞吐与推理延迟。开源社区与芯片厂商在此争夺“默认开发接口”。

角色

这一层谁在干活

芯片软件平台

驱动、库与图编译,锁住开发者习惯。

  • CUDA 生态
  • ROCm
  • CANN(昇腾)

训练框架

动态图、分布式与检查点,是研究与工业训练的共同语言。

  • PyTorch
  • JAX
  • MindSpore
  • Megatron-LM

推理与服务

批处理、分页注意力、量化与路由,直接决定单位 token 成本。

  • vLLM
  • TensorRT-LLM
  • TGI
  • SGLang
馆内机构

可点进档案的公司

NVIDIA以 CUDA 与 GPU 成为现代深度学习默认算力层,并发布 Nemotron、Cosmos 等模型。 Hugging Face开源模型与数据集协作平台,Transformers 库定义了现代 LLM 工程默认接口。 Meta以 Llama 开放权重推动全球开源生态,覆盖研究、企业与端侧。 Microsoft以 Azure、Copilot 与 Phi 小模型把前沿与端侧 AI 写入操作系统与办公套件。 Google以 Gemini 与 Gemma 覆盖闭源旗舰与开放轻量,并把模型嵌入搜索与云。 华为 / Huawei以盘古大模型与昇腾算力服务政企与行业,强调全栈自主与行业落地。
概念

读懂这一层

GPU(图形处理器)原本为图像渲染设计的并行芯片,后来成为训练与推理神经网络的主力算力。 量化(Quantization)用更低位数表示权重或激活,以减小模型体积、加快推理并节省显存。 Transformer基于自注意力机制的神经网络架构,是所有现代大语言模型的基础。
专题

相关主题路线

AI Infra 模型效率 开放模型

试试搜索