AI Infra
从「Google 成立」到「Google 领导层重组,四位元老离职创业」,先抓住起点、路线转向与当前边界,再展开完整事件线。
Google 领导层重组,四位元老离职创业
Google 8 月 6 日重组 AI 领导层:Demis Hassabis 卸任日常管理,转任 Alphabet 首席科学家兼 DeepMind 主席;Koray Kavukcuoglu 升 SVP 接管 Gemini;Jeff Dean、Sanjay Ghemawat、Oriol Vinyals、Quoc Le 离职创办 Discovery Loop(谷歌创始投资)。导火索是 Gemini 3.5 Pro 一再延期,Alphabet 股价单日跌约 4%。
OpenAI 发布 GPT-5.1
OpenAI 发布 GPT-5.1,作为 GPT-5 系列的稳定升级,重点优化推理速度、API 成本与工具调用稳定性。它是「旗舰模型按季迭代」节奏里的关键一环。
OpenAI 发布 GPT-4o mini
OpenAI 发布 GPT-4o mini,以极低的价格提供接近 GPT-4o 的能力,把「小模型 + 低价」变成主流选择,引发开发者大规模迁移与行业价格跟进。
华为云发布盘古大模型 5.0
华为在 HDC 2024 发布盘古 5.0,覆盖 NLP、多模态、视觉、预测与科学计算等分支与多档参数,强调昇腾部署与行业场景,把“硬件+模型+云”绑成一条国产全栈叙事。
vLLM 与 PagedAttention 重塑 LLM 服务吞吐
UC Berkeley 等研究者开源 vLLM,并以 PagedAttention 把 KV 缓存拆成可非连续映射的页,降低显存碎片与预留浪费,显著提高大模型服务吞吐。
英伟达市值突破万亿美元
英伟达市值突破 1 万亿美元,成为历史上首家达成这一里程碑的芯片公司。ChatGPT 引爆的 AI 算力需求让 GPU 从游戏配件变成 AI 时代的「石油」。
FlashAttention 用 IO 感知重写精确注意力
Tri Dao 等人提出 FlashAttention:在 GPU 上按块计算精确 softmax 注意力,减少高带宽内存(HBM)读写,从而在不近似注意力数学的前提下加速并节省显存。
神经语言模型缩放规律被量化
OpenAI 研究者在跨越七个数量级的计算规模上拟合经验幂律,测量语言模型交叉熵损失随参数量、数据量和训练计算量的变化,并提出当时的计算预算分配公式。
微软向 OpenAI 投资十亿美元
微软宣布向 OpenAI 投资 10 亿美元,双方开展多年合作:Azure 成为 OpenAI 的独家云供应商,OpenAI 的技术将整合进微软产品。这笔投资为 GPT 系列的规模化训练提供了算力与资本。
OpenAI Five 击败 Dota 2 世界冠军
OpenAI Five 在一场三局两胜的公开赛中连胜两局,击败 2018 年 Dota 2 世界冠军 OG。比赛使用 17 名可选英雄及若干规则限制,五个智能体各自控制一名角色并实时协作。
PyTorch 公开亮相
Facebook AI Research 公开 PyTorch,以 Python 与动态计算图为核心,让研究者用熟悉的控制流搭建并调试深度网络。
Google 发布 TPU
Google 在 I/O 2016 公布自研 Tensor Processing Unit,这是一款针对神经网络推理优化的专用芯片,已在 AlphaGo 与搜索排序等场景使用。TPU 标志着大公司开始为深度学习定制硬件。
Google 开源 TensorFlow
Google 以 Apache 2.0 许可证发布 TensorFlow,把内部第二代机器学习系统开放给研究者和开发者。
Google Brain 与大规模分布式学习
Google Brain 团队在 1.6 万个 CPU 核心上训练大型神经网络,无监督地学会从 YouTube 视频帧中识别猫。它证明「更大数据、更多算力」能让深度网络自己涌现特征,是深度学习复兴的关键推力之一。
CUDA 把 GPU 变成通用计算平台
NVIDIA 发布 CUDA,让开发者用 C 风格工具直接编写在 GPU 上运行的通用并行程序。
Google 成立
拉里·佩奇和谢尔盖·布林在车库创立 Google,核心是 PageRank 算法——用链接结构给网页排序。它把搜索变成一场以数据和算法为核心的竞赛,也为日后 Google 的 AI 帝国埋下第一块地基。