扩展定律
从「Google 发布 TPU」到「GPT-4.5 发布」,先抓住起点、路线转向与当前边界,再展开完整事件线。
GPT-4.5 发布
OpenAI 发布 GPT-4.5,宣称这是其最后一个不基于推理的旗舰模型,强化世界知识、自然对话与模式识别。发布后市场反应分化,凸显「纯规模路线 vs 推理路线」的分歧。
英伟达市值突破万亿美元
英伟达市值突破 1 万亿美元,成为历史上首家达成这一里程碑的芯片公司。ChatGPT 引爆的 AI 算力需求让 GPU 从游戏配件变成 AI 时代的「石油」。
Chinchilla 修正算力最优缩放配比
DeepMind 在 arXiv 发表《Training Compute-Optimal Large Language Models》,训练 400 余个规模从约 7000 万到逾 160 亿参数的模型。结论是算力最优时模型大小与训练 token 应近似等比放大;同算力的 70B Chinchilla(约 1.4T token)全面超过 280B Gopher。
GPT-3 发布
OpenAI 训练 1750 亿参数 GPT-3,并以零样本、单样本和少样本提示评估它。模型无需更新权重即可尝试翻译、问答、文本生成和简单代码,但不同任务的结果差异很大。
神经语言模型缩放规律被量化
OpenAI 研究者在跨越七个数量级的计算规模上拟合经验幂律,测量语言模型交叉熵损失随参数量、数据量和训练计算量的变化,并提出当时的计算预算分配公式。
Google 发布 TPU
Google 在 I/O 2016 公布自研 Tensor Processing Unit,这是一款针对神经网络推理优化的专用芯片,已在 AlphaGo 与搜索排序等场景使用。TPU 标志着大公司开始为深度学习定制硬件。