大语言模型

从「Transformer 架构论文发表」到「腾讯混元发布并开源 Hy4 preview」,先抓住起点、路线转向与当前边界,再展开完整事件线。

01

腾讯混元发布并开源 Hy4 preview

腾讯混元发布并开源 Hy4 preview:770B 总参、49B 激活的 MoE,上下文突破 1M,Apache 2.0 协议;定位「为生产力而生」,聚焦软件工程、办公分析、游戏开发与科学研究,在 WorkBuddy/CodeBuddy、元宝、ima 等产品同步首发,并首次参与自身研发全链路形成「初步的递归自我改进闭环」。

A行业级
02

智谱开源 GLM-5.3-Flash(Ox Alpha)

智谱「认领」此前以匿名身份 Ox Alpha(中文社区称「牛来」)上线的模型为 GLM-5.3-Flash:320B-A18B,GLM-5 系列首个原生多模态模型,以 MIT 协议开源;其训练使用数十万亿词元、由约 10 万张国产芯片支撑,匿名盲测期间曾登顶 OpenRouter 并终结 DeepSeek 连续 56 天霸榜。

A行业级
03

阿里发布并开源 Qwen3.8-Flash

阿里发布并开源 Qwen3.8-Flash:总参 125B、单 token 激活 6B 的多模态 MoE,采用全新「Next」架构(QSA 稀疏注意力 + Gated DeltaNet 混合注意力),训练成本较 Qwen3.7-Plus 下降约 90%,推理定价每百万输入 1 元、输出 3 元;被视为 Qwen4 的雏形,首发上线「千问办公」。

A行业级
04

DeepSeek-V4 Pro 正式版发布

DeepSeek 将 V4 Pro 更新为 0813 正式版:1.6T 总参 MoE、1M 上下文、最大输出 38.4 万 token,首次原生支持图像推理;DeepSWE 从预览版 12.8 升至 62.7,超过 Claude Opus 4.8,部分智能体基准逼近甚至反超 Claude Fable 5。同日发布开源 Agent 开发框架 DeepSeek Harness v0.1。

A行业级
05

Google 发布 Gemini 3.7 Flash

Google 发布 Gemini 3.7 Flash:距 3.6 Flash 仅三周,官方称其为「编程与智能体场景下最智能的主力模型」,DeepSWE 从 49.0% 升至 65.3%、WebDev Arena Elo 1588;限时五折定价(输入 0.75 美元/百万 token),并同步接入 Gemini Spark 与 Enterprise Agent Platform。

A行业级
06

xAI 发布 Grok 4.6

xAI 发布 Grok 4.6:总参数约 1.5T 的 MoE 旗舰,重点强化长时间运行的智能体任务、复杂交互与视觉工作,在 Artificial Analysis 综合智能指数上与 GPT-5.6 Sol 持平(61 分),API 定价明显低于竞品,同步上线 Cursor 与 Grok Build。

A行业级
07

GPT-5.6 Luna 向免费用户开放

OpenAI 宣布免费与 Go 用户默认模型切换为 GPT-5.6 Luna,下周起无限次文本聊天,并新增 Think 按钮让免费档首次可主动调用更高推理;Plus/Pro 的 GPT-5.6 Sol 同步升级,事实错误率较 GPT-5.5 Instant 降约 68%。

A行业级
08

Google 领导层重组,四位元老离职创业

Google 8 月 6 日重组 AI 领导层:Demis Hassabis 卸任日常管理,转任 Alphabet 首席科学家兼 DeepMind 主席;Koray Kavukcuoglu 升 SVP 接管 Gemini;Jeff Dean、Sanjay Ghemawat、Oriol Vinyals、Quoc Le 离职创办 Discovery Loop(谷歌创始投资)。导火索是 Gemini 3.5 Pro 一再延期,Alphabet 股价单日跌约 4%。

A行业级
09

智谱公开 GLM-5 预告

智谱的 ZCode 页面意外曝光了 GLM-5 的预告信息,暗示下一代旗舰将在编程与 Agent 能力上发力。GLM 系列从 GLM-4.5 到 GLM-5 的迭代节奏,是中国大模型竞争加速的缩影。

B领域级
10

阿里发布 Qwen3.8 与 Qwen3.8-Max

阿里云发布 Qwen3.8 与 Qwen3.8-Max:总参数 2.4T、每 token 激活约 950B 的稀疏 MoE 架构,原生多模态视觉与 1M 上下文,CodeArena 全球第四;官方宣布下周开源 Max 权重与 Qwen3.8-27B,并同步推出 Agent 产品「千问办公」。

A行业级
11

Claude Opus 5 发布

Anthropic 发布 Claude Opus 5,定位接近旗舰前沿智能、定价与 Opus 4.8 持平,成为 Claude Max 的新默认模型与 Claude Pro 的最强选项,并随发布带来对话中途工具切换、API 安全回退等工程化机制。

A行业级
12

Gemini 3.6 Flash 发布,旗舰 3.5 Pro 继续缺席

Google DeepMind 发布 Gemini 3.6 Flash,以及 3.5 Flash-Lite 与面向政府试点的 3.5 Flash Cyber;3.6 Flash 把输出定价下调并保持 1M 上下文,官方同时确认旗舰 3.5 Pro 仍在测试、Gemini 4 预训练已经启动。

B领域级
13

Kimi K3 发布并开源

月之暗面发布 Kimi K3,总参数 2.8 万亿、每 token 激活约 1040 亿的 MoE 架构模型,原生支持视觉与百万级上下文;7 月 27 日权重开放,成为当时全球参数最大的开源模型,并在 WebDev Arena 上首次由开源模型登顶。

A行业级
14

GPT-5.6 发布

OpenAI 发布 GPT-5.6,以 Sol、Terra、Luna 三档覆盖旗舰能力、成本平衡与高吞吐,并加入程序化工具调用、多 Agent 编排、显式缓存和持久推理。

B领域级
15

OpenAI 发布 GPT-Live 全双工语音模型

OpenAI 发布全双工语音模型 GPT-Live-1 与 GPT-Live-1 mini,让 ChatGPT 语音能同时听与说,支持同声传译、智能垫话与后台委派;两者分别成为付费与免费用户的默认语音模型,并向 iOS、Android 与网页端逐步推送。

B领域级
16

Claude 5 家族成形

Anthropic 在六月先后推出 Claude Fable 5 与 Sonnet 5:前者面向长时间运行的高难度 Agent,后者强调速度与智能的综合平衡。

B领域级
17

Gemini 3.5 Flash 发布

Google 发布 Gemini 3.5 Flash 正式版,把持续高强度 Agent 与代码任务定位为 Flash 主力场景,并将其设为 gemini-flash-latest 的默认模型。

B领域级
18

DeepSeek 发布 V3.2

DeepSeek 在 2025 年底发布 V3.2,采用更激进的稀疏注意力与 MoE 架构,在保持能力的同时把推理成本进一步压低,继续推动开源模型的效率革命。

B领域级
19

Anthropic 发布 Claude Opus 4.5

Anthropic 发布 Claude Opus 4.5,在深度推理、长任务执行与代码能力上进一步压榨上限,被视为与 GPT-5 系列、Gemini 3 并列的旗舰之一。

A行业级
20

Google 发布 Gemini 3 Pro

谷歌发布 Gemini 3 Pro,在推理、多模态与长上下文上全面对标并部分反超 OpenAI 的 GPT-5 系列。它让谷歌在旗舰竞争里重回前排,也标志着 2025 年底「推理旗舰」之争进入白热化。

A行业级
21

OpenAI 发布 GPT-5.1

OpenAI 发布 GPT-5.1,作为 GPT-5 系列的稳定升级,重点优化推理速度、API 成本与工具调用稳定性。它是「旗舰模型按季迭代」节奏里的关键一环。

A行业级
22

Anthropic 发布 Claude Sonnet 4.5

Anthropic 发布 Claude Sonnet 4.5,在代码与 Agent 能力上比肩甚至超过更大尺寸的旗舰,同时保持更低成本。它把「尺寸不是一切」的竞争逻辑推向极致。

A行业级
23

DeepSeek 发布 V3.1

DeepSeek 发布 V3.1,把上下文窗口大幅扩展并强化工具调用能力,延续「高性价比开源旗舰」路线。它巩固了 DeepSeek 在中国开源模型中的领先位置。

B领域级
24

GPT-5 发布

OpenAI 发布 GPT-5。ChatGPT 以路由系统在快速模型与深度推理模型之间选择;API 则提供 GPT-5、mini 和 nano 三档独立模型及可配置的推理强度,而不是照搬 ChatGPT 路由。

A行业级
25

月之暗面开源 Kimi K2

月之暗面发布 Kimi K2,约 1T 总参数、32B 激活的开放 MoE,编码与 Agent 基准表现突出,把 Kimi 从长上下文聊天产品扩展为全球可下载的旗舰权重。

A行业级
26

xAI 发布 Grok 4

xAI 发布 Grok 4,首次把旗舰能力拉到推理模型的头部阵营,与 GPT、Claude、Gemini 正面竞争。它让 xAI 从「马斯克的另类项目」变成真正的第三极竞争者。

A行业级
27

Anthropic 发布 Claude 4

Anthropic 发布 Claude 4 家族:Opus 4 作为旗舰,Sonnet 4 主打速度与 Agent 任务,并推出支持工具调用的版本。Claude 4 将「长任务自主执行」确立为产品主线,与代码与 Agent 生态深度绑定。

A行业级
28

Gemini 2.5 引入思维过程

谷歌发布 Gemini 2.5,以「思考模型」为核心:模型在回答前进行内部推理,强调编码、数学与长任务能力。Gemini 2.5 让谷歌在推理模型竞赛中重新回到第一梯队。

A行业级
29

百度发布文心 4.5 与 X1

百度同日上线文心 4.5(原生多模态)与文心 X1(深度思考),并在文心一言免费开放,随后承诺开源 4.5 系列,把搜索大厂重新拉回模型军备第一排。

A行业级
30

GPT-4.5 发布

OpenAI 发布 GPT-4.5,宣称这是其最后一个不基于推理的旗舰模型,强化世界知识、自然对话与模式识别。发布后市场反应分化,凸显「纯规模路线 vs 推理路线」的分歧。

A行业级
31

微软曝光自研大模型 MAI-1

微软公开自研大模型 MAI-1,由 Inflection 前团队主导开发,被定位为与 OpenAI 合作之外的自主底座。它标志着微软开始摆脱「单一大模型供应商依赖」。

B领域级
32

Anthropic 发布 Claude 3.7 Sonnet

Anthropic 发布 Claude 3.7 Sonnet,首创「混合推理」模式:同一模型既可在标准模式下快速回答,也可在扩展思维模式下长时间推理。它让推理能力从「特殊模型」变成「默认开关」。

A行业级
33

xAI 发布 Grok 3

xAI 发布 Grok 3,宣称由 Colossus 超算(约 10 万张 GPU)训练,主打推理与数学能力,在发布前后声称某些基准领先。它把 xAI 从追赶者带进前沿竞争的核心圈。

A行业级
34

DeepSeek-R1 发布

DeepSeek 发布开放推理模型 DeepSeek-R1,以强化学习驱动的推理能力和开放权重迅速引发全球关注。

A行业级
35

月之暗面发布 Kimi K1.5

月之暗面发布 Kimi K1.5,用强化学习训练出具备长上下文推理能力的模型,多项基准对齐或超越当时的国际头部推理模型,成为国产推理模型的代表作品。

A行业级
36

DeepSeek-V3 发布

DeepSeek 发布 DeepSeek-V3,以开放权重和显著的训练效率引发行业关注,并让前沿模型的成本结构成为公开讨论的焦点。

B领域级
37

亚马逊发布 Nova 模型家族

亚马逊在 re:Invent 发布 Nova 系列基础模型,覆盖文本、多模态与视频生成,通过 Bedrock 提供给企业。Nova 让亚马逊补上自研大模型拼图,与 Anthropic 合作并行推进。

B领域级
38

Claude Computer Use 公测:模型操作图形界面

Anthropic 在 2024 年 10 月 22 日将 computer use 以公测形式接入 API:模型根据屏幕截图决定移动光标、点击与键入等动作,在实验性条件下用人类方式操作计算机。

A行业级
39

OpenAI o1 发布

OpenAI 发布 o1-preview,把更多计算放到回答前的推理过程,在数学、科学和编程任务上显著提高复杂问题求解能力。

A行业级
40

xAI 发布 Grok-2

xAI 发布 Grok-2,支持图像理解与生成,能力进入全球第一梯队。马斯克的「叛逆」人设与 X 平台数据形成独特打法,也引发关于 AI 约束与安全的持续讨论。

B领域级
41

Meta 发布 Llama 3.1 405B

Meta 发布 Llama 3.1,其中 405B 版本在多项基准上逼近 GPT-4o,是首个与闭源旗舰同场竞技的开源模型。扎克伯格同时发表长文,公开为开源 AI 辩护。

A行业级
42

OpenAI 发布 GPT-4o mini

OpenAI 发布 GPT-4o mini,以极低的价格提供接近 GPT-4o 的能力,把「小模型 + 低价」变成主流选择,引发开发者大规模迁移与行业价格跟进。

B领域级
43

华为云发布盘古大模型 5.0

华为在 HDC 2024 发布盘古 5.0,覆盖 NLP、多模态、视觉、预测与科学计算等分支与多档参数,强调昇腾部署与行业场景,把“硬件+模型+云”绑成一条国产全栈叙事。

B领域级
44

Claude 3.5 Sonnet 发布

Anthropic 发布 Claude 3.5 Sonnet,以更低的价格和更快的速度达到接近或超过上一代旗舰的代码、视觉和推理表现。

B领域级
45

昆仑万维推进天工 / Skywork 大模型

昆仑万维以天工产品与 Skywork 模型系列推进搜索增强对话、多模态与后续开放权重,成为中国互联网第二梯队中坚持全栈模型品牌的代表之一。

B领域级
46

GPT-4o 发布

OpenAI 发布 GPT-4o,以同一神经网络处理文本、视觉与音频,让实时语音和视觉交互第一次成为通用模型的原生能力。

A行业级
47

商汤发布日日新 SenseNova 5.0

商汤在技术日发布 SenseNova 5.0,强调知识、数学、推理与代码,并推出云到端全栈产品矩阵,把 CV 起家的公司更明确地绑在通用大模型战线上。

B领域级
48

Meta 发布 Llama 3

Meta 发布 Llama 3 家族(8B 与 70B),性能大幅提升并随后推出 405B 旗舰。它让开源模型的水平首次逼近闭源前沿模型,也把「开源与闭源之争」推向全球大模型竞争的中心。

A行业级
49

AI21 发布 Jamba 混合架构模型

AI21 Labs 发布 Jamba,首个将 Mamba 状态空间模型与 Transformer 结合的大规模混合架构,在长上下文与吞吐上展示效率优势。

B领域级
50

Kimi 凭超长上下文破圈

月之暗面把 Kimi 的长文本能力推到 200 万字级别,能一次读完几十本书或整份招股书。这一能力让 Kimi 在国产大模型里脱颖而出,成为 2024 年初最出圈的 AI 应用之一。

A行业级
51

Cohere 发布 Command R

Cohere 发布 Command R 系列,专为企业场景优化,强化检索增强生成(RAG)与多语言能力,走「开源可用、企业友好」的差异化路线。

B领域级
52

Anthropic 发布 Claude 3 家族

Anthropic 发布 Claude 3 家族:旗舰 Opus、均衡 Sonnet、轻量 Haiku。Opus 在多项基准上超越 GPT-4,首次支持 20 万 token 上下文。三档齐发的策略让大模型进入「按需选档」时代。

A行业级
53

Google 开源 Gemma

Google 发布开源模型 Gemma,提供 2B 与 7B 两种规模。这是谷歌首次向社区开放自家大模型权重,标志着开源与闭源双线作战成为巨头标配。

B领域级
54

Google 发布 Gemini 1.5

Google 发布 Gemini 1.5 Pro,首次将上下文窗口推向 100 万 token,可在一次推理中处理数小时视频、整本书籍与超长代码库。它把「长上下文」从演示变成可用的产品能力。

A行业级
55

智谱发布 GLM-4

智谱发布 GLM-4,性能对标同期 GPT-4,同时延续开源策略。GLM 系列成为国产大模型中「学术出身、开源与商业并进」路线的代表。

B领域级
56

Mistral 发布 Mixtral 8x7B 混合专家模型

Mistral AI 以 Apache 2.0 发布 Mixtral 8x7B 稀疏混合专家模型:每层 8 组专家、每 token 路由 2 个,总参数约 46.7B、每 token 约 12.9B 激活。厂商报告在多数基准上超过 Llama 2 70B、推理更快,并匹配或超过 GPT-3.5;这些比较由发布方给出。

A行业级
57

Google 发布 Gemini 1.0

Google DeepMind 发布 Gemini 1.0,以 Ultra、Pro、Nano 三个规模覆盖数据中心、通用产品和端侧设备。发布当日 Bard 接入 Pro,Nano 登上 Pixel 8 Pro;Ultra 则等到 2024 年才面向用户开放。

A行业级
58

阶跃星辰发布 Step 系列

阶跃星辰由姜大昕创立,发布 Step 系列大模型,主打万亿参数与多模态能力,成为「大模型六小龙」中的代表之一,其 Step 系列持续迭代并开源部分版本。

B领域级
59

xAI 发布 Grok

埃隆·马斯克创立的 xAI 发布 Grok-1 及配套产品,主打「实时接入 X(推特)」与少约束的幽默风格,向 ChatGPT 发起差异化竞争。

B领域级
60

零一万物发布 Yi 系列

零一万物由李开复创立,发布 Yi 系列大模型,其中 Yi-34B 以较强的中英文综合能力进入开源模型第一梯队,成为「大模型六小龙」中的代表。

B领域级
61

百度发布文心大模型 4.0

百度在 2023 百度世界大会上发布文心大模型 4.0,宣称综合能力与 GPT-4 相当,并接入搜索、地图、网盘等全线产品。它被视为国产大模型对标国际旗舰的标志性一役。

B领域级
62

月之暗面发布 Kimi

月之暗面(Moonshot AI)发布 Kimi 智能助手,以长上下文与中文长文本处理为差异化卖点。它在国产对话产品中以「能读长文档、多轮长对话」快速出圈。

A行业级
63

Mistral 7B 以小模型进入开放生态

Mistral AI 以 Apache 2.0 许可证发布 Mistral 7B 权重。模型采用分组查询注意力和 4096 token 滑动窗口;发布方报告它在多项基准上超过 Llama 2 13B,但这属于厂商基准比较。

B领域级
64

腾讯混元大模型发布

腾讯正式发布混元大模型,覆盖文本、代码、图像等多模态能力,并接入微信、腾讯云等业务。至此,国内互联网巨头全部站上自研大模型的牌桌。

A行业级
65

MiniMax 发布大模型与海螺 AI

MiniMax 发布自研大模型并推出 AI 对话应用海螺 AI,主打多模态与效率。2025 年其 MiniMax-01 系列以新型 MoE 架构与 400 万上下文引发关注,成为国产模型的技术派代表。

B领域级
66

字节发布豆包

字节跳动推出 AI 对话助手豆包,依托火山引擎的云雀大模型。豆包随后凭借字节的流量分发与免费策略迅速成长,成为中国用户规模领先的 AI 应用之一。

B领域级
67

通义千问开放 Qwen 权重

阿里云发布 Qwen-7B 与 Qwen-7B-Chat 的代码和权重;基础模型以超过 2.2 万亿 token 预训练,覆盖中文、英文、代码和多语言文本。许可允许研究使用,月活用户低于一亿的商业主体可直接使用,更大规模须另行申请。

B领域级
68

Meta 发布 Llama 2 开放权重

Meta 发布 Llama 2 预训练与对话微调权重,参数规模 7B、13B、70B,并宣布研究与商业用途免费可用。许可为 Llama 2 社区许可(含可接受使用政策与月活门槛等附加条款),不是无限制的 OSI 开源软件许可;微软为优先云合作方。

A行业级
69

上海 AI 实验室开源 InternLM

上海人工智能实验室发布并开源书生 InternLM 系列大模型,这是中国科研机构主导的国产开源大模型代表,后续迭代出 InternLM2、InternLM3 等版本,并配套开源工具链。

B领域级
70

vLLM 与 PagedAttention 重塑 LLM 服务吞吐

UC Berkeley 等研究者开源 vLLM,并以 PagedAttention 把 KV 缓存拆成可非连续映射的页,降低显存碎片与预留浪费,显著提高大模型服务吞吐。

A行业级
71

百川智能发布 Baichuan 开源大模型

王小川创立的百川智能发布 Baichuan-7B,首个版本即开源,随后推出 Baichuan-13B 与 53B。公司以「开源+商业双轨」切入,成为国产开源大模型的重要参与者。

B领域级
72

OpenAI API 加入函数调用

OpenAI 在 0613 版 GPT-4 与 GPT-3.5 Turbo 中加入函数调用。开发者用 JSON Schema 声明函数,模型返回函数名与参数;应用仍须校验参数、执行函数并把结果送回模型。

A行业级
73

智谱开源 ChatGLM

智谱 AI 发布并开源 ChatGLM 系列,其中包括中文场景优化的对话模型,成为国产开源大模型的重要代表,随后迭代出 ChatGLM2、ChatGLM3 与 GLM-4。

B领域级
74

讯飞星火发布

科大讯飞发布讯飞星火认知大模型,展示文本生成、知识问答、数学推理与多语种能力,并把大模型与自身语音与教育优势结合。

B领域级
75

阿里通义千问正式发布

阿里云宣布通义千问正式开启测试,这是阿里自研大语言模型向公众开放的关键节点。此后通义千问通过 API 与开源(Qwen 系列)两条路扩展,成为国际开源模型格局中的中国代表。

B领域级
76

文心一言开启中国大模型浪潮

百度发布文心一言,以录播演示的方式推出对话模型产品,成为 ChatGPT 后中国主要科技公司里首个正式发布的大模型。发布会当日百度港股一度下跌,也引来对「AI 抢跑 vs 实力」的争论。

A行业级
77

Anthropic 发布 Claude

Anthropic 发布 Claude,并通过 API 及 Slack、Notion 等合作入口提供访问。公司把可预测性、减少有害输出和长文本处理列为产品重点;这些是发布方定位,不是对准确性或安全性的独立认证。

A行业级
78

GPT-4 发布

OpenAI 发布 GPT-4,并报告其在模拟律师资格考试中达到约前 10%,而 GPT-3.5 约在后 10%。图像输入最初仅限合作方测试;技术报告未披露参数量、训练数据构成、架构或训练算力。

A行业级
79

Meta 发布 LLaMA

Meta 发布 7B、13B、33B 和 65B 参数的 LLaMA 论文,并向获批研究者提供非商业许可权重;其中 65B 模型用 1.4 万亿 token 训练。权重随后外泄,社区迅速开发量化、微调和本地推理工具。

A行业级
80

微软把 ChatGPT 放进必应搜索

微软发布新版必应,把 OpenAI 的模型与搜索索引结合,允许用户用自然语言提问并查看带引用的回答。搜索引擎开始从「结果列表」转向「对话加引用」。

A行业级
81

Constitutional AI:用原则与 AI 反馈训练无害性

Anthropic 提出 Constitutional AI:用人类写定的原则列表让模型批评与改写自身输出,再以 AI 反馈做强化学习(RLAIF),在减少有害性人工标签的同时训练更少回避、更能解释拒绝的助手。

A行业级
82

ChatGPT 发布

OpenAI 以免费“研究预览”发布基于 GPT-3.5 的 ChatGPT,把经过人工反馈训练的模型放进保留上下文的网页对话界面。它能连续追问、改写文本和解释代码,也会自信地给出错误答案。

S范式级
83

FlashAttention 用 IO 感知重写精确注意力

Tri Dao 等人提出 FlashAttention:在 GPU 上按块计算精确 softmax 注意力,减少高带宽内存(HBM)读写,从而在不近似注意力数学的前提下加速并节省显存。

A行业级
84

Chinchilla 修正算力最优缩放配比

DeepMind 在 arXiv 发表《Training Compute-Optimal Large Language Models》,训练 400 余个规模从约 7000 万到逾 160 亿参数的模型。结论是算力最优时模型大小与训练 token 应近似等比放大;同算力的 70B Chinchilla(约 1.4T token)全面超过 280B Gopher。

A行业级
85

InstructGPT 用人类反馈对齐指令

OpenAI 公开 InstructGPT 的三阶段训练方法:监督示范微调、人工偏好奖励模型、再用 PPO 强化学习。标注员在成对比较中更常选择 1.3B InstructGPT,而不是大约大 100 倍的 175B GPT-3,但该结果只代表这套任务和标注规范。

S范式级
86

OpenAI Codex 把 GPT-3 适配到代码

OpenAI 发布 Codex API 私有测试版。Codex 由 GPT-3 继续在公开代码上训练,早期 12B 版本在 HumanEval 单次采样中解出 28.8% 的题目,并为 GitHub Copilot 提供模型能力。

A行业级
87

LoRA 提出大模型低秩适配

微软研究者提出 LoRA:冻结预训练权重,在 Transformer 层注入可训练的低秩分解矩阵。相对全量微调 GPT-3 175B,论文报告可训练参数约降一万倍、显存约降三倍,合并后不增加推理延迟。

A行业级
88

华为发布盘古大模型

华为在华为云开发者大会上发布盘古系列大模型,覆盖 NLP、视觉、多模态等方向,主打行业场景落地。它是中国早期由科技巨头主导的大模型尝试之一。

B领域级
89

EleutherAI 开源 GPT-Neo

EleutherAI 发布 GPT-Neo 1.3B 与 2.7B,证明没有科技巨头预算的独立社区也能训练出可用的语言大模型,为开源 AI 的后续繁荣埋下伏笔。

B领域级
90

CLIP 用自然语言监督连接图文

OpenAI 发布 CLIP:在大规模图文对上对比训练图像编码器与文本编码器,使模型可用自然语言描述做零样本图像分类,并开放代码与权重示例。

A行业级
91

GPT-3 发布

OpenAI 训练 1750 亿参数 GPT-3,并以零样本、单样本和少样本提示评估它。模型无需更新权重即可尝试翻译、问答、文本生成和简单代码,但不同任务的结果差异很大。

A行业级
92

RAG 检索增强生成论文

Facebook AI 提出 RAG:用稠密检索从文档库取出相关段落,再与预训练序列到序列模型一起条件生成答案,在开放域问答等任务上验证有效。

A行业级
93

神经语言模型缩放规律被量化

OpenAI 研究者在跨越七个数量级的计算规模上拟合经验幂律,测量语言模型交叉熵损失随参数量、数据量和训练计算量的变化,并提出当时的计算预算分配公式。

A行业级
94

GPT-2 展示零样本任务迁移

OpenAI 公布在约 800 万个网页文档上训练的 15 亿参数 GPT-2,并演示模型在不做任务微调时完成基础问答、摘要和翻译。公司起初只发布较小版本,随后于 2019 年 11 月放出完整模型。

A行业级
95

Hugging Face Transformers 库成型

Hugging Face 推出并扩展 Transformers 库,把 BERT 等预训练模型的加载、分词与微调收成统一 API,降低复现与迁移成本。

A行业级
96

BERT 发布

Google 发布 BERT,以掩码语言建模和下一句预测预训练双向 Transformer 编码器。3.4 亿参数的 BERT-Large 只增加小型输出层,便在 GLUE、SQuAD 等 11 项任务上刷新当时最佳结果。

A行业级
97

GPT-1 验证生成式预训练

OpenAI 在 BooksCorpus 上预训练 1.17 亿参数、12 层的 Transformer 解码器,再分别微调到 12 个有监督任务;论文报告其中 9 项刷新当时最佳结果。

A行业级
98

Transformer 架构论文发表

Google 研究者在机器翻译论文中提出 Transformer,用自注意力、前馈网络和位置编码构成编码器—解码器,去掉循环和卷积。

S范式级
谱系

相关模型谱系

AI21 Jamba / Jurassic 谱系Jamba 1.5 Qwen(通义千问)模型谱系Qwen3.8-Flash / Qwen3.8-Max Amazon Nova 模型谱系Nova Premier / 最新档 Claude 模型谱系Claude Fable 5 / Opus 5 / Sonnet 5 百川模型谱系Baichuan4 系列 文心 ERNIE 模型谱系文心 5.x 豆包 / Seed 模型谱系SeedRealtime · Seedance 2.5 / Seed2.1 Cohere Command 模型谱系Command A DeepSeek 模型谱系DeepSeek-V4-Pro(0813 正式版)· V4-Flash(正式版) Gemini 模型谱系Gemini 3.7 Flash Gemma 模型谱系Gemma 3 华为盘古模型谱系盘古 5.x / Ultra IBM Granite 谱系Granite 3.x 讯飞星火模型谱系星火 X1 / 高阶版本 书生·浦语 InternLM 模型谱系InternLM3 天工 Skywork 谱系Skywork / SkyReels Llama 模型谱系Llama 4 Scout / Maverick Microsoft Phi 模型谱系Phi-4 系列 MiniMax 模型谱系MiniMax-M3 Mistral 模型谱系Mistral Large / 开放权重家族 Kimi 模型谱系Kimi K3 NVIDIA Nemotron / Cosmos 谱系Nemotron / Cosmos OpenAI 模型谱系GPT-5.6(Sol / Terra / Luna)· GPT-Live 商汤日日新 SenseNova 谱系SenseNova 最新代 阶跃星辰 Step 模型谱系Step 系列最新旗舰 混元 / Hy 模型谱系Hy4 preview Grok 模型谱系Grok 4.6 Yi 模型谱系Yi-Lightning 智谱 GLM 模型谱系GLM-5.3 / GLM-5.3-Flash
机构

相关机构

AI21 Labs以 Jurassic 与 Jamba(SSM+Transformer 混合)探索高效长上下文企业模型。 阿里巴巴 / Alibaba通过通义千问(Qwen)家族把中文与多语言开放模型做成持续迭代的云与开发者生态。 Amazon / AWS以 Amazon Nova 自研模型与 Bedrock 多厂商托管平台服务企业生成式 AI。 Anthropic以 AI 安全为核心、以长上下文和可靠 Agent 为产品特色的大模型公司。 百川智能 / Baichuan王小川创立,以快速开源 Baichuan/Baichuan2 与后续 Baichuan4 企业 API 进入中文大模型第一梯队。 百度 / Baidu以文心(ERNIE)知识增强预训练与文心一言产品为核心,覆盖搜索、云与行业大模型。 字节跳动 / ByteDance以豆包大模型与 Seed 研究品牌覆盖通用、推理、语音与视频生成,并通过火山引擎与 C 端豆包形成双轮交付。 Cohere面向企业检索增强与 Agent 的 Command 系列模型公司,强调 RAG、工具调用与私有部署。 DeepSeek(深度求索)以高效训练和开源策略著称的中国大模型公司,以低成本实现前沿性能。 Google DeepMind深度强化学习与科学 AI 的核心实验室,AlphaGo/AlphaFold 与 Gemini 研究同源。 Google以 Gemini 与 Gemma 覆盖闭源旗舰与开放轻量,并把模型嵌入搜索与云。 华为 / Huawei以盘古大模型与昇腾算力服务政企与行业,强调全栈自主与行业落地。 IBM从 Deep Blue、Watson 到 Granite 开放企业模型,服务受监管行业。 科大讯飞 / iFlytek以语音技术起家,星火大模型面向教育、办公与政企,强调中文与行业落地。 上海人工智能实验室 / Shanghai AI Lab以书生·浦语(InternLM)开放模型服务科研与产业,强调可复现训练与中文能力。 昆仑万维 / Kunlun以天工 Skywork 大模型覆盖搜索、对话与多模态,并布局海外产品矩阵。 Meta以 Llama 开放权重推动全球开源生态,覆盖研究、企业与端侧。 Microsoft以 Azure、Copilot 与 Phi 小模型把前沿与端侧 AI 写入操作系统与办公套件。 MiniMax以 abab / M 系列语言模型与海螺视频等多媒体生成见长,强调小激活参数下的强 Agent 与编码能力。 Mistral AI欧洲开源与高效模型代表,从 7B、Mixtral 到 Codestral 与 Large 旗舰。 月之暗面 / Moonshot AI以超长上下文与 Kimi 产品闻名的中国大模型公司,后以 K2 开放 MoE 进入全球编码与 Agent 竞争。 NVIDIA以 CUDA 与 GPU 成为现代深度学习默认算力层,并发布 Nemotron、Cosmos 等模型。 OpenAI大语言模型、AI 产品化和 Agent 方向的核心推动者。 商汤 / SenseTime计算机视觉起家的中国 AI 公司,以日日新 SenseNova 大模型覆盖多模态与行业。 阶跃星辰 / StepFun以 Step 系列多模态与推理模型见长的中国创业公司,覆盖图像、视频与长上下文。 腾讯 / Tencent以混元(Hunyuan/Hy)大模型服务微信、元宝与云生态,并在视频、3D 与开源侧扩张。 xAI埃隆·马斯克创立,以 Grok 模型与 X 平台实时信息结合,强调推理、工具与少审查风格。 零一万物 / 01.AI李开复创立的大模型公司,以 Yi 开放权重系列与 Yi-Lightning 高性价比 MoE 进入全球榜单。 智谱 AI / Zhipu以 GLM 架构与 ChatGLM 开源生态起家,提供基座模型、多模态与 Agent 产品的国产大模型公司。

试试搜索