推理模型
从「xAI 发布 Grok-2」到「智谱发布 GLM-5.3」,先抓住起点、路线转向与当前边界,再展开完整事件线。
智谱发布 GLM-5.3
智谱发布 GLM-5.3:基座与 GLM-5.2 相同,通过极致的后训练 Scaling(强化学习)大幅提升智能上界,编程能力较前代提升约 50%,主打智能体编程与防御性网络安全;官方承诺安全评估完成后两周内开源权重。
DeepSeek-V4 Pro 正式版发布
DeepSeek 将 V4 Pro 更新为 0813 正式版:1.6T 总参 MoE、1M 上下文、最大输出 38.4 万 token,首次原生支持图像推理;DeepSWE 从预览版 12.8 升至 62.7,超过 Claude Opus 4.8,部分智能体基准逼近甚至反超 Claude Fable 5。同日发布开源 Agent 开发框架 DeepSeek Harness v0.1。
xAI 发布 Grok 4.6
xAI 发布 Grok 4.6:总参数约 1.5T 的 MoE 旗舰,重点强化长时间运行的智能体任务、复杂交互与视觉工作,在 Artificial Analysis 综合智能指数上与 GPT-5.6 Sol 持平(61 分),API 定价明显低于竞品,同步上线 Cursor 与 Grok Build。
GPT-5.6 Luna 向免费用户开放
OpenAI 宣布免费与 Go 用户默认模型切换为 GPT-5.6 Luna,下周起无限次文本聊天,并新增 Think 按钮让免费档首次可主动调用更高推理;Plus/Pro 的 GPT-5.6 Sol 同步升级,事实错误率较 GPT-5.5 Instant 降约 68%。
智谱公开 GLM-5 预告
智谱的 ZCode 页面意外曝光了 GLM-5 的预告信息,暗示下一代旗舰将在编程与 Agent 能力上发力。GLM 系列从 GLM-4.5 到 GLM-5 的迭代节奏,是中国大模型竞争加速的缩影。
Claude Opus 5 发布
Anthropic 发布 Claude Opus 5,定位接近旗舰前沿智能、定价与 Opus 4.8 持平,成为 Claude Max 的新默认模型与 Claude Pro 的最强选项,并随发布带来对话中途工具切换、API 安全回退等工程化机制。
GPT-5.6 发布
OpenAI 发布 GPT-5.6,以 Sol、Terra、Luna 三档覆盖旗舰能力、成本平衡与高吞吐,并加入程序化工具调用、多 Agent 编排、显式缓存和持久推理。
Claude 5 家族成形
Anthropic 在六月先后推出 Claude Fable 5 与 Sonnet 5:前者面向长时间运行的高难度 Agent,后者强调速度与智能的综合平衡。
Gemini 3.5 Flash 发布
Google 发布 Gemini 3.5 Flash 正式版,把持续高强度 Agent 与代码任务定位为 Flash 主力场景,并将其设为 gemini-flash-latest 的默认模型。
DeepSeek-V4 预览版发布
DeepSeek 开源 V4 Pro 与 Flash 预览版,把 1M 上下文、思考模式和 Agent 编程能力放进同一家族,并继续强调稀疏架构的成本效率。
Anthropic 发布 Claude Opus 4.5
Anthropic 发布 Claude Opus 4.5,在深度推理、长任务执行与代码能力上进一步压榨上限,被视为与 GPT-5 系列、Gemini 3 并列的旗舰之一。
Google 发布 Gemini 3 Pro
谷歌发布 Gemini 3 Pro,在推理、多模态与长上下文上全面对标并部分反超 OpenAI 的 GPT-5 系列。它让谷歌在旗舰竞争里重回前排,也标志着 2025 年底「推理旗舰」之争进入白热化。
OpenAI 发布 GPT-5.1
OpenAI 发布 GPT-5.1,作为 GPT-5 系列的稳定升级,重点优化推理速度、API 成本与工具调用稳定性。它是「旗舰模型按季迭代」节奏里的关键一环。
Anthropic 发布 Claude Sonnet 4.5
Anthropic 发布 Claude Sonnet 4.5,在代码与 Agent 能力上比肩甚至超过更大尺寸的旗舰,同时保持更低成本。它把「尺寸不是一切」的竞争逻辑推向极致。
GPT-5 发布
OpenAI 发布 GPT-5。ChatGPT 以路由系统在快速模型与深度推理模型之间选择;API 则提供 GPT-5、mini 和 nano 三档独立模型及可配置的推理强度,而不是照搬 ChatGPT 路由。
月之暗面开源 Kimi K2
月之暗面发布 Kimi K2,约 1T 总参数、32B 激活的开放 MoE,编码与 Agent 基准表现突出,把 Kimi 从长上下文聊天产品扩展为全球可下载的旗舰权重。
xAI 发布 Grok 4
xAI 发布 Grok 4,首次把旗舰能力拉到推理模型的头部阵营,与 GPT、Claude、Gemini 正面竞争。它让 xAI 从「马斯克的另类项目」变成真正的第三极竞争者。
阿里发布 Qwen3 系列
阿里发布 Qwen3 系列,从 0.6B 到旗舰 235B(MoE)全面开源,原生支持思考/非思考双模式。Qwen3-235B 在多项评测中成为最强开源模型之一,改写开源与闭源的实力版图。
OpenAI 发布 o3 与 o4-mini
OpenAI 发布 o3 与 o4-mini,首次让推理模型在 ChatGPT 内自主调用搜索、代码执行、图像等全套工具。它把「推理」与「行动」首次系统性地结合到旗舰模型里。
Gemini 2.5 引入思维过程
谷歌发布 Gemini 2.5,以「思考模型」为核心:模型在回答前进行内部推理,强调编码、数学与长任务能力。Gemini 2.5 让谷歌在推理模型竞赛中重新回到第一梯队。
百度发布文心 4.5 与 X1
百度同日上线文心 4.5(原生多模态)与文心 X1(深度思考),并在文心一言免费开放,随后承诺开源 4.5 系列,把搜索大厂重新拉回模型军备第一排。
Anthropic 发布 Claude 3.7 Sonnet
Anthropic 发布 Claude 3.7 Sonnet,首创「混合推理」模式:同一模型既可在标准模式下快速回答,也可在扩展思维模式下长时间推理。它让推理能力从「特殊模型」变成「默认开关」。
xAI 发布 Grok 3
xAI 发布 Grok 3,宣称由 Colossus 超算(约 10 万张 GPU)训练,主打推理与数学能力,在发布前后声称某些基准领先。它把 xAI 从追赶者带进前沿竞争的核心圈。
DeepSeek-R1 发布
DeepSeek 发布开放推理模型 DeepSeek-R1,以强化学习驱动的推理能力和开放权重迅速引发全球关注。
月之暗面发布 Kimi K1.5
月之暗面发布 Kimi K1.5,用强化学习训练出具备长上下文推理能力的模型,多项基准对齐或超越当时的国际头部推理模型,成为国产推理模型的代表作品。
OpenAI o1 发布
OpenAI 发布 o1-preview,把更多计算放到回答前的推理过程,在数学、科学和编程任务上显著提高复杂问题求解能力。
xAI 发布 Grok-2
xAI 发布 Grok-2,支持图像理解与生成,能力进入全球第一梯队。马斯克的「叛逆」人设与 X 平台数据形成独特打法,也引发关于 AI 约束与安全的持续讨论。