AI Agent
从「GitHub Copilot 发布」到「腾讯混元发布并开源 Hy4 preview」,先抓住起点、路线转向与当前边界,再展开完整事件线。
腾讯混元发布并开源 Hy4 preview
腾讯混元发布并开源 Hy4 preview:770B 总参、49B 激活的 MoE,上下文突破 1M,Apache 2.0 协议;定位「为生产力而生」,聚焦软件工程、办公分析、游戏开发与科学研究,在 WorkBuddy/CodeBuddy、元宝、ima 等产品同步首发,并首次参与自身研发全链路形成「初步的递归自我改进闭环」。
智谱发布 GLM-5.3
智谱发布 GLM-5.3:基座与 GLM-5.2 相同,通过极致的后训练 Scaling(强化学习)大幅提升智能上界,编程能力较前代提升约 50%,主打智能体编程与防御性网络安全;官方承诺安全评估完成后两周内开源权重。
DeepSeek-V4 Pro 正式版发布
DeepSeek 将 V4 Pro 更新为 0813 正式版:1.6T 总参 MoE、1M 上下文、最大输出 38.4 万 token,首次原生支持图像推理;DeepSWE 从预览版 12.8 升至 62.7,超过 Claude Opus 4.8,部分智能体基准逼近甚至反超 Claude Fable 5。同日发布开源 Agent 开发框架 DeepSeek Harness v0.1。
Google 发布 Gemini 3.7 Flash
Google 发布 Gemini 3.7 Flash:距 3.6 Flash 仅三周,官方称其为「编程与智能体场景下最智能的主力模型」,DeepSWE 从 49.0% 升至 65.3%、WebDev Arena Elo 1588;限时五折定价(输入 0.75 美元/百万 token),并同步接入 Gemini Spark 与 Enterprise Agent Platform。
xAI 发布 Grok 4.6
xAI 发布 Grok 4.6:总参数约 1.5T 的 MoE 旗舰,重点强化长时间运行的智能体任务、复杂交互与视觉工作,在 Artificial Analysis 综合智能指数上与 GPT-5.6 Sol 持平(61 分),API 定价明显低于竞品,同步上线 Cursor 与 Grok Build。
Meta 发布并开源 Muse Glimmer
Meta 超级智能实验室发布 Muse Glimmer:约 30B 参数的稠密多模态智能体模型,由闭源基座 Muse Spark 逻辑蒸馏而来,Apache 2.0 开源,可在 24GB 显存消费级 GPU 或 M4/M5 Max MacBook 上完全本地运行;扎克伯格同日发文宣布 Meta 重返开源。
字节发布 SeedRealtime 音视频全双工模型
字节跳动发布 SeedRealtime:原生音视频全双工大模型,统一端到端架构融合音频、视频与文本,豆包 App 全量上线视频通话;官方称相比级联模型,节奏问题减少约 50%。
阿里发布 Qwen3.8 与 Qwen3.8-Max
阿里云发布 Qwen3.8 与 Qwen3.8-Max:总参数 2.4T、每 token 激活约 950B 的稀疏 MoE 架构,原生多模态视觉与 1M 上下文,CodeArena 全球第四;官方宣布下周开源 Max 权重与 Qwen3.8-27B,并同步推出 Agent 产品「千问办公」。
DeepSeek-V4-Flash 正式版发布
DeepSeek 发布 V4-Flash 正式版(V4-Flash-0731),取代预览版:思考/非思考双模式、1M 上下文、Agent 能力增强与推测解码;8 月 6 日公告整体上调 API 定价,市场解读为低价策略转折与 V4-Pro 正式版信号。
Claude Opus 5 发布
Anthropic 发布 Claude Opus 5,定位接近旗舰前沿智能、定价与 Opus 4.8 持平,成为 Claude Max 的新默认模型与 Claude Pro 的最强选项,并随发布带来对话中途工具切换、API 安全回退等工程化机制。
Gemini 3.6 Flash 发布,旗舰 3.5 Pro 继续缺席
Google DeepMind 发布 Gemini 3.6 Flash,以及 3.5 Flash-Lite 与面向政府试点的 3.5 Flash Cyber;3.6 Flash 把输出定价下调并保持 1M 上下文,官方同时确认旗舰 3.5 Pro 仍在测试、Gemini 4 预训练已经启动。
GPT-5.6 发布
OpenAI 发布 GPT-5.6,以 Sol、Terra、Luna 三档覆盖旗舰能力、成本平衡与高吞吐,并加入程序化工具调用、多 Agent 编排、显式缓存和持久推理。
OpenAI 发布 GPT-Live 全双工语音模型
OpenAI 发布全双工语音模型 GPT-Live-1 与 GPT-Live-1 mini,让 ChatGPT 语音能同时听与说,支持同声传译、智能垫话与后台委派;两者分别成为付费与免费用户的默认语音模型,并向 iOS、Android 与网页端逐步推送。
Claude 5 家族成形
Anthropic 在六月先后推出 Claude Fable 5 与 Sonnet 5:前者面向长时间运行的高难度 Agent,后者强调速度与智能的综合平衡。
Gemini 3.5 Flash 发布
Google 发布 Gemini 3.5 Flash 正式版,把持续高强度 Agent 与代码任务定位为 Flash 主力场景,并将其设为 gemini-flash-latest 的默认模型。
Anthropic 发布 Claude Opus 4.5
Anthropic 发布 Claude Opus 4.5,在深度推理、长任务执行与代码能力上进一步压榨上限,被视为与 GPT-5 系列、Gemini 3 并列的旗舰之一。
Anthropic 发布 Claude Sonnet 4.5
Anthropic 发布 Claude Sonnet 4.5,在代码与 Agent 能力上比肩甚至超过更大尺寸的旗舰,同时保持更低成本。它把「尺寸不是一切」的竞争逻辑推向极致。
GPT-5 发布
OpenAI 发布 GPT-5。ChatGPT 以路由系统在快速模型与深度推理模型之间选择;API 则提供 GPT-5、mini 和 nano 三档独立模型及可配置的推理强度,而不是照搬 ChatGPT 路由。
月之暗面开源 Kimi K2
月之暗面发布 Kimi K2,约 1T 总参数、32B 激活的开放 MoE,编码与 Agent 基准表现突出,把 Kimi 从长上下文聊天产品扩展为全球可下载的旗舰权重。
Anthropic 发布 Claude 4
Anthropic 发布 Claude 4 家族:Opus 4 作为旗舰,Sonnet 4 主打速度与 Agent 任务,并推出支持工具调用的版本。Claude 4 将「长任务自主执行」确立为产品主线,与代码与 Agent 生态深度绑定。
OpenAI Codex 云端编程 Agent 上线
OpenAI 在 ChatGPT 中发布 Codex 研究预览,为每个任务启动隔离云端环境,读取仓库、修改代码、运行测试并返回补丁证据。
OpenAI 开源 Codex CLI 终端编程 Agent
OpenAI 在发布 o3 与 o4-mini 的同时开源 Codex CLI:可在本地终端读仓库、改文件、跑命令的编程 Agent,与云端 Codex 任务队列形成终端与云端双轨。
OpenAI 发布 o3 与 o4-mini
OpenAI 发布 o3 与 o4-mini,首次让推理模型在 ChatGPT 内自主调用搜索、代码执行、图像等全套工具。它把「推理」与「行动」首次系统性地结合到旗舰模型里。
OpenAI 推出 Responses API 与 Agents SDK
OpenAI 发布 Responses API、内置网页搜索、文件搜索和计算机使用工具,并开源 Agents SDK 管理工具、交接、护栏和追踪。
Manus 引爆通用智能体热潮
初创公司 Monica(蝴蝶效应)发布 Manus,一个被包装为「自主完成复杂任务」的通用智能体。演示视频显示它能筛选简历、写报告、分析数据,上线即引爆社交媒体与邀请码经济。
Claude Code 发布
Anthropic 随 Claude 3.7 Sonnet 发布 Claude Code 研究预览。这个命令行工具读取仓库、修改文件、运行命令,并在每次高风险操作前请求权限。
OpenAI 推出 Deep Research
OpenAI 面向 Pro 用户发布 Deep Research,让模型自主多轮搜索、阅读与整合资料,输出带引用的研究报告。它把「研究助理」变成了 AI 的成熟产品形态。
OpenAI 发布 Operator
OpenAI 推出 Operator,一个能独立操作浏览器完成订餐、填表、购物等任务的通用 Agent。它是「AI 替你干活」从聊天走向行动的代表性产品。
Google 发布 Gemini 2.0
Google 发布 Gemini 2.0 Flash,主打原生多模态与 Agentic 能力,并演示 Project Mariner 等浏览器代理。它把 Google 的战略重心从对话模型转向「能替你干活」的智能体。
MCP 协议发布
Anthropic 发布 Model Context Protocol,定义 AI 应用发现和调用外部工具、资源及提示模板的客户端—服务器接口。
Codeium 发布 Windsurf AI IDE
Codeium 推出 Windsurf 编辑器与 Cascade Agent,强调跨文件流程与持续上下文,与 Cursor 竞争“AI 原生 IDE”品类。
Claude Computer Use 公测:模型操作图形界面
Anthropic 在 2024 年 10 月 22 日将 computer use 以公测形式接入 API:模型根据屏幕截图决定移动光标、点击与键入等动作,在实验性条件下用人类方式操作计算机。
Cursor 确立 AI 原生编辑器路线
Anysphere 宣布完成 6000 万美元 A 轮融资。Cursor 已把模型聊天、代码库索引和生成式编辑直接放进基于 VS Code 的开发环境。
Claude 3.5 Sonnet 发布
Anthropic 发布 Claude 3.5 Sonnet,以更低的价格和更快的速度达到接近或超过上一代旗舰的代码、视觉和推理表现。
Claude Tool Use 正式可用
Anthropic 宣布 Claude Tool Use 正式可用。开发者用 JSON Schema 定义客户端工具,Claude 返回 `tool_use` 内容块和结构化参数;实际执行、权限检查与结果回传仍由客户端负责。
Devin 把“软件工程 Agent”带入大众视野
Cognition 公布 Devin,展示一个在沙箱中规划任务、编辑代码、运行命令、浏览文档并提交结果的软件工程 Agent。
OpenAI 发布 Assistants API
OpenAI 在 DevDay 以测试版发布 Assistants API,定义 Assistant、Thread、Message 与 Run 等托管对象,并接入文件检索、Code Interpreter 和函数调用。它把会话状态交给平台管理,也引入了由平台规定的运行状态机。
OpenAI 推出自定义 GPTs
OpenAI 在首届 DevDay 发布 GPTs,让 ChatGPT Plus 和 Enterprise 用户用指令、上传文件、内置工具及自定义 Actions 配置专用助手,无需重新训练模型。原定 11 月上线的 GPT Store 延至 2024 年 1 月开放。
SWE-bench 用真实 GitHub Issue 评测编程 Agent
普林斯顿团队发布 SWE-bench,把真实 Python 仓库中的 2,294 个已解决 Issue 转成可执行的软件工程评测任务。
Continue 开源 IDE 编程助手
Continue 以开源 VS Code / JetBrains 扩展提供聊天、补全与代码库上下文,强调开发者自带模型与可定制工作流,成为商业 AI IDE 之外的开放对照。
OpenAI API 加入函数调用
OpenAI 在 0613 版 GPT-4 与 GPT-3.5 Turbo 中加入函数调用。开发者用 JSON Schema 声明函数,模型返回函数名与参数;应用仍须校验参数、执行函数并把结果送回模型。
Aider 把 Git 结对写进终端
开源工具 Aider 在终端中对接多厂商 LLM,按聊天指令直接修改本地 Git 仓库并生成可审查 diff,成为 Agent Coding 兴起前最重要的开源结对路径之一。
AutoGPT 引爆自主智能体实验
开源项目 AutoGPT 发布,展示让 GPT-4 自主拆分目标、调用工具并迭代执行的思路。它虽不成熟,却让「AI 智能体」成为生成式 AI 最热门的叙事之一。
ChatGPT 插件连接外部服务
OpenAI 向候补名单用户开放 ChatGPT 插件测试。第三方以域名下的清单文件和 OpenAPI 规范描述接口,模型可据此选择调用;最初的浏览器和代码解释器插件由 OpenAI 自己提供。
DeepMind 发布 Gato 通才智能体
DeepMind 发布 Gato,一个用单一 Transformer 权重同时完成 604 项任务的多模态智能体,从电子游戏、机械臂控制到对话与图像描述。它被视为「通才智能体」路线的标志性实验。
GitHub Copilot 发布
GitHub 发布 Copilot 技术预览,把 OpenAI Codex 生成的单行或整段函数建议直接放进 Visual Studio Code。开发者需主动接受建议,GitHub 同时明确提示生成代码可能错误或复现训练数据中的模式。