多模态 AI
从「GAN 提出对抗式生成训练」到「阿里发布并开源 Qwen3.8-Flash」,先抓住起点、路线转向与当前边界,再展开完整事件线。
智谱开源 GLM-5.3-Flash(Ox Alpha)
智谱「认领」此前以匿名身份 Ox Alpha(中文社区称「牛来」)上线的模型为 GLM-5.3-Flash:320B-A18B,GLM-5 系列首个原生多模态模型,以 MIT 协议开源;其训练使用数十万亿词元、由约 10 万张国产芯片支撑,匿名盲测期间曾登顶 OpenRouter 并终结 DeepSeek 连续 56 天霸榜。
阿里发布并开源 Qwen3.8-Flash
阿里发布并开源 Qwen3.8-Flash:总参 125B、单 token 激活 6B 的多模态 MoE,采用全新「Next」架构(QSA 稀疏注意力 + Gated DeltaNet 混合注意力),训练成本较 Qwen3.7-Plus 下降约 90%,推理定价每百万输入 1 元、输出 3 元;被视为 Qwen4 的雏形,首发上线「千问办公」。
字节发布 SeedRealtime 音视频全双工模型
字节跳动发布 SeedRealtime:原生音视频全双工大模型,统一端到端架构融合音频、视频与文本,豆包 App 全量上线视频通话;官方称相比级联模型,节奏问题减少约 50%。
Google 发布 Gemini Robotics 2
Google DeepMind 发布 Gemini Robotics 2:VLA 模型 + ER 2 具身推理 + On-Device 2 端侧模型,在 Apptronik Apollo 2 人形机器人上演示,并推出 ASIMOV-Agentic 安全基准。
阿里发布 Qwen3.8 与 Qwen3.8-Max
阿里云发布 Qwen3.8 与 Qwen3.8-Max:总参数 2.4T、每 token 激活约 950B 的稀疏 MoE 架构,原生多模态视觉与 1M 上下文,CodeArena 全球第四;官方宣布下周开源 Max 权重与 Qwen3.8-27B,并同步推出 Agent 产品「千问办公」。
Gemini 3.6 Flash 发布,旗舰 3.5 Pro 继续缺席
Google DeepMind 发布 Gemini 3.6 Flash,以及 3.5 Flash-Lite 与面向政府试点的 3.5 Flash Cyber;3.6 Flash 把输出定价下调并保持 1M 上下文,官方同时确认旗舰 3.5 Pro 仍在测试、Gemini 4 预训练已经启动。
Kimi K3 发布并开源
月之暗面发布 Kimi K3,总参数 2.8 万亿、每 token 激活约 1040 亿的 MoE 架构模型,原生支持视觉与百万级上下文;7 月 27 日权重开放,成为当时全球参数最大的开源模型,并在 WebDev Arena 上首次由开源模型登顶。
Seedance 2.5 冲击 30 秒连续生成
火山引擎 Force 后,Seedance 2.5 进入公开上线窗口,宣称单次扩散生成最长约 30 秒连续片段、减少分段拼接,把视频生成竞争轴从画质推进到原生时长。
Google 发布 Gemini 3 Pro
谷歌发布 Gemini 3 Pro,在推理、多模态与长上下文上全面对标并部分反超 OpenAI 的 GPT-5 系列。它让谷歌在旗舰竞争里重回前排,也标志着 2025 年底「推理旗舰」之争进入白热化。
OpenAI 发布 Sora 2
OpenAI 发布 Sora 2 旗舰视频与音频生成模型,同步 iOS 应用与水印策略,把 2024 年底的订阅生成能力升级为更强的多模态产品,并探索信息流式分发。
字节跳动发布 Seedance 1.0
火山引擎 Force 大会发布 Seedance 1.0 与 Pro 等视频生成基座,支持文/图输入与多镜头叙事,并接入豆包等内容入口,把字节的视频生成能力推到公开产品前台。
Google 发布 Veo 3 原生音频视频
Google 在 I/O 2025 周期发布 Veo 3,强调原生同步音频(对白、音效、环境声)与更强可控性,并逐步接入 Gemini 应用与 API。
Llama 4 发布
Meta 发布 Llama 4 Scout 与 Maverick,采用混合专家架构并原生支持多模态,把开放权重模型推向超长上下文和更高计算效率。
Gemini 2.5 引入思维过程
谷歌发布 Gemini 2.5,以「思考模型」为核心:模型在回答前进行内部推理,强调编码、数学与长任务能力。Gemini 2.5 让谷歌在推理模型竞赛中重新回到第一梯队。
百度发布文心 4.5 与 X1
百度同日上线文心 4.5(原生多模态)与文心 X1(深度思考),并在文心一言免费开放,随后承诺开源 4.5 系列,把搜索大厂重新拉回模型军备第一排。
Luma 发布 Ray2 视频模型
Luma 在 Dream Machine 上线 Ray2,宣称相对前代约 10 倍训练算力,强调快速连贯运动、细节与事件逻辑,面向付费订阅创作者。
Google 发布 Gemini 2.0
Google 发布 Gemini 2.0 Flash,主打原生多模态与 Agentic 能力,并演示 Project Mariner 等浏览器代理。它把 Google 的战略重心从对话模型转向「能替你干活」的智能体。
Sora 对 ChatGPT 用户正式开放
OpenAI 将 Sora 向 ChatGPT Plus/Pro 用户开放(先美国等地),把 2024 年 2 月的研究演示推进为可在产品内生成短视频的订阅能力。
亚马逊发布 Nova 模型家族
亚马逊在 re:Invent 发布 Nova 系列基础模型,覆盖文本、多模态与视频生成,通过 Bedrock 提供给企业。Nova 让亚马逊补上自研大模型拼图,与 Anthropic 合作并行推进。
腾讯开源混元视频模型
腾讯开源 HunyuanVideo 等视频生成基础模型,以较大参数规模进入开源视频权重第一梯队,并在 Hugging Face 等平台获得高下载量。
Claude Computer Use 公测:模型操作图形界面
Anthropic 在 2024 年 10 月 22 日将 computer use 以公测形式接入 API:模型根据屏幕截图决定移动光标、点击与键入等动作,在实验性条件下用人类方式操作计算机。
Black Forest Labs 发布 FLUX.1
Black Forest Labs 发布 FLUX.1 家族(pro / dev / schnell),在提示遵循与细节上显著抬升开放与 API 文生图上限,并迅速成为社区默认高质量选项之一。
Runway 发布 Gen-3 Alpha
Runway 发布 Gen-3 Alpha,在运动、时序一致性与可控性上相对 Gen-2 明显抬升,巩固其在广告与影视预演工具链中的位置。
Apple 发布 Apple Intelligence
苹果在 WWDC 公布 Apple Intelligence:端侧 Foundation Models 与私有云协同,把写作、图像、通知摘要与 Siri 升级做成系统级功能,而不是独立聊天 App。
快手发布可灵 Kling 1.0
快手发布可灵(Kling)1.0 文/图生视频模型,强调大幅运动、镜头语言与较高时序一致性,迅速成为全球视频生成产品对照系之一。
昆仑万维推进天工 / Skywork 大模型
昆仑万维以天工产品与 Skywork 模型系列推进搜索增强对话、多模态与后续开放权重,成为中国互联网第二梯队中坚持全栈模型品牌的代表之一。
Google 发布 Veo 视频生成模型
Google 在 I/O 2024 公布 DeepMind 的 Veo 文生视频模型,宣称可生成更高分辨率、更长片段的视频,与 Sora 演示后的全球赛道正式对位。
GPT-4o 发布
OpenAI 发布 GPT-4o,以同一神经网络处理文本、视觉与音频,让实时语音和视觉交互第一次成为通用模型的原生能力。
生数发布 Vidu 1.0
生数科技发布 Vidu 1.0 文生视频模型与应用,强调动态一致性与角色稳定,成为 Sora 演示之后最早一批可实际试用的中国视频生成产品之一。
商汤发布日日新 SenseNova 5.0
商汤在技术日发布 SenseNova 5.0,强调知识、数学、推理与代码,并推出云到端全栈产品矩阵,把 CV 起家的公司更明确地绑在通用大模型战线上。
Google 发布 Gemini 1.5
Google 发布 Gemini 1.5 Pro,首次将上下文窗口推向 100 万 token,可在一次推理中处理数小时视频、整本书籍与超长代码库。它把「长上下文」从演示变成可用的产品能力。
Sora 展示长时文生视频
OpenAI 公布 Sora 研究预览,可根据文字生成最长一分钟、保持较高视觉质量和镜头连贯性的视频。
面壁开源 MiniCPM 端侧模型
面壁智能与 OpenBMB 开源 MiniCPM 系列,以小参数中文友好基座强调端侧可部署;随后 MiniCPM-V 把多模态也压进边缘设备叙事。
Midjourney 发布 V6
Midjourney V6 在提示遵循与文字渲染上明显进步,使社区默认美学从“氛围滤镜”更接近可执行的设计说明。
Google 发布 Gemini 1.0
Google DeepMind 发布 Gemini 1.0,以 Ultra、Pro、Nano 三个规模覆盖数据中心、通用产品和端侧设备。发布当日 Bard 接入 Pro,Nano 登上 Pixel 8 Pro;Ultra 则等到 2024 年才面向用户开放。
阶跃星辰发布 Step 系列
阶跃星辰由姜大昕创立,发布 Step 系列大模型,主打万亿参数与多模态能力,成为「大模型六小龙」中的代表之一,其 Step 系列持续迭代并开源部分版本。
xAI 发布 Grok
埃隆·马斯克创立的 xAI 发布 Grok-1 及配套产品,主打「实时接入 X(推特)」与少约束的幽默风格,向 ChatGPT 发起差异化竞争。
MiniMax 发布大模型与海螺 AI
MiniMax 发布自研大模型并推出 AI 对话应用海螺 AI,主打多模态与效率。2025 年其 MiniMax-01 系列以新型 MoE 架构与 400 万上下文引发关注,成为国产模型的技术派代表。
GPT-4 发布
OpenAI 发布 GPT-4,并报告其在模拟律师资格考试中达到约前 10%,而 GPT-3.5 约在后 10%。图像输入最初仅限合作方测试;技术报告未披露参数量、训练数据构成、架构或训练算力。
OpenAI 开源 Whisper 语音识别
OpenAI 发布 Whisper:在约 68 万小时多语、多任务监督音频上训练的端到端语音系统,并开源推理代码与模型权重。官方称在多样数据集上零样本表现更稳健,错误约比专项模型少 50%。
Stable Diffusion 开放文生图权重
Stability AI 与 CompVis 发布 Stable Diffusion 1.4 的代码和约 4GB 权重。模型在压缩潜空间中去噪,能在消费级 GPU 上生成 512×512 图像,也让本地微调和第三方界面迅速扩散。
DeepMind 发布 Gato 通才智能体
DeepMind 发布 Gato,一个用单一 Transformer 权重同时完成 604 项任务的多模态智能体,从电子游戏、机械臂控制到对话与图像描述。它被视为「通才智能体」路线的标志性实验。
DALL·E 2 让文生图进入实用阶段
OpenAI 发布 DALL·E 2,用扩散模型把文本描述转成高分辨率图像,支持编辑与变体生成。它让「文生图」从研究演示变成大众可体验的创作工具。
CLIP 用自然语言监督连接图文
OpenAI 发布 CLIP:在大规模图文对上对比训练图像编码器与文本编码器,使模型可用自然语言描述做零样本图像分类,并开放代码与权重示例。
OpenAI 发布 DALL·E
OpenAI 公布约 120 亿参数的 DALL·E:把文本与图像离散 token 编入同一序列,用解码器 Transformer 从文字描述生成图像,并通过受控样例展示组合概念与零样本式生成。
DDPM 让扩散模型成为实用生成路线
Ho、Jain 与 Abbeel 提出 DDPM:训练网络预测逐步加入图像的噪声,再用 1000 步反向过程采样。论文在 CIFAR-10 上报告 3.17 的 FID 和 9.46 的 Inception Score。
GAN 提出对抗式生成训练
Ian Goodfellow 等人提出生成对抗网络,以同一个 minimax 目标训练生成器与判别器。论文在 MNIST、Toronto Face Database 和 CIFAR-10 上展示结果,并指出两部分训练需要保持同步。