生成式媒体

从「GAN 提出对抗式生成训练」到「欧盟《人工智能法》扩大实施,透明度与通用模型义务开始执法」,先抓住起点、路线转向与当前边界,再展开完整事件线。

01

欧盟《人工智能法》扩大实施,透明度与通用模型义务开始执法

欧盟《人工智能法》于 2026 年 8 月 2 日进入新的执法阶段:面向公众的系统必须披露 AI 身份,深度伪造必须带机器可读标识,通用 AI 模型提供商开始受欧洲 AI 办公室监管;高风险条款经"综合简化"一揽子计划推迟至 2027 年 12 月起分批适用。

A行业级
02

Seedance 2.5 冲击 30 秒连续生成

火山引擎 Force 后,Seedance 2.5 进入公开上线窗口,宣称单次扩散生成最长约 30 秒连续片段、减少分段拼接,把视频生成竞争轴从画质推进到原生时长。

B领域级
03

Sora 网页与应用停服

OpenAI 于 2026 年 4 月 26 日停用 Sora 网页与应用体验;API 计划于同年 9 月 24 日关停。短视频生成旗舰从必须对标变成可持续性反例。

A行业级
04

Seedance 2.0 发布与版权风暴

字节 Seed 团队正式发布 Seedance 2.0,写实多模态视频生成迅速出圈;数日内好莱坞片方与行业协会密集发函,全球上线节奏受阻,视频生成进入“能力—版权”硬碰撞阶段。

A行业级
05

OpenAI 发布 Sora 2

OpenAI 发布 Sora 2 旗舰视频与音频生成模型,同步 iOS 应用与水印策略,把 2024 年底的订阅生成能力升级为更强的多模态产品,并探索信息流式分发。

A行业级
06

字节跳动发布 Seedance 1.0

火山引擎 Force 大会发布 Seedance 1.0 与 Pro 等视频生成基座,支持文/图输入与多镜头叙事,并接入豆包等内容入口,把字节的视频生成能力推到公开产品前台。

A行业级
07

Google 发布 Veo 3 原生音频视频

Google 在 I/O 2025 周期发布 Veo 3,强调原生同步音频(对白、音效、环境声)与更强可控性,并逐步接入 Gemini 应用与 API。

A行业级
08

Luma 发布 Ray2 视频模型

Luma 在 Dream Machine 上线 Ray2,宣称相对前代约 10 倍训练算力,强调快速连贯运动、细节与事件逻辑,面向付费订阅创作者。

B领域级
09

Sora 对 ChatGPT 用户正式开放

OpenAI 将 Sora 向 ChatGPT Plus/Pro 用户开放(先美国等地),把 2024 年 2 月的研究演示推进为可在产品内生成短视频的订阅能力。

A行业级
10

腾讯开源混元视频模型

腾讯开源 HunyuanVideo 等视频生成基础模型,以较大参数规模进入开源视频权重第一梯队,并在 Hugging Face 等平台获得高下载量。

A行业级
11

李飞飞创办 World Labs

AI 教母李飞飞宣布创办 World Labs,专注「空间智能」:让 AI 理解三维世界的几何与物理。公司几个月后发布首个可交互生成世界模型,把世界模型路线从概念推向产品。

B领域级
12

Black Forest Labs 发布 FLUX.1

Black Forest Labs 发布 FLUX.1 家族(pro / dev / schnell),在提示遵循与细节上显著抬升开放与 API 文生图上限,并迅速成为社区默认高质量选项之一。

A行业级
13

Runway 发布 Gen-3 Alpha

Runway 发布 Gen-3 Alpha,在运动、时序一致性与可控性上相对 Gen-2 明显抬升,巩固其在广告与影视预演工具链中的位置。

B领域级
14

快手发布可灵 Kling 1.0

快手发布可灵(Kling)1.0 文/图生视频模型,强调大幅运动、镜头语言与较高时序一致性,迅速成为全球视频生成产品对照系之一。

A行业级
15

Google 发布 Veo 视频生成模型

Google 在 I/O 2024 公布 DeepMind 的 Veo 文生视频模型,宣称可生成更高分辨率、更长片段的视频,与 Sora 演示后的全球赛道正式对位。

A行业级
16

生数发布 Vidu 1.0

生数科技发布 Vidu 1.0 文生视频模型与应用,强调动态一致性与角色稳定,成为 Sora 演示之后最早一批可实际试用的中国视频生成产品之一。

B领域级
17

Stability AI 发布 Stable Diffusion 3

Stability AI 发布 Stable Diffusion 3,采用新的多模态扩散变压器架构,在文字渲染与多主体遵循上显著进步。开源图像生成迎来架构换代。

B领域级
18

Sora 展示长时文生视频

OpenAI 公布 Sora 研究预览,可根据文字生成最长一分钟、保持较高视觉质量和镜头连贯性的视频。

A行业级
19

Midjourney 发布 V6

Midjourney V6 在提示遵循与文字渲染上明显进步,使社区默认美学从“氛围滤镜”更接近可执行的设计说明。

B领域级
20

艺术家集体起诉生成式 AI 公司

一批艺术家对 Stability AI、Midjourney 等公司提起集体诉讼,指控其用受版权保护的图像训练模型。这开启了对 AI 训练数据合法性的全球法律博弈。

B领域级
21

Character.AI 公测

由前谷歌研究员创办的 Character.AI 开放公测,用户可以和虚构人物、历史人物或自建角色对话,开创了「AI 伴侣与角色扮演」这一消费级赛道。

B领域级
22

Stable Diffusion 开放文生图权重

Stability AI 与 CompVis 发布 Stable Diffusion 1.4 的代码和约 4GB 权重。模型在压缩潜空间中去噪,能在消费级 GPU 上生成 512×512 图像,也让本地微调和第三方界面迅速扩散。

S范式级
23

Midjourney 在 Discord 里开启文生图热潮

Midjourney 以 Discord 机器人形式开放公开测试,用户通过文本指令生成风格独特的图像。它凭借社群传播与独特美学快速走红,成为文生图大众化的标志性产品之一。

A行业级
24

DALL·E 2 让文生图进入实用阶段

OpenAI 发布 DALL·E 2,用扩散模型把文本描述转成高分辨率图像,支持编辑与变体生成。它让「文生图」从研究演示变成大众可体验的创作工具。

A行业级
25

OpenAI 发布 DALL·E

OpenAI 公布约 120 亿参数的 DALL·E:把文本与图像离散 token 编入同一序列,用解码器 Transformer 从文字描述生成图像,并通过受控样例展示组合概念与零样本式生成。

A行业级
26

DDPM 让扩散模型成为实用生成路线

Ho、Jain 与 Abbeel 提出 DDPM:训练网络预测逐步加入图像的噪声,再用 1000 步反向过程采样。论文在 CIFAR-10 上报告 3.17 的 FID 和 9.46 的 Inception Score。

A行业级
27

Deepfake 引发全球警惕

基于生成式模型的换脸视频「Deepfake」在网络上大规模传播,首次让公众直面 AI 造假对信任、隐私与安全的冲击,也催生了检测与治理的长期军备竞赛。

B领域级
28

DeepMind 发布 WaveNet

DeepMind 公布 WaveNet,一种直接生成原始音频波形的深度生成模型,在英文与中文语音合成中显著提升自然度,被认为大幅缩小了机器语音与人声的差距。

B领域级
29

GAN 提出对抗式生成训练

Ian Goodfellow 等人提出生成对抗网络,以同一个 minimax 目标训练生成器与判别器。论文在 MNIST、Toronto Face Database 和 CIFAR-10 上展示结果,并指出两部分训练需要保持同步。

A行业级
谱系

相关模型谱系

Flux 模型谱系Flux 1.1 / Pro 豆包 / Seed 模型谱系SeedRealtime · Seedance 2.5 / Seed2.1 快手可灵 Kling 谱系Kling 2.x Luma Dream Machine 谱系Ray2 / Dream Machine Midjourney 模型谱系V7 / 最新 MiniMax 模型谱系MiniMax-M3 OpenAI 模型谱系GPT-5.6(Sol / Terra / Luna)· GPT-Live Runway Gen 视频谱系Gen-3 / 后续 Stable Diffusion 谱系Stable Diffusion 3 / 后续 混元 / Hy 模型谱系Hy4 preview Vidu 视频谱系Vidu 2.x
机构

相关机构

Black Forest LabsStable Diffusion 核心作者团队创立,以 Flux 系列重新定义开放与 API 文生图质量。 字节跳动 / ByteDance以豆包大模型与 Seed 研究品牌覆盖通用、推理、语音与视频生成,并通过火山引擎与 C 端豆包形成双轮交付。 快手 / Kuaishou以可灵(Kling)视频生成模型进入全球文生视频竞争,依托短视频内容生态。 Luma AI以 Dream Machine 视频模型与 3D 捕获技术连接生成媒体与空间计算。 Midjourney以 Discord 社区驱动的文生图产品定义消费级生成美学与迭代节奏。 MiniMax以 abab / M 系列语言模型与海螺视频等多媒体生成见长,强调小激活参数下的强 Agent 与编码能力。 OpenAI大语言模型、AI 产品化和 Agent 方向的核心推动者。 Runway以 Gen 系列视频模型与创意工具链推动文/图生视频进入专业制作工作流。 Stability AI以 Stable Diffusion 开放文生图权重点燃本地生成生态,并延伸到视频与 3D。 腾讯 / Tencent以混元(Hunyuan/Hy)大模型服务微信、元宝与云生态,并在视频、3D 与开源侧扩张。 生数科技 / Shengshu以 Vidu 视频大模型进入全球文生视频赛道,强调动态一致性与中文场景。 World Labs专注「空间智能」,用生成式世界模型让 AI 理解并实时生成三维世界。

试试搜索