生成式媒体
从「GAN 提出对抗式生成训练」到「欧盟《人工智能法》扩大实施,透明度与通用模型义务开始执法」,先抓住起点、路线转向与当前边界,再展开完整事件线。
欧盟《人工智能法》扩大实施,透明度与通用模型义务开始执法
欧盟《人工智能法》于 2026 年 8 月 2 日进入新的执法阶段:面向公众的系统必须披露 AI 身份,深度伪造必须带机器可读标识,通用 AI 模型提供商开始受欧洲 AI 办公室监管;高风险条款经"综合简化"一揽子计划推迟至 2027 年 12 月起分批适用。
Seedance 2.5 冲击 30 秒连续生成
火山引擎 Force 后,Seedance 2.5 进入公开上线窗口,宣称单次扩散生成最长约 30 秒连续片段、减少分段拼接,把视频生成竞争轴从画质推进到原生时长。
Sora 网页与应用停服
OpenAI 于 2026 年 4 月 26 日停用 Sora 网页与应用体验;API 计划于同年 9 月 24 日关停。短视频生成旗舰从必须对标变成可持续性反例。
Seedance 2.0 发布与版权风暴
字节 Seed 团队正式发布 Seedance 2.0,写实多模态视频生成迅速出圈;数日内好莱坞片方与行业协会密集发函,全球上线节奏受阻,视频生成进入“能力—版权”硬碰撞阶段。
OpenAI 发布 Sora 2
OpenAI 发布 Sora 2 旗舰视频与音频生成模型,同步 iOS 应用与水印策略,把 2024 年底的订阅生成能力升级为更强的多模态产品,并探索信息流式分发。
字节跳动发布 Seedance 1.0
火山引擎 Force 大会发布 Seedance 1.0 与 Pro 等视频生成基座,支持文/图输入与多镜头叙事,并接入豆包等内容入口,把字节的视频生成能力推到公开产品前台。
Google 发布 Veo 3 原生音频视频
Google 在 I/O 2025 周期发布 Veo 3,强调原生同步音频(对白、音效、环境声)与更强可控性,并逐步接入 Gemini 应用与 API。
Luma 发布 Ray2 视频模型
Luma 在 Dream Machine 上线 Ray2,宣称相对前代约 10 倍训练算力,强调快速连贯运动、细节与事件逻辑,面向付费订阅创作者。
Sora 对 ChatGPT 用户正式开放
OpenAI 将 Sora 向 ChatGPT Plus/Pro 用户开放(先美国等地),把 2024 年 2 月的研究演示推进为可在产品内生成短视频的订阅能力。
腾讯开源混元视频模型
腾讯开源 HunyuanVideo 等视频生成基础模型,以较大参数规模进入开源视频权重第一梯队,并在 Hugging Face 等平台获得高下载量。
李飞飞创办 World Labs
AI 教母李飞飞宣布创办 World Labs,专注「空间智能」:让 AI 理解三维世界的几何与物理。公司几个月后发布首个可交互生成世界模型,把世界模型路线从概念推向产品。
Black Forest Labs 发布 FLUX.1
Black Forest Labs 发布 FLUX.1 家族(pro / dev / schnell),在提示遵循与细节上显著抬升开放与 API 文生图上限,并迅速成为社区默认高质量选项之一。
Runway 发布 Gen-3 Alpha
Runway 发布 Gen-3 Alpha,在运动、时序一致性与可控性上相对 Gen-2 明显抬升,巩固其在广告与影视预演工具链中的位置。
快手发布可灵 Kling 1.0
快手发布可灵(Kling)1.0 文/图生视频模型,强调大幅运动、镜头语言与较高时序一致性,迅速成为全球视频生成产品对照系之一。
Google 发布 Veo 视频生成模型
Google 在 I/O 2024 公布 DeepMind 的 Veo 文生视频模型,宣称可生成更高分辨率、更长片段的视频,与 Sora 演示后的全球赛道正式对位。
生数发布 Vidu 1.0
生数科技发布 Vidu 1.0 文生视频模型与应用,强调动态一致性与角色稳定,成为 Sora 演示之后最早一批可实际试用的中国视频生成产品之一。
Stability AI 发布 Stable Diffusion 3
Stability AI 发布 Stable Diffusion 3,采用新的多模态扩散变压器架构,在文字渲染与多主体遵循上显著进步。开源图像生成迎来架构换代。
Sora 展示长时文生视频
OpenAI 公布 Sora 研究预览,可根据文字生成最长一分钟、保持较高视觉质量和镜头连贯性的视频。
Midjourney 发布 V6
Midjourney V6 在提示遵循与文字渲染上明显进步,使社区默认美学从“氛围滤镜”更接近可执行的设计说明。
艺术家集体起诉生成式 AI 公司
一批艺术家对 Stability AI、Midjourney 等公司提起集体诉讼,指控其用受版权保护的图像训练模型。这开启了对 AI 训练数据合法性的全球法律博弈。
Character.AI 公测
由前谷歌研究员创办的 Character.AI 开放公测,用户可以和虚构人物、历史人物或自建角色对话,开创了「AI 伴侣与角色扮演」这一消费级赛道。
Stable Diffusion 开放文生图权重
Stability AI 与 CompVis 发布 Stable Diffusion 1.4 的代码和约 4GB 权重。模型在压缩潜空间中去噪,能在消费级 GPU 上生成 512×512 图像,也让本地微调和第三方界面迅速扩散。
Midjourney 在 Discord 里开启文生图热潮
Midjourney 以 Discord 机器人形式开放公开测试,用户通过文本指令生成风格独特的图像。它凭借社群传播与独特美学快速走红,成为文生图大众化的标志性产品之一。
DALL·E 2 让文生图进入实用阶段
OpenAI 发布 DALL·E 2,用扩散模型把文本描述转成高分辨率图像,支持编辑与变体生成。它让「文生图」从研究演示变成大众可体验的创作工具。
OpenAI 发布 DALL·E
OpenAI 公布约 120 亿参数的 DALL·E:把文本与图像离散 token 编入同一序列,用解码器 Transformer 从文字描述生成图像,并通过受控样例展示组合概念与零样本式生成。
DDPM 让扩散模型成为实用生成路线
Ho、Jain 与 Abbeel 提出 DDPM:训练网络预测逐步加入图像的噪声,再用 1000 步反向过程采样。论文在 CIFAR-10 上报告 3.17 的 FID 和 9.46 的 Inception Score。
Deepfake 引发全球警惕
基于生成式模型的换脸视频「Deepfake」在网络上大规模传播,首次让公众直面 AI 造假对信任、隐私与安全的冲击,也催生了检测与治理的长期军备竞赛。
DeepMind 发布 WaveNet
DeepMind 公布 WaveNet,一种直接生成原始音频波形的深度生成模型,在英文与中文语音合成中显著提升自然度,被认为大幅缩小了机器语音与人声的差距。
GAN 提出对抗式生成训练
Ian Goodfellow 等人提出生成对抗网络,以同一个 minimax 目标训练生成器与判别器。论文在 MNIST、Toronto Face Database 和 CIFAR-10 上展示结果,并指出两部分训练需要保持同步。