语音 AI

从「Siri 让语音助手进入大众手机」到「字节发布 SeedRealtime 音视频全双工模型」,先抓住起点、路线转向与当前边界,再展开完整事件线。

01

字节发布 SeedRealtime 音视频全双工模型

字节跳动发布 SeedRealtime:原生音视频全双工大模型,统一端到端架构融合音频、视频与文本,豆包 App 全量上线视频通话;官方称相比级联模型,节奏问题减少约 50%。

A行业级
02

腾讯混元发布 Hy ASR 3.0

腾讯混元发布 Hy ASR 3.0 preview,在中文普通话识别上取得进展,官方公布的中文普通话词错率进一步下降。它显示国产语音模型在多语言与口音泛化上持续投入。

B领域级
03

OpenAI 发布 GPT-Live 全双工语音模型

OpenAI 发布全双工语音模型 GPT-Live-1 与 GPT-Live-1 mini,让 ChatGPT 语音能同时听与说,支持同声传译、智能垫话与后台委派;两者分别成为付费与免费用户的默认语音模型,并向 iOS、Android 与网页端逐步推送。

B领域级
04

Google 发布 Veo 3 原生音频视频

Google 在 I/O 2025 周期发布 Veo 3,强调原生同步音频(对白、音效、环境声)与更强可控性,并逐步接入 Gemini 应用与 API。

A行业级
05

GPT-4o 发布

OpenAI 发布 GPT-4o,以同一神经网络处理文本、视觉与音频,让实时语音和视觉交互第一次成为通用模型的原生能力。

A行业级
06

讯飞星火发布

科大讯飞发布讯飞星火认知大模型,展示文本生成、知识问答、数学推理与多语种能力,并把大模型与自身语音与教育优势结合。

B领域级
07

OpenAI 开源 Whisper 语音识别

OpenAI 发布 Whisper:在约 68 万小时多语、多任务监督音频上训练的端到端语音系统,并开源推理代码与模型权重。官方称在多样数据集上零样本表现更稳健,错误约比专项模型少 50%。

A行业级
08

Google Duplex 用 AI 打电话订餐

Google 在 I/O 大会上演示 Duplex:AI 用自然的语气打电话替用户预约理发与餐厅,与真人对话时语气词、停顿都惟妙惟肖。它让「AI 替人打电话」从科幻变成演示,也引发关于透明度的伦理讨论。

B领域级
09

DeepMind 发布 WaveNet

DeepMind 公布 WaveNet,一种直接生成原始音频波形的深度生成模型,在英文与中文语音合成中显著提升自然度,被认为大幅缩小了机器语音与人声的差距。

B领域级
10

Amazon Echo 与 Alexa 问世

亚马逊发布 Echo 智能音箱与 Alexa 语音助手,把语音交互带进客厅。它验证了「对话式 AI + 硬件」的产品形态,也让语音助手之战从手机蔓延到家庭。

B领域级
11

Siri 让语音助手进入大众手机

苹果在 iPhone 4S 发布会上展示 Siri,让语音助手成为智能手机的标配叙事。它把自然语言理解、语音识别与联网服务整合进一个消费者产品。

B领域级
谱系

相关模型谱系

文心 ERNIE 模型谱系文心 5.x 豆包 / Seed 模型谱系SeedRealtime · Seedance 2.5 / Seed2.1 OpenAI 模型谱系GPT-5.6(Sol / Terra / Luna)· GPT-Live
机构

相关机构

百度 / Baidu以文心(ERNIE)知识增强预训练与文心一言产品为核心,覆盖搜索、云与行业大模型。 字节跳动 / ByteDance以豆包大模型与 Seed 研究品牌覆盖通用、推理、语音与视频生成,并通过火山引擎与 C 端豆包形成双轮交付。 OpenAI大语言模型、AI 产品化和 Agent 方向的核心推动者。

试试搜索