AI 应用
从「MYCIN 医疗专家系统」到「GPT-5.6 Luna 向免费用户开放」,先抓住起点、路线转向与当前边界,再展开完整事件线。
GPT-5.6 Luna 向免费用户开放
OpenAI 宣布免费与 Go 用户默认模型切换为 GPT-5.6 Luna,下周起无限次文本聊天,并新增 Think 按钮让免费档首次可主动调用更高推理;Plus/Pro 的 GPT-5.6 Sol 同步升级,事实错误率较 GPT-5.5 Instant 降约 68%。
字节发布 SeedRealtime 音视频全双工模型
字节跳动发布 SeedRealtime:原生音视频全双工大模型,统一端到端架构融合音频、视频与文本,豆包 App 全量上线视频通话;官方称相比级联模型,节奏问题减少约 50%。
Google 发布 Gemini Robotics 2
Google DeepMind 发布 Gemini Robotics 2:VLA 模型 + ER 2 具身推理 + On-Device 2 端侧模型,在 Apptronik Apollo 2 人形机器人上演示,并推出 ASIMOV-Agentic 安全基准。
腾讯混元发布 Hy ASR 3.0
腾讯混元发布 Hy ASR 3.0 preview,在中文普通话识别上取得进展,官方公布的中文普通话词错率进一步下降。它显示国产语音模型在多语言与口音泛化上持续投入。
Sora 网页与应用停服
OpenAI 于 2026 年 4 月 26 日停用 Sora 网页与应用体验;API 计划于同年 9 月 24 日关停。短视频生成旗舰从必须对标变成可持续性反例。
Seedance 2.0 发布与版权风暴
字节 Seed 团队正式发布 Seedance 2.0,写实多模态视频生成迅速出圈;数日内好莱坞片方与行业协会密集发函,全球上线节奏受阻,视频生成进入“能力—版权”硬碰撞阶段。
OpenAI 发布 Sora 2
OpenAI 发布 Sora 2 旗舰视频与音频生成模型,同步 iOS 应用与水印策略,把 2024 年底的订阅生成能力升级为更强的多模态产品,并探索信息流式分发。
Manus 引爆通用智能体热潮
初创公司 Monica(蝴蝶效应)发布 Manus,一个被包装为「自主完成复杂任务」的通用智能体。演示视频显示它能筛选简历、写报告、分析数据,上线即引爆社交媒体与邀请码经济。
OpenAI 推出 Deep Research
OpenAI 面向 Pro 用户发布 Deep Research,让模型自主多轮搜索、阅读与整合资料,输出带引用的研究报告。它把「研究助理」变成了 AI 的成熟产品形态。
OpenAI 发布 Operator
OpenAI 推出 Operator,一个能独立操作浏览器完成订餐、填表、购物等任务的通用 Agent。它是「AI 替你干活」从聊天走向行动的代表性产品。
Luma 发布 Ray2 视频模型
Luma 在 Dream Machine 上线 Ray2,宣称相对前代约 10 倍训练算力,强调快速连贯运动、细节与事件逻辑,面向付费订阅创作者。
Sora 对 ChatGPT 用户正式开放
OpenAI 将 Sora 向 ChatGPT Plus/Pro 用户开放(先美国等地),把 2024 年 2 月的研究演示推进为可在产品内生成短视频的订阅能力。
ChatGPT 上线联网搜索
OpenAI 发布 ChatGPT Search,让聊天助手直接联网检索并以实时信息作答,附带来源链接。它把 AI 对话推向搜索场景,直接挑战传统搜索引擎。
Runway 发布 Gen-3 Alpha
Runway 发布 Gen-3 Alpha,在运动、时序一致性与可控性上相对 Gen-2 明显抬升,巩固其在广告与影视预演工具链中的位置。
Apple 发布 Apple Intelligence
苹果在 WWDC 公布 Apple Intelligence:端侧 Foundation Models 与私有云协同,把写作、图像、通知摘要与 Siri 升级做成系统级功能,而不是独立聊天 App。
快手发布可灵 Kling 1.0
快手发布可灵(Kling)1.0 文/图生视频模型,强调大幅运动、镜头语言与较高时序一致性,迅速成为全球视频生成产品对照系之一。
Google 发布 Veo 视频生成模型
Google 在 I/O 2024 公布 DeepMind 的 Veo 文生视频模型,宣称可生成更高分辨率、更长片段的视频,与 Sora 演示后的全球赛道正式对位。
生数发布 Vidu 1.0
生数科技发布 Vidu 1.0 文生视频模型与应用,强调动态一致性与角色稳定,成为 Sora 演示之后最早一批可实际试用的中国视频生成产品之一。
Sora 展示长时文生视频
OpenAI 公布 Sora 研究预览,可根据文字生成最长一分钟、保持较高视觉质量和镜头连贯性的视频。
Apple Vision Pro 发售
Apple Vision Pro 正式发售,以眼动、手势与语音为交互方式,把计算从平面屏幕带进空间。它首次让「空间计算」成为大众可购买的产品形态,也展示了苹果对 AI 与硬件的融合思路。
Neuralink 完成首例人体植入
马斯克创办的 Neuralink 宣布完成首例人体大脑植入,患者在术后能用意念控制电脑光标。它是脑机接口领域的标志性事件,也是「AI 与人脑直连」愿景的临床起点。
百度发布文心大模型 4.0
百度在 2023 百度世界大会上发布文心大模型 4.0,宣称综合能力与 GPT-4 相当,并接入搜索、地图、网盘等全线产品。它被视为国产大模型对标国际旗舰的标志性一役。
微软把 Copilot 铺满全产品线
微软在 2023 年秋季发布会上宣布统一品牌 Copilot:Bing、Windows、Microsoft 365 全线接入 AI 助手。微软把「AI 作为软件的新交互层」推向亿级用户,确立了生产力软件拥抱大模型的模板。
Perplexity AI 上线
Perplexity AI 上线,把检索与生成结合成「答案引擎」:直接引用来源给出回答。它开创了对话式 AI 搜索的新范式,与传统的「十条蓝色链接」形成对比。
ChatGPT 发布
OpenAI 以免费“研究预览”发布基于 GPT-3.5 的 ChatGPT,把经过人工反馈训练的模型放进保留上下文的网页对话界面。它能连续追问、改写文本和解释代码,也会自信地给出错误答案。
特斯拉发布 Optimus 人形机器人
特斯拉在 AI Day 上首次展示 Optimus 人形机器人原型,宣称将复用造车的电机、电池与 FSD 算法。它把「人形机器人」从实验室概念推向公众视野与产业热度。
OpenAI 开源 Whisper 语音识别
OpenAI 发布 Whisper:在约 68 万小时多语、多任务监督音频上训练的端到端语音系统,并开源推理代码与模型权重。官方称在多样数据集上零样本表现更稳健,错误约比专项模型少 50%。
Character.AI 公测
由前谷歌研究员创办的 Character.AI 开放公测,用户可以和虚构人物、历史人物或自建角色对话,开创了「AI 伴侣与角色扮演」这一消费级赛道。
Stable Diffusion 开放文生图权重
Stability AI 与 CompVis 发布 Stable Diffusion 1.4 的代码和约 4GB 权重。模型在压缩潜空间中去噪,能在消费级 GPU 上生成 512×512 图像,也让本地微调和第三方界面迅速扩散。
OpenAI 发布 DALL·E
OpenAI 公布约 120 亿参数的 DALL·E:把文本与图像离散 token 编入同一序列,用解码器 Transformer 从文字描述生成图像,并通过受控样例展示组合概念与零样本式生成。
Waymo One 商业运营启动
Waymo 在凤凰城启动 Waymo One,首次向公众开放付费的自动驾驶出租车服务,把自动驾驶从路测 demo 推进到商业化运营阶段。
Google Duplex 用 AI 打电话订餐
Google 在 I/O 大会上演示 Duplex:AI 用自然的语气打电话替用户预约理发与餐厅,与真人对话时语气词、停顿都惟妙惟肖。它让「AI 替人打电话」从科幻变成演示,也引发关于透明度的伦理讨论。
百度开放 Apollo 自动驾驶平台
百度发布 Apollo 自动驾驶开放平台,向全球开发者与车企开放高精地图、感知、规划等模块。它希望用开放生态对抗 Waymo 的封闭路线,成为中国自动驾驶的标志性事件。
谷歌发布神经机器翻译
谷歌宣布其在线翻译改用神经机器翻译(GNMT),端到端深度模型在质量上大幅超越传统统计方法。它宣告深度学习接管了机器翻译这一重要应用领域。
YOLO 提出实时目标检测
Redmon 等人提出 YOLO(You Only Look Once),把目标检测变成单次回归问题,一帧图像一次前向推理即可输出所有目标的位置与类别,速度达到实时。它开创了单阶段检测路线,深刻影响自动驾驶、监控与终端视觉。
特斯拉上线 Autopilot
特斯拉通过 OTA 向 Model S 推送 Autopilot,把车道保持、自适应巡航等辅助驾驶能力带到量产车上。它是「用数据+软件迭代做自动驾驶」路线的标志性起点。
Amazon Echo 与 Alexa 问世
亚马逊发布 Echo 智能音箱与 Alexa 语音助手,把语音交互带进客厅。它验证了「对话式 AI + 硬件」的产品形态,也让语音助手之战从手机蔓延到家庭。
Netflix 百万美元推荐大赛
Netflix 宣布悬赏 100 万美元,奖励能把其推荐算法准确率提升 10% 的团队。大赛吸引了全球上千支队伍,最终由多团队融合算法夺冠,也让「机器学习竞赛」成为普及概念。
Amazon Mechanical Turk 上线
亚马逊上线 Mechanical Turk(MTurk),让企业把人类难以自动化的任务拆成微任务分发给在线工人。它成了 AI 数据标注的基础设施,也把「众包人工」嵌入机器学习流水线,改变了数据生产的方式。
DARPA 自动驾驶挑战赛
DARPA 在 2004、2005、2007 年举办三届自动驾驶挑战赛。首届无车完赛,第二届 5 辆车跑完全程,2007 年的城市挑战赛则要求车辆在模拟城市中遵守交规。比赛直接催化了现代自动驾驶产业。
iRobot 发布 Roomba
iRobot 推出 Roomba 扫地机器人,用简单的传感器与随机覆盖策略完成清扫。它没有「智能」光环,却第一次让机器人成为大众消费品,为后来家用机器人与具身智能积累了用户与数据基础。
Mobileye 让视觉走进量产汽车
希伯来大学教授沙舒亚创办 Mobileye,用单目摄像头和专用视觉芯片做量产车的辅助驾驶感知。它把「机器看懂道路」从论文变成前装量产件,成为自动驾驶产业最早也最成功的商业化路线之一。
Google 成立
拉里·佩奇和谢尔盖·布林在车库创立 Google,核心是 PageRank 算法——用链接结构给网页排序。它把搜索变成一场以数据和算法为核心的竞赛,也为日后 Google 的 AI 帝国埋下第一块地基。
XCON 商业专家系统
卡内基梅隆为 DEC 开发 XCON(原名 R1),用数千条规则自动配置 VAX 计算机订单。它被广泛视为第一个成功的商业专家系统,让 AI 第一次在企业里证明商业价值。
MYCIN 医疗专家系统
斯坦福大学的 Edward Shortliffe 开发 MYCIN,一个用产生式规则诊断血液感染并推荐抗生素的专家系统。它以不确定性与可解释的推理链为特色,被视为医学 AI 的早期标杆。