AI 历史

从「图灵发表《论可计算数》」到「Google 领导层重组,四位元老离职创业」,先抓住起点、路线转向与当前边界,再展开完整事件线。

01

Google 领导层重组,四位元老离职创业

Google 8 月 6 日重组 AI 领导层:Demis Hassabis 卸任日常管理,转任 Alphabet 首席科学家兼 DeepMind 主席;Koray Kavukcuoglu 升 SVP 接管 Gemini;Jeff Dean、Sanjay Ghemawat、Oriol Vinyals、Quoc Le 离职创办 Discovery Loop(谷歌创始投资)。导火索是 Gemini 3.5 Pro 一再延期,Alphabet 股价单日跌约 4%。

A行业级
02

腾讯混元发布 Hy ASR 3.0

腾讯混元发布 Hy ASR 3.0 preview,在中文普通话识别上取得进展,官方公布的中文普通话词错率进一步下降。它显示国产语音模型在多语言与口音泛化上持续投入。

B领域级
03

Google 发布 Gemini 3 Pro

谷歌发布 Gemini 3 Pro,在推理、多模态与长上下文上全面对标并部分反超 OpenAI 的 GPT-5 系列。它让谷歌在旗舰竞争里重回前排,也标志着 2025 年底「推理旗舰」之争进入白热化。

A行业级
04

xAI 发布 Grok 4

xAI 发布 Grok 4,首次把旗舰能力拉到推理模型的头部阵营,与 GPT、Claude、Gemini 正面竞争。它让 xAI 从「马斯克的另类项目」变成真正的第三极竞争者。

A行业级
05

Anthropic 发布 Claude 4

Anthropic 发布 Claude 4 家族:Opus 4 作为旗舰,Sonnet 4 主打速度与 Agent 任务,并推出支持工具调用的版本。Claude 4 将「长任务自主执行」确立为产品主线,与代码与 Agent 生态深度绑定。

A行业级
06

阿里发布 Qwen3 系列

阿里发布 Qwen3 系列,从 0.6B 到旗舰 235B(MoE)全面开源,原生支持思考/非思考双模式。Qwen3-235B 在多项评测中成为最强开源模型之一,改写开源与闭源的实力版图。

A行业级
07

OpenAI 发布 o3 与 o4-mini

OpenAI 发布 o3 与 o4-mini,首次让推理模型在 ChatGPT 内自主调用搜索、代码执行、图像等全套工具。它把「推理」与「行动」首次系统性地结合到旗舰模型里。

A行业级
08

Gemini 2.5 引入思维过程

谷歌发布 Gemini 2.5,以「思考模型」为核心:模型在回答前进行内部推理,强调编码、数学与长任务能力。Gemini 2.5 让谷歌在推理模型竞赛中重新回到第一梯队。

A行业级
09

Manus 引爆通用智能体热潮

初创公司 Monica(蝴蝶效应)发布 Manus,一个被包装为「自主完成复杂任务」的通用智能体。演示视频显示它能筛选简历、写报告、分析数据,上线即引爆社交媒体与邀请码经济。

A行业级
10

GPT-4.5 发布

OpenAI 发布 GPT-4.5,宣称这是其最后一个不基于推理的旗舰模型,强化世界知识、自然对话与模式识别。发布后市场反应分化,凸显「纯规模路线 vs 推理路线」的分歧。

A行业级
11

微软曝光自研大模型 MAI-1

微软公开自研大模型 MAI-1,由 Inflection 前团队主导开发,被定位为与 OpenAI 合作之外的自主底座。它标志着微软开始摆脱「单一大模型供应商依赖」。

B领域级
12

xAI 发布 Grok 3

xAI 发布 Grok 3,宣称由 Colossus 超算(约 10 万张 GPU)训练,主打推理与数学能力,在发布前后声称某些基准领先。它把 xAI 从追赶者带进前沿竞争的核心圈。

A行业级
13

Google 发布 Gemini 2.0

Google 发布 Gemini 2.0 Flash,主打原生多模态与 Agentic 能力,并演示 Project Mariner 等浏览器代理。它把 Google 的战略重心从对话模型转向「能替你干活」的智能体。

A行业级
14

Google 发布 Willow 量子芯片

Google 公布 Willow 量子芯片:量子比特数量随规模增大而错误率指数下降,在随机电路采样任务上远超经典超算。它被视为量子纠错路线的关键里程碑。

A行业级
15

Hinton 获诺贝尔物理学奖

瑞典皇家科学院将 2024 年诺贝尔物理学奖授予 Geoffrey Hinton 与 John Hopfield,表彰他们用物理学方法奠定人工神经网络的基础。深度学习首次获得诺贝尔奖,标志 AI 的科学地位获得制度性确认。

A行业级
16

Meta 发布 Llama 3.1 405B

Meta 发布 Llama 3.1,其中 405B 版本在多项基准上逼近 GPT-4o,是首个与闭源旗舰同场竞技的开源模型。扎克伯格同时发表长文,公开为开源 AI 辩护。

A行业级
17

欧盟《人工智能法案》正式公布

欧盟在官方公报发布《人工智能法案》,建立禁止用途、高风险系统、透明度和通用 AI 模型的分层规则。

A行业级
18

阿里开源 Qwen2 系列

阿里通义千问团队发布 Qwen2 系列开源模型,覆盖 0.5B 到 72B 多个尺寸,7B/72B 在多项基准上领先同量级开源模型。它把开源生态从「单点模型」推向「全尺寸系列」。

A行业级
19

DeepSeek-V2 发布

DeepSeek 发布 V2,采用 MLA(多头潜在注意力)+ DeepSeekMoE 稀疏架构,以远低于同行的价格开放 API。推理成本约为 Llama 3 的 1/100,直接引爆了中国大模型的价格战。

A行业级
20

Meta 发布 Llama 3

Meta 发布 Llama 3 家族(8B 与 70B),性能大幅提升并随后推出 405B 旗舰。它让开源模型的水平首次逼近闭源前沿模型,也把「开源与闭源之争」推向全球大模型竞争的中心。

A行业级
21

AI21 发布 Jamba 混合架构模型

AI21 Labs 发布 Jamba,首个将 Mamba 状态空间模型与 Transformer 结合的大规模混合架构,在长上下文与吞吐上展示效率优势。

B领域级
22

Anthropic 发布 Claude 3 家族

Anthropic 发布 Claude 3 家族:旗舰 Opus、均衡 Sonnet、轻量 Haiku。Opus 在多项基准上超越 GPT-4,首次支持 20 万 token 上下文。三档齐发的策略让大模型进入「按需选档」时代。

A行业级
23

OpenAI 董事会风波

OpenAI 董事会突然解雇 CEO Sam Altman,随后在员工与投资人施压、高管出走与微软斡旋之下,于五天后的 11 月 22 日宣布 Altman 复职并改组董事会。事件暴露了非营利治理与商业利益的结构性张力。

A行业级
24

xAI 发布 Grok

埃隆·马斯克创立的 xAI 发布 Grok-1 及配套产品,主打「实时接入 X(推特)」与少约束的幽默风格,向 ChatGPT 发起差异化竞争。

B领域级
25

布莱切利园 AI 安全峰会

英国在布莱切利园召开首届 AI 安全峰会,中美欧等多国代表与前沿实验室出席,签署《布莱切利宣言》,承认前沿 AI 存在潜在灾难性风险并承诺国际合作治理。

A行业级
26

月之暗面发布 Kimi

月之暗面(Moonshot AI)发布 Kimi 智能助手,以长上下文与中文长文本处理为差异化卖点。它在国产对话产品中以「能读长文档、多轮长对话」快速出圈。

A行业级
27

百川智能发布 Baichuan 开源大模型

王小川创立的百川智能发布 Baichuan-7B,首个版本即开源,随后推出 Baichuan-13B 与 53B。公司以「开源+商业双轨」切入,成为国产开源大模型的重要参与者。

B领域级
28

讯飞星火发布

科大讯飞发布讯飞星火认知大模型,展示文本生成、知识问答、数学推理与多语种能力,并把大模型与自身语音与教育优势结合。

B领域级
29

Meta 发布 SAM「分割一切」

Meta AI 发布 Segment Anything Model(SAM),一个可在零样本下分割任意图像中任意物体的模型,配套 1100 万张图像、10 亿掩码的数据集。它被视为视觉版「基础模型」。

A行业级
30

AutoGPT 引爆自主智能体实验

开源项目 AutoGPT 发布,展示让 GPT-4 自主拆分目标、调用工具并迭代执行的思路。它虽不成熟,却让「AI 智能体」成为生成式 AI 最热门的叙事之一。

B领域级
31

文心一言开启中国大模型浪潮

百度发布文心一言,以录播演示的方式推出对话模型产品,成为 ChatGPT 后中国主要科技公司里首个正式发布的大模型。发布会当日百度港股一度下跌,也引来对「AI 抢跑 vs 实力」的争论。

A行业级
32

斯坦福 Alpaca 低成本复刻

斯坦福团队用 52K 条由 GPT-3.5 生成的指令数据微调 LLaMA-7B,训练成本仅约 600 美元,得到行为接近 GPT-3.5 的 Alpaca。它引爆了「低成本复刻闭源模型」的浪潮。

A行业级
33

微软把 ChatGPT 放进必应搜索

微软发布新版必应,把 OpenAI 的模型与搜索索引结合,允许用户用自然语言提问并查看带引用的回答。搜索引擎开始从「结果列表」转向「对话加引用」。

A行业级
34

EleutherAI 开源 GPT-Neo

EleutherAI 发布 GPT-Neo 1.3B 与 2.7B,证明没有科技巨头预算的独立社区也能训练出可用的语言大模型,为开源 AI 的后续繁荣埋下伏笔。

B领域级
35

微软向 OpenAI 投资十亿美元

微软宣布向 OpenAI 投资 10 亿美元,双方开展多年合作:Azure 成为 OpenAI 的独家云供应商,OpenAI 的技术将整合进微软产品。这笔投资为 GPT 系列的规模化训练提供了算力与资本。

A行业级
36

深度学习三巨头获图灵奖

ACM 宣布将 2018 年度图灵奖授予 Geoffrey Hinton、Yann LeCun 和 Yoshua Bengio,表彰他们在深度神经网络领域的突破性贡献,为现代 AI 奠定基础。

A行业级
37

AlphaStar 击败职业星际玩家

DeepMind 公布 AlphaStar,一个在《星际争霸 II》中击败顶级职业玩家的 AI,展示了深度强化学习在不完美信息、长时决策的实时战略游戏中的能力。

B领域级
38

Waymo One 商业运营启动

Waymo 在凤凰城启动 Waymo One,首次向公众开放付费的自动驾驶出租车服务,把自动驾驶从路测 demo 推进到商业化运营阶段。

B领域级
39

微软 Tay 上线即翻车

微软在 Twitter 上发布聊天机器人 Tay,宣称「像青少年一样说话」,结果网民 24 小时内用恶意推文把它教成了满口种族歧视的机器人。微软被迫下线并公开道歉,成为 AI 安全的经典反面教材。

A行业级
40

OpenAI 成立

OpenAI 由 Sam Altman、Elon Musk、Ilya Sutskever、Greg Brockman 等人联合创立,定位为以安全与开放为优先的非营利 AI 研究机构,初始承诺资金约 10 亿美元。

A行业级
41

Google 收购 DeepMind

Google 收购由 Demis Hassabis、Shane Legg 和 Mustafa Suleyman 创立的 DeepMind,据报价格约 4 亿至 6 亿美元。收购附带「AGI 安全委员会」协议,DeepMind 得以在谷歌体系内保持研究独立性。

A行业级
42

Google Brain 与大规模分布式学习

Google Brain 团队在 1.6 万个 CPU 核心上训练大型神经网络,无监督地学会从 YouTube 视频帧中识别猫。它证明「更大数据、更多算力」能让深度网络自己涌现特征,是深度学习复兴的关键推力之一。

A行业级
43

Siri 让语音助手进入大众手机

苹果在 iPhone 4S 发布会上展示 Siri,让语音助手成为智能手机的标配叙事。它把自然语言理解、语音识别与联网服务整合进一个消费者产品。

B领域级
44

DeepMind 成立

Demis Hassabis、Shane Legg 与 Mustafa Suleyman 在伦敦创立 DeepMind,目标是构建通用学习系统,再用它解决现实问题。

B领域级
45

Amazon Mechanical Turk 上线

亚马逊上线 Mechanical Turk(MTurk),让企业把人类难以自动化的任务拆成微任务分发给在线工人。它成了 AI 数据标注的基础设施,也把「众包人工」嵌入机器学习流水线,改变了数据生产的方式。

B领域级
46

DARPA 自动驾驶挑战赛

DARPA 在 2004、2005、2007 年举办三届自动驾驶挑战赛。首届无车完赛,第二届 5 辆车跑完全程,2007 年的城市挑战赛则要求车辆在模拟城市中遵守交规。比赛直接催化了现代自动驾驶产业。

B领域级
47

深蓝击败国际象棋世界冠军

IBM 深蓝在纽约六局重赛中以 3.5 比 2.5 战胜国际象棋世界冠军 Garry Kasparov,成为首个在正式比赛条件下击败现役世界冠军的计算机系统。

A行业级
48

支持向量机

Corinna Cortes 与 Vladimir Vapnik 发表《Support-Vector Networks》,系统提出支持向量机。它以最大间隔超平面和核技巧为核心,在 1990 年代到 2000 年代初成为文本、图像分类的主流方法之一。

B领域级
49

TD-Gammon 与时间差分学习

Gerald Tesauro 在 IBM 开发 TD-Gammon,让一个带时序差分学习的小型神经网络仅靠与自己对弈训练,棋力逼近人类大师。它把「从经验中学习价值」变成了可以量化的现实。

B领域级
50

Watkins 提出 Q-learning

博士生 Watkins 提出 Q-learning,一种无需环境模型的时序差分算法,用一张 Q 表评估「状态-动作」的价值。它成为现代强化学习的核心算法之一,也是 AlphaGo、DQN 等系统的理论源头。

A行业级
51

LeNet 与卷积神经网络

Yann LeCun 及其合作者提出 LeNet,把卷积、池化与反向传播组合成可训练的卷积神经网络,先用于邮政编码手写数字识别,后在银行支票识别中实际部署。它证明深度网络可以在真实任务上工作。

A行业级
52

专家系统市场退潮

专家系统专用硬件与软件市场在 1987 年后迅速收缩,企业发现大规模规则库昂贵、脆弱且难以持续维护。

A行业级
53

Cyc 常识知识库项目启动

莱纳特启动 Cyc 项目,试图把人类常识编码成机器可推理的知识库。它代表了符号主义「知识工程」路线的长期主义实验,也深刻影响了知识图谱等方向。

B领域级
54

日本第五代计算机计划

日本通产省启动第五代计算机计划,目标是在十年内造出以逻辑推理为核心、能处理知识的计算机。它引发美欧对 AI 竞争力的警觉,也最终在成果与期望之间留下巨大落差。

B领域级
55

Hopfield 网络

物理学家约翰·霍普菲尔德提出带反馈的循环神经网络,用能量函数刻画网络动力学,可存储和恢复模式。它复兴了陷入低谷的神经网络研究。

A行业级
56

XCON 商业专家系统

卡内基梅隆为 DEC 开发 XCON(原名 R1),用数千条规则自动配置 VAX 计算机订单。它被广泛视为第一个成功的商业专家系统,让 AI 第一次在企业里证明商业价值。

A行业级
57

MYCIN 医疗专家系统

斯坦福大学的 Edward Shortliffe 开发 MYCIN,一个用产生式规则诊断血液感染并推荐抗生素的专家系统。它以不确定性与可解释的推理链为特色,被视为医学 AI 的早期标杆。

B领域级
58

第一次 AI 寒冬

1973 年 Lighthill 报告否定英国 AI 研究的实际进展,叠加机器翻译和感知机项目失利,英美公共资金随后明显收缩。

A行业级
59

Lighthill 报告重创英国 AI

应用数学家 Lighthill 向英国科学研究委员会提交报告,批评 AI 研究承诺过高、进展有限,尤其否定「通用人工智能」的可行性。报告直接导致英国政府大幅削减 AI 经费,与 1974 年美国的 DARPA 收缩一起构成第一轮 AI 寒冬。

A行业级
60

《Perceptrons》划出单层网络的边界

Minsky 与 Papert 系统分析感知机,证明单层线性模型无法解决 XOR 等问题,并讨论了计算复杂度限制。

B领域级
61

SHRDLU 与积木世界

Terry Winograd 在 MIT 开发 SHRDLU,一个操作虚拟积木世界的自然语言程序。它能回答关于积木状态的问题、执行指令,并解释自己为什么拒绝某些操作。

B领域级
62

ELIZA 展示对话程序的投射效应

Joseph Weizenbaum 发表 ELIZA 论文:程序按优先级寻找关键词,再用分解与重组规则改写用户输入。著名的 DOCTOR 脚本模仿罗杰斯式访谈,但系统并不建立对谈话内容的语义模型。

B领域级
63

Mark I 感知机问世

Rosenblatt 展示 Mark I 感知机,一台能通过调整权重「学会」识别图案的硬件。它让神经网络第一次以实物的形式登上舞台,也点燃了公众对「会学习的机器」的第一波热情与后来的失望。

B领域级
64

LISP 语言诞生

John McCarthy 提出 LISP,一种以符号表达式和递归为核心的编程语言。它成为之后几十年 AI 研究的主流工具,也为「程序即数据」的思想打下基础。

B领域级
65

通用问题求解器 GPS

纽厄尔、肖和西蒙开发通用问题求解器 GPS,用「手段-目的分析」把任意问题拆成子目标逐步解决。它是符号主义 AI 早期最雄心勃勃的尝试。

A行业级
66

达特茅斯暑期研究项目

1956 年夏天,研究者在达特茅斯学院讨论学习、语言、抽象和自我改进机器。项目提案首次用“Artificial Intelligence”命名这组问题。

S范式级
67

Logic Theorist 完成定理证明

Allen Newell、Herbert Simon 与 Cliff Shaw 开发 Logic Theorist,用启发式搜索证明《数学原理》第二章 52 个命题中的 38 个;其中一个证明比书中版本更短。

A行业级
68

Arthur Samuel 的跳棋程序

在 IBM 702 上,Arthur Samuel 编写了一个会下跳棋的程序,并让它通过与自己对弈持续改进棋力。他后来把这项工作称为「机器学习」的一个早期实例,这个术语也由此进入公共词汇。

B领域级
69

图灵提出“模仿游戏”

图灵在《计算机器与智能》中提出“模仿游戏”:询问者只通过文字与人和机器交谈,再判断双方身份。论文同时讨论“儿童机器”与训练,未把测试等同于意识证明。

A行业级
70

McCulloch–Pitts 人工神经元

沃伦·麦卡洛克与沃尔特·皮茨发表《神经活动中内在思想的逻辑演算》,证明简单人工神经元可执行逻辑运算。这篇论文为神经网络与 AI 提供了数学基础。

A行业级
71

图灵发表《论可计算数》

图灵在《论可计算数及其在判定问题上的应用》中提出「图灵机」抽象模型,定义了可计算性的边界,为后来的计算机与人工智能提供了理论地基。

A行业级
谱系

相关模型谱系

IBM Granite 谱系Granite 3.x
机构

相关机构

IBM从 Deep Blue、Watson 到 Granite 开放企业模型,服务受监管行业。

试试搜索