自然语言处理
从「ELIZA 展示对话程序的投射效应」到「GPT-3 发布」,先抓住起点、路线转向与当前边界,再展开完整事件线。
GPT-3 发布
OpenAI 训练 1750 亿参数 GPT-3,并以零样本、单样本和少样本提示评估它。模型无需更新权重即可尝试翻译、问答、文本生成和简单代码,但不同任务的结果差异很大。
RAG 检索增强生成论文
Facebook AI 提出 RAG:用稠密检索从文档库取出相关段落,再与预训练序列到序列模型一起条件生成答案,在开放域问答等任务上验证有效。
GPT-2 展示零样本任务迁移
OpenAI 公布在约 800 万个网页文档上训练的 15 亿参数 GPT-2,并演示模型在不做任务微调时完成基础问答、摘要和翻译。公司起初只发布较小版本,随后于 2019 年 11 月放出完整模型。
Hugging Face Transformers 库成型
Hugging Face 推出并扩展 Transformers 库,把 BERT 等预训练模型的加载、分词与微调收成统一 API,降低复现与迁移成本。
BERT 发布
Google 发布 BERT,以掩码语言建模和下一句预测预训练双向 Transformer 编码器。3.4 亿参数的 BERT-Large 只增加小型输出层,便在 GLUE、SQuAD 等 11 项任务上刷新当时最佳结果。
GPT-1 验证生成式预训练
OpenAI 在 BooksCorpus 上预训练 1.17 亿参数、12 层的 Transformer 解码器,再分别微调到 12 个有监督任务;论文报告其中 9 项刷新当时最佳结果。
Google Duplex 用 AI 打电话订餐
Google 在 I/O 大会上演示 Duplex:AI 用自然的语气打电话替用户预约理发与餐厅,与真人对话时语气词、停顿都惟妙惟肖。它让「AI 替人打电话」从科幻变成演示,也引发关于透明度的伦理讨论。
Transformer 架构论文发表
Google 研究者在机器翻译论文中提出 Transformer,用自注意力、前馈网络和位置编码构成编码器—解码器,去掉循环和卷积。
谷歌发布神经机器翻译
谷歌宣布其在线翻译改用神经机器翻译(GNMT),端到端深度模型在质量上大幅超越传统统计方法。它宣告深度学习接管了机器翻译这一重要应用领域。
注意力机制进入神经机器翻译
Bahdanau、Cho 与 Bengio 提出在神经机器翻译中联合学习对齐与翻译:解码器每生成一个词,都对编码器隐状态做软注意力加权,而不是只依赖一个固定句向量。
Seq2Seq 统一可变长度序列转换
Google 研究者提出用两个多层 LSTM 将输入序列编码成向量,再逐步生成输出序列,并在机器翻译上取得有竞争力的结果。
Word2Vec 发布
Google 团队发布 Word2Vec 的 CBOW 与 Skip-gram 方法,用局部上下文预测任务在数十亿词语料上快速学习稠密词向量。
Siri 让语音助手进入大众手机
苹果在 iPhone 4S 发布会上展示 Siri,让语音助手成为智能手机的标配叙事。它把自然语言理解、语音识别与联网服务整合进一个消费者产品。
IBM Watson 赢下《Jeopardy!》
IBM Watson 在三场《Jeopardy!》比赛中击败两位冠军选手,展示机器处理双关、线索检索和答案置信度排序的能力。
LSTM 长短期记忆网络
Sepp Hochreiter 与 Jürgen Schmidhuber 提出 LSTM,用恒定误差传送与门控记忆单元缓解循环网络训练中的梯度消失,使较长序列上的信用分配更可行。
SHRDLU 与积木世界
Terry Winograd 在 MIT 开发 SHRDLU,一个操作虚拟积木世界的自然语言程序。它能回答关于积木状态的问题、执行指令,并解释自己为什么拒绝某些操作。
ELIZA 展示对话程序的投射效应
Joseph Weizenbaum 发表 ELIZA 论文:程序按优先级寻找关键词,再用分解与重组规则改写用户输入。著名的 DOCTOR 脚本模仿罗杰斯式访谈,但系统并不建立对谈话内容的语义模型。