计算机视觉
从「LeNet 与卷积神经网络」到「商汤发布日日新 SenseNova 5.0」,先抓住起点、路线转向与当前边界,再展开完整事件线。
商汤发布日日新 SenseNova 5.0
商汤在技术日发布 SenseNova 5.0,强调知识、数学、推理与代码,并推出云到端全栈产品矩阵,把 CV 起家的公司更明确地绑在通用大模型战线上。
Apple Vision Pro 发售
Apple Vision Pro 正式发售,以眼动、手势与语音为交互方式,把计算从平面屏幕带进空间。它首次让「空间计算」成为大众可购买的产品形态,也展示了苹果对 AI 与硬件的融合思路。
Meta 发布 SAM「分割一切」
Meta AI 发布 Segment Anything Model(SAM),一个可在零样本下分割任意图像中任意物体的模型,配套 1100 万张图像、10 亿掩码的数据集。它被视为视觉版「基础模型」。
CLIP 用自然语言监督连接图文
OpenAI 发布 CLIP:在大规模图文对上对比训练图像编码器与文本编码器,使模型可用自然语言描述做零样本图像分类,并开放代码与权重示例。
YOLO 提出实时目标检测
Redmon 等人提出 YOLO(You Only Look Once),把目标检测变成单次回归问题,一帧图像一次前向推理即可输出所有目标的位置与类别,速度达到实时。它开创了单阶段检测路线,深刻影响自动驾驶、监控与终端视觉。
ResNet 让超深网络可训练
微软研究者提出残差网络,用跳跃连接训练 152 层模型,并赢得 2015 年 ImageNet 分类任务。
AlexNet 赢得 ImageNet 竞赛
AlexNet 在 ILSVRC 2012 将 top-5 错误率降到 15.3%,第二名为 26.2%。这个差距让深度卷积网络成为计算机视觉的新基线。
ImageNet 数据集发布
李飞飞团队发布 ImageNet,按 WordNet 名词层级组织超过 1400 万张人工标注图像;2010 年开始的 ILSVRC 提供统一训练集和年度比较。
Mobileye 让视觉走进量产汽车
希伯来大学教授沙舒亚创办 Mobileye,用单目摄像头和专用视觉芯片做量产车的辅助驾驶感知。它把「机器看懂道路」从论文变成前装量产件,成为自动驾驶产业最早也最成功的商业化路线之一。
LeNet 与卷积神经网络
Yann LeCun 及其合作者提出 LeNet,把卷积、池化与反向传播组合成可训练的卷积神经网络,先用于邮政编码手写数字识别,后在银行支票识别中实际部署。它证明深度网络可以在真实任务上工作。