计算机视觉

从「LeNet 与卷积神经网络」到「商汤发布日日新 SenseNova 5.0」,先抓住起点、路线转向与当前边界,再展开完整事件线。

01

商汤发布日日新 SenseNova 5.0

商汤在技术日发布 SenseNova 5.0,强调知识、数学、推理与代码,并推出云到端全栈产品矩阵,把 CV 起家的公司更明确地绑在通用大模型战线上。

B领域级
02

Apple Vision Pro 发售

Apple Vision Pro 正式发售,以眼动、手势与语音为交互方式,把计算从平面屏幕带进空间。它首次让「空间计算」成为大众可购买的产品形态,也展示了苹果对 AI 与硬件的融合思路。

B领域级
03

Meta 发布 SAM「分割一切」

Meta AI 发布 Segment Anything Model(SAM),一个可在零样本下分割任意图像中任意物体的模型,配套 1100 万张图像、10 亿掩码的数据集。它被视为视觉版「基础模型」。

A行业级
04

CLIP 用自然语言监督连接图文

OpenAI 发布 CLIP:在大规模图文对上对比训练图像编码器与文本编码器,使模型可用自然语言描述做零样本图像分类,并开放代码与权重示例。

A行业级
05

YOLO 提出实时目标检测

Redmon 等人提出 YOLO(You Only Look Once),把目标检测变成单次回归问题,一帧图像一次前向推理即可输出所有目标的位置与类别,速度达到实时。它开创了单阶段检测路线,深刻影响自动驾驶、监控与终端视觉。

B领域级
06

ResNet 让超深网络可训练

微软研究者提出残差网络,用跳跃连接训练 152 层模型,并赢得 2015 年 ImageNet 分类任务。

A行业级
07

AlexNet 赢得 ImageNet 竞赛

AlexNet 在 ILSVRC 2012 将 top-5 错误率降到 15.3%,第二名为 26.2%。这个差距让深度卷积网络成为计算机视觉的新基线。

S范式级
08

ImageNet 数据集发布

李飞飞团队发布 ImageNet,按 WordNet 名词层级组织超过 1400 万张人工标注图像;2010 年开始的 ILSVRC 提供统一训练集和年度比较。

A行业级
09

Mobileye 让视觉走进量产汽车

希伯来大学教授沙舒亚创办 Mobileye,用单目摄像头和专用视觉芯片做量产车的辅助驾驶感知。它把「机器看懂道路」从论文变成前装量产件,成为自动驾驶产业最早也最成功的商业化路线之一。

C补充
10

LeNet 与卷积神经网络

Yann LeCun 及其合作者提出 LeNet,把卷积、池化与反向传播组合成可训练的卷积神经网络,先用于邮政编码手写数字识别,后在银行支票识别中实际部署。它证明深度网络可以在真实任务上工作。

A行业级
谱系

相关模型谱系

商汤日日新 SenseNova 谱系SenseNova 最新代
机构

相关机构

Mobileye用单目摄像头与专用 EyeQ 芯片做前装量产 ADAS,是自动驾驶视觉感知最早的商业化路线之一。 商汤 / SenseTime计算机视觉起家的中国 AI 公司,以日日新 SenseNova 大模型覆盖多模态与行业。

试试搜索