← 返回课程 🛰️ E04 · 第8课 1998 年 · 人工智能简史 🖼️ 计算机视觉 · CNN 起点计算机视觉(Computer Vision)让机器「看懂」图像——认字、认脸、认车牌都靠它。层级:人工智能 ⊃ 机器学习 ⊃ 深度学习(CNN 就是深度学习里看图的那一类)本站在这一门里的位置:1998 年 LeNet-5 用卷积神经网络(CNN)读手写数字,是计算机视觉真正的起点。

🧩 LeNet:教电脑读懂手写数字

🎯 认识杨立昆的 LeNet——最早会「扫描特征」的卷积神经网络,理解它一层层提取特征来识图
1998 🧩 第 8 站 / 16 · 1998 年

LeNet:教电脑读懂手写数字

会「扫描特征」的卷积神经网络
🎯 本课目标:认识杨立昆的 LeNet——最早会「扫描特征」的卷积神经网络,理解它一层层提取特征来识图

🕰️ 故事时间 · 那时候发生了什么?

1998 年 · 🧩
杨立昆
杨立昆Yann LeCun
1960 —
法国计算机科学家 · 卷积神经网络之父
  • 1960 年出生在法国
  • 1998 年做出 LeNet,让电脑读懂手写数字
  • 发明「卷积」扫描法,做出最早大规模用起来的「看图 AI」
  • 银行用它读支票上的手写数字,一用就是很多年

🖼️ 图片来源:CC BY-SA 2.0 · Wikimedia Commons

1960 — 1980 年代 · 背景
十张真实的手写数字样本:上面一行是 0 到 4,下面一行是 5 到 9
手写数字看着简单,可每个人写的都不一样,电脑要认出来并不容易(图里是真实的手写数字样本,上面一行 0 ~ 4,下面一行 5 ~ 9)。背景 · 手写数字样本(MNIST 数据集)

这一站的主人公是杨立昆。他 1960 年出生在法国,从小就对科学充满好奇,长大后跑到美国的贝尔实验室工作。

那时候的电脑算得飞快,却「看不见」:在它眼里,一张图只是一堆数字。邮局每天要分拣成千上万封信,信封上的手写邮编只能靠人眼一个一个认。杨立昆想:能不能让电脑自己学会「看」?

1989 · 首次落地
示意图:LeNet 把一张手写图一块一块地扫描,先认出线条、再拼出形状,最后输出这是哪个数字
LeNet 的办法:一层层扫描 → 先认「线条」→ 再拼出「圈」→ 判断这是几。提出时间 · 1989 年 · 本课件自制

1989 年,杨立昆把上一站学过的「反向传播」(向后纠错)用在一个会扫描的网络上,做出第一个能认字的神经网络——LeNet。它不盯着整张图看,而是像拿着放大镜,一小块、一小块地扫过去。

1998 · 论文发表
示意图:支票上手写的五位数,被 LeNet 一眼读出来
手写的「22205」,LeNet 也能一眼读出来。发布 · 1998 年 · 本课件自制

1998 年,他把这套办法写成论文 LeNet-5 正式发表,并真的去干了一件很「接地气」的活儿——读支票上的手写数字。银行把它装进支票处理系统里(由 NCR 等厂商部署),一用就是很多年——到 1990 年代末,全美国有相当一部分支票就是靠它读出来的:这是「会看图的 AI」第一次真正上街干活。

🔍 它怎么「看」
示意图:用像放大镜一样的小窗口一块块扫过数字 6,先认出线条,再拼出圈,最后判断这是 6
不是盯着一整张图看,而是「一块块扫 → 一层层拼」,这就是卷积。原理 · 本课件自制

它为什么这么厉害?因为它会「扫描特征」:像拿着放大镜,一小块一小块地扫过去,先认出「线条」,再拼出「弯弯的圈」,最后判断「这是 0 还是 6」。这种一层层扫描、一层层提炼的办法,就叫「卷积」——LeNet 是世界上第一批会卷积的神经网络。

2018 · 图灵奖
图灵奖奖杯:一只银碗
图灵奖的奖杯是一只银碗,是计算机界的最高荣誉。2018 年 · 与辛顿、本吉奥一同获得

把「让机器自己学会看」这件事坚持做了几十年,杨立昆得到了回报:2018 年,他和上一站讲过的辛顿,还有 本吉奥一起,拿到了计算机界的最高奖——图灵奖

💡 最终影响
示意图:相册认脸、车牌识别、拍照翻译,用的都是 LeNet 的后代
相册认脸、车牌识别、拍照翻译——都是 LeNet 的后代。影响 · 本课件自制

今天手机里的相册认脸车牌识别拍照翻译……用的都是 LeNet 的后代。它和它的后代们,是所有「看图的 AI」的老祖宗——你每按一次「拍照搜一搜」,背后都有杨立昆这张会扫描的小网络。

🖼️ 图片:杨立昆照片、图灵奖奖杯来自维基共享资源;手写数字样本取自 MNIST 数据集(Yann LeCun 等 · CC BY-SA 3.0);其余示意图为本课件自制

📖 知识小课堂 · 记住这个魔法!

点击卡片翻开,看看背后的知识~

LeNet👆 点我翻开
1998 年的 LeNet-5,是计算机视觉最早的起点,也是最早被大规模用起来的卷积神经网络
🧑杨立昆是谁👆 点我翻开
1960 年生于法国,在贝尔实验室工作,被称为「卷积神经网络之父」
💡它认识什么👆 点我翻开
能读懂手写数字,比如信封上的邮政编码
🏦邮局与银行都请它👆 点我翻开
先帮邮局认信封上的邮编,后来银行用它读支票上的手写数字
🔑卷积是什么👆 点我翻开
像放大镜一样逐块扫描 → 一层层提取线条、形状等特征
🧭池化做什么👆 点我翻开
把特征图缩小,只留下激活最亮的那几个(最关键的特征)
🏆2018 · 图灵奖👆 点我翻开
2018 年,杨立昆与辛顿、本吉奥一同获得计算机界最高奖
📱今天的它👆 点我翻开
相册认脸、车牌识别、拍照翻译——用的都是 LeNet 的后代

🖐️ 动手小任务 · 亲自试一试

🧩卷积神经网络实验室 · CNN用会「找特征」的滤镜,认出你手写的 0~9

🎯 实际问题:读出信封上的邮编

  • 📮 邮局遇到的真问题:每天有海量信件要分拣,信封上手写的邮编(邮政编码)不能全靠人眼一个个认。杨立昆(Yann LeCun)当年正是为了让电脑自动读出信封上的手写邮编,才发明了 LeNet —— 最早的卷积神经网络(CNN),后来银行真的用它读支票上的手写数字。我们今天要解决的,就是同一个“实际问题”:认出随手写下的 0~9。
📮 邮局分拣机 · 手写邮编识别
📮
100080
⬇ LeNet 逐个识别 ⬇
📮 等待进信…
这就是当年 LeNet 在邮局干的活

🧠 CNN 可视化训练器 真 MNIST 28×28 · 4+8 滤镜 5×5 · 392→32→10

用的是真实 MNIST 手写数字(不是电脑生成的模板)!先点「🎬 开始可视化训练」看完整训练过程(损失曲线 + 滤镜/特征图点亮);再用下面的按钮一步一步调试(前向→反向→更新)。

📚 训练数据集 500 组 · 点击加载
📊 测试数据集 200 组 · 点击加载
🧠 网络结构 · 28×28 真 MNIST → 卷积(扫着看)→ 池化(把特征图缩小、只留最亮的)→ 输出 10
正权值 负权值 特征图颜色越绿 = 激活越强
学习率 η =
状态: 就绪 📉 损失: 🔢 步数: 0 📚 epoch: 0
📊 数据面板 当前样本

✍️ 互动演示:手写数字识别

先点上方「🎬 开始可视化训练」让 CNN 学会 0~9;再在 28×28 格子里用鼠标点亮像素(和真实 MNIST 一样大),画一个数字,点「🔍 识别」。右边会显示卷积滤镜在图片上找到了什么特征!(绿色 = 激活越强)

🖊️ 在这里写数字(28×28)
🎯 识别结果
?
先训练,再写一个数字试试!

❓ 小测验 · 你学会了吗?

点选答案,答对会变绿、答错会变红(可重试)~

Q1. LeNet 最擅长做的事是什么?

Q2. LeNet 用「卷积」的办法,是怎么认图的?

Q3. LeNet 是哪位科学家的重要成果?

Q4. 训练器里「池化」这一层做的是什么?

Q5. 点「🔍 识别」后,右边那些绿色的图是什么?

Q6. 这个实验室训练用的手写数字,是从哪来的?

Q7. 杨立昆当年发明 LeNet,最先想解决的实际问题是什么?

Q8. 画完一个数字点「识别」,网络最后是怎么给出答案的?

🏁 回顾与完课 · 为自己盖章

我从故事里记住了一个新知识我能把这个故事讲给家人听我完成了一次小任务挑战我想把这一站和下一站连起来想一想

💭 思考一下:你会怎么教一位外星朋友认数字?是一步一步拆开讲,还是一次性给它看整张图?哪种更像「扫描特征」?

🏅

人工智能简史 · 完课证明

小小学员 完成了 本站LeNet:教电脑读懂手写数字

学会:会「扫描特征」的卷积神经网络

第 8 站
已完课