
🖼️ 图片来源:CC BY-SA 2.0 · Wikimedia Commons
这一站的主人公是杨立昆。他 1960 年出生在法国,从小就对科学充满好奇,长大后跑到美国的贝尔实验室工作。
那时候的电脑算得飞快,却「看不见」:在它眼里,一张图只是一堆数字。邮局每天要分拣成千上万封信,信封上的手写邮编只能靠人眼一个一个认。杨立昆想:能不能让电脑自己学会「看」?
1989 年,杨立昆把上一站学过的「反向传播」(向后纠错)用在一个会扫描的网络上,做出第一个能认字的神经网络——LeNet。它不盯着整张图看,而是像拿着放大镜,一小块、一小块地扫过去。
1998 年,他把这套办法写成论文 LeNet-5 正式发表,并真的去干了一件很「接地气」的活儿——读支票上的手写数字。银行把它装进支票处理系统里(由 NCR 等厂商部署),一用就是很多年——到 1990 年代末,全美国有相当一部分支票就是靠它读出来的:这是「会看图的 AI」第一次真正上街干活。
它为什么这么厉害?因为它会「扫描特征」:像拿着放大镜,一小块一小块地扫过去,先认出「线条」,再拼出「弯弯的圈」,最后判断「这是 0 还是 6」。这种一层层扫描、一层层提炼的办法,就叫「卷积」——LeNet 是世界上第一批会卷积的神经网络。
把「让机器自己学会看」这件事坚持做了几十年,杨立昆得到了回报:2018 年,他和上一站讲过的辛顿,还有 本吉奥一起,拿到了计算机界的最高奖——图灵奖。
今天手机里的相册认脸、车牌识别、拍照翻译……用的都是 LeNet 的后代。它和它的后代们,是所有「看图的 AI」的老祖宗——你每按一次「拍照搜一搜」,背后都有杨立昆这张会扫描的小网络。
🖼️ 图片:杨立昆照片、图灵奖奖杯来自维基共享资源;手写数字样本取自 MNIST 数据集(Yann LeCun 等 · CC BY-SA 3.0);其余示意图为本课件自制
点击卡片翻开,看看背后的知识~
用的是真实 MNIST 手写数字(不是电脑生成的模板)!先点「🎬 开始可视化训练」看完整训练过程(损失曲线 + 滤镜/特征图点亮);再用下面的按钮一步一步调试(前向→反向→更新)。
先点上方「🎬 开始可视化训练」让 CNN 学会 0~9;再在 28×28 格子里用鼠标点亮像素(和真实 MNIST 一样大),画一个数字,点「🔍 识别」。右边会显示卷积滤镜在图片上找到了什么特征!(绿色 = 激活越强)
点选答案,答对会变绿、答错会变红(可重试)~
Q1. LeNet 最擅长做的事是什么?
Q2. LeNet 用「卷积」的办法,是怎么认图的?
Q3. LeNet 是哪位科学家的重要成果?
Q4. 训练器里「池化」这一层做的是什么?
Q5. 点「🔍 识别」后,右边那些绿色的图是什么?
Q6. 这个实验室训练用的手写数字,是从哪来的?
Q7. 杨立昆当年发明 LeNet,最先想解决的实际问题是什么?
Q8. 画完一个数字点「识别」,网络最后是怎么给出答案的?
💭 思考一下:你会怎么教一位外星朋友认数字?是一步一步拆开讲,还是一次性给它看整张图?哪种更像「扫描特征」?
小小学员 完成了 本站《LeNet:教电脑读懂手写数字》
学会:会「扫描特征」的卷积神经网络