← 返回课程 🛰️ E04 · 第11课 2017 年 · 人工智能简史 📐 大模型基石 · 注意力机制注意力机制 / Transformer让模型在处理一句话时,把注意力放在最相关的几个词上(给它们更大的权重)。层级:人工智能 ⊃ 机器学习 ⊃ 深度学习 ⊃ 大模型(Transformer)本站在这一门里的位置:2017 年《Attention Is All You Need》提出 Transformer,成了今天所有大模型的骨架。

📐 Transformer:注意力改变了世界

🎯 认识 2017 年 Transformer 的「注意力机制」——让 AI 学会关注重点,成为今天大语言模型的基石
2017 📐 第 11 站 / 16 · 2017 年

Transformer:注意力改变了世界

一篇论文带来的 AI 革命
🎯 本课目标:认识 2017 年 Transformer 的「注意力机制」——让 AI 学会关注重点,成为今天大语言模型的基石

🕰️ 故事时间 · 那时候发生了什么?

2017 年 · 📐
Transformer 结构图
论文里的 Transformer 结构图——今天所有大语言模型的地基

🖼️ 结构图:Transformer 全架构图 · CC BY 4.0 · Wikimedia Commons

2014 年 — 2016 年 · 背景
谷歌数据中心的机房照片
机器翻译早就上线了:谷歌翻译就跑在这样的大机房里。背景 · 真实照片

那是机器翻译已经很常见的年代:谷歌翻译每天要翻译上千亿个词。可它读句子的老办法有个大毛病——像排队一样,一个字一个字顺着读

句子一长就出问题:读到后面,「排队」在前的词早就忘得差不多了;而且只能一个词一个词往下走,慢。翻译长句子时,机器常常「记不住、翻不准」。

2017 年 6 月 12 日 · 提出
arXiv 上《Attention Is All You Need》论文页面的截图:标题、八位作者、提交日期与摘要
论文原页:2017 年 6 月 12 日提交,作者一栏挤了八个名字。真实论文页面(arXiv:1706.03762)

2017 年 6 月 12 日,一篇论文被上传到 arXiv,标题很霸气:《Attention Is All You Need》——「注意力,就是你所需要的一切」。

作者是谷歌的八位研究员。他们提出了一种全新的结构 Transformer:里面没有排队、没有循环,只留下一个机关——「注意力机制」。

2017 年 · 注意力在干什么
论文原图:making 把注意力投向远处的 more 和 difficult
「making」越过一整句,直接看到了远处的词。论文原图 · Google
论文原图:编码器第 5 层的一个自注意力头
每一层里都有许多个「注意力头」,各看各的重点。论文原图 · Google
论文原图:its 这个词同时连着前面的 Law 和 application
「its」一头连着「Law」、一头连着「application」——指代关系也能连上。论文原图 · Google

注意力做的事,就是让每个词自己去看该看谁。翻译这句话时,「making」一眼就望见了很远的「more」和「difficult」——隔得再远也忘不了

它还能分清「它」指的是谁:句子里的 its 死死盯着前面的 Law。机器第一次学会了「指代」这件事。下面三张都是论文里的原图,点开可以放大看连线。

2017 年 12 月 · 正式发表
谷歌 TPU 专用芯片的实物照片
今天的大模型,都在这样的专用芯片上训练(图为谷歌 TPU)。发布 · 真实照片

论文在 2017 年 12 月的 NeurIPS 大会上正式发表,代码和模型全部公开。有意思的是,论文里写着:当时最好的模型只用 8 块 GPU 训练 3.5 天——在那会儿,算是又快又省。

从那以后大家都改用它:2018 年起 BERTGPT 一个接一个冒出来,模型越做越大,也越来越「聪明」。

✨ 最终影响
ChatGPT 对话界面截图
2022 年底,ChatGPT 上线,两个月就吸引了上亿人。影响 · 真实界面截图

今天你听过的大语言模型——ChatGPT、Gemini、文心一言、通义千问——几乎都是这篇论文的「后代」。它们读句子用的还是同一招:注意力

八位作者大概也没想到:自己写下的几张纸,成了整个 AI 时代的地基。

🖼️ 图片:机房照片、TPU 实物照来自维基共享资源(Wikimedia Commons,CC BY-SA 4.0);论文页面、注意力可视化、ChatGPT 界面为真实论文原图与页面截图,仅作教学使用

📖 知识小课堂 · 记住这个魔法!

点击卡片翻开,看看背后的知识~

Transformer👆 点我翻开
2017 年提出的 AI 新架构,改变整个 AI 世界
💡注意力机制👆 点我翻开
让 AI 学会「抓重点」,而不是每个词平均用力
🐌老办法的毛病👆 点我翻开
以前像排队:一个字一个字顺着读,句子一长就忘了前面
📄那篇论文👆 点我翻开
2017 年 6 月上传的论文,标题叫《Attention Is All You Need》
🔍注意力在干什么👆 点我翻开
让每个词自己去看该看谁——隔得再远也忘不了
🎯它还能认出「它」👆 点我翻开
句子里的 its 一眼望见前面的 Law,机器第一次学会「指代」
🧮又快又省👆 点我翻开
论文里最好的模型,只用 8 块 GPU 训练 3.5 天
🔑大模型基石👆 点我翻开
今天的大语言模型(GPT 等)全都建立在 Transformer 之上

🖐️ 动手试一试 · 注意力机制可视化

🧠
情绪判断实验室 · 这句话是「高兴」还是「难过」? 2017 Transformer:有“注意力”的机器会回头看重点 —— 先看看“没有注意力”的它会怎么猜错
🎯 问题定义 · 判断这句话的情绪
一百分开心
❓ 机器要回答:这一整句话,该判「😄 高兴」还是「😢 难过」?(小心「不 / 开心」——它会把情绪翻个方向哦)

👇 第一台机器 —— 🙈 没有注意力:它只能一个字一个字地读,谁都不看。它的判断结果是:

✨ 第二台机器 —— 有注意力:它先一个字一个字读完整个句子,然后在本句末尾放一个 CLS“回头”看重点(真实 BERT 一般把 CLS 放在句子最前面,这里为了「先读完再回头判断」的直觉放在句尾,作用一样)、用点积找最相关的词 —— CLS 是 BERT 的“分类标记”:它不代表某一个字,而是专门把整句重点吸到一起、好做“整句判断”(点 CLS 或任意一个词试试)
🗺️ 向量空间 · 意思越像的词,点离得越近 —— 读一个词时,它就去找“向量最像”的词
这页每个词先用 6 个数(人物/物品/地点/样子/动作/其他)表示“意思”,再按一条固定规则投影成 2D 的一个点(公式看不懂没关系:只要知道「6 个数被压成纸上一个点」就够——左右 = 人物+动作 − 物品 +½样子 −½地点;上下 = 物品+样子 +½其他);原点 (0,0) 在图正中心,点与点之间不连线。真正“谁跟谁像”看上面词块之间的弧线热度:点积大 → 注意力多(真实模型维度要高得多,这里只是把向量投影到纸上示意)。
图里的浅灰小点/字是更多示例词:意思或情绪相近的会靠在一起(如 开心 ↔ 高兴),相反的会离得远(如开心/高兴 ↔ 难过),位置为示意。
🎯 看懂了吗?同样是判断“高兴还是难过”:🙈 没有注意力的机器只会一个字一个字地读,把每个词的感觉加起来 —— 遇到「考了一百分,却不开心」就被“开心”骗了,判成高兴 ❌;✨ 有注意力的机器先看全句重点,发现「不 + 开心」要连起来看 → 判成难过 ✅。
(本页的“开心/难过/向量”是精心设计的示例;真实 Transformer 里,词向量和“把不+情绪词连起来”的组合都要靠海量语料训练学出来 —— 但“变向量 → 找重点 → 组合信息”这套思路和真实注意力一模一样。
真实 BERT 一般把 CLS 放在句首;这里为了让小朋友有“先读完整句、再回头做判断”的直觉而放在句尾 —— 作用完全一样:CLS 就是机器专门用来“汇总整句、做整句判断”的标记,它自己的向量也是要学出来的。)

❓ 小测验 · 你学会了吗?

点选答案,答对会变绿、答错会变红(可重试)~

Q1. Transformer 最核心的「魔法机关」是什么?

Q2. 2017 年那篇改变世界的论文叫什么?

Q3. 今天的大语言模型,主要是建立在什么之上的?

Q4. 在「情绪判断」实验室里,第一台「🙈 没有注意力」的机器为什么判错?

Q5. 「✨ 有注意力」的机器为什么能判对?

Q6. 句子末尾那个 CLS(分类标记)是干什么用的?

Q7. 在那张「向量空间」图上,意思越像的两个词会怎么样?

Q8. 在向量空间里,一个词是用几个数来表示「意思」的?

🏁 回顾与完课 · 为自己盖章

我从故事里记住了一个新知识我能把这个故事讲给家人听我完成了一次小任务挑战我想把这一站和下一站连起来想一想

💭 思考一下:读一段话时,你最「注意」哪些词?为什么机器学会「抓重点」会这么重要?

🏅

人工智能简史 · 完课证明

小小学员 完成了 本站Transformer:注意力改变了世界

学会:一篇论文带来的 AI 革命

第 11 站
已完课