← 返回课程 🛰️ E04 · 第10课 2016 年 · 人工智能简史 🎯 强化学习 · 试错中变强强化学习(Reinforcement Learning)不给标准答案,只给奖励和惩罚,让机器自己试错、越练越强。层级:它是机器学习的一种(人工智能 ⊃ 机器学习 ⊃ 强化学习)。本站在这一门里的位置:2016 年 AlphaGo 用「深度学习看棋局 + 强化学习自我对弈 + 蒙特卡罗树搜索」战胜李世石。

🎯 AlphaGo:AI 有了棋感

🎯 认识 2016 年 AlphaGo 战胜李世石,理解强化学习——机器通过自己与自己下棋练出「直觉」
2016 🎯 第 10 站 / 16 · 2016 年

AlphaGo:AI 有了棋感

学会了「直觉」的围棋高手
🎯 本课目标:认识 2016 年 AlphaGo 战胜李世石,理解强化学习——机器通过自己与自己下棋练出「直觉」

🕰️ 故事时间 · 那时候发生了什么?

2016 年 · 🎯
2016 年 3 月首尔 Google DeepMind 挑战赛现场:左边是坐在棋盘前的李世石,右边是替 AlphaGo 落子的黄士杰
2016 年 3 月 9—15 日 · 首尔四季酒店(韩国棋院等主办)
左边是李世石,右边替 AlphaGo 落子的是黄士杰
AlphaGo vs 李世石Google DeepMind Challenge Match
2016 年 3 月 9 日 — 15 日 · 首尔
五番棋 · 最终比分 4 : 1(AlphaGo 胜)
  • 第一盘 3/9:AlphaGo 执白胜,李世石中盘认输
  • 第二盘 3/10:AlphaGo 执黑胜 —— 赛后李世石承认它「下得近乎完美」(媒体报道多在第三盘之后)
  • 第三盘 3/12:AlphaGo 执白胜,总比分变成 3 : 0
  • 第四盘 3/13:李世石执白胜 —— 第 78 手「神之一手」,人类赢下的唯一一盘
  • 第五盘 3/15:AlphaGo 执白胜,总比分定格 4 : 1

🖼️ 图片:2016 年首尔挑战赛现场(来源 mensgear.net,网络公开图片,仅作教学使用)

1950 年代 — 2015 · 背景
19 路围棋棋盘与黑白棋子实拍
19×19 的棋盘:看上去简单,却把人类难住了几千年。背景 · 真实照片

围棋看着简单——黑白两色的石头,轮流往交叉点上放。可它是棋类里最难的:棋盘上的变化比宇宙里的原子还多,每走一步大约有 250 种选择。

1997 年「深蓝」靠把每步能想到的走法往前算很多步、再挑最好的一步赢了国际象棋,可这一招在围棋上完全行不通——根本算不完。所以赛前,几乎没有人觉得电脑能赢。

2015 年 10 月 · 对局
AlphaGo 与欧洲冠军樊麾对局的棋谱记录
AlphaGo 与樊麾那一盘的对局记录(黑先)。提出 · 真实对局棋谱

2015 年 10 月,英国 DeepMind 公司的程序 AlphaGo 悄悄和欧洲冠军樊麾下了五盘——5:0 全胜。这是历史上第一次有程序在公平对局中战胜围棋职业棋手

2016 年 1 月,这件事登上了《自然》(Nature)杂志封面。全世界这才知道:围棋,也被攻下了。

2016 年 3 月 · 人机大战
2016 年的李世石
2016 年的李世石——他面对的对手不是人。发布 · 真实照片

2016 年 3 月,首尔:世界冠军李世石端坐在棋盘前,对面没有真人对手,只有一个叫 AlphaGo 的程序。这场「人机大战」下五盘,全世界几亿人屏住呼吸观看。

结果 AlphaGo 一连赢下三盘,比分一度是 3:0

2016 年 3 月 13 日 · 神之一手
第四盘(李世石执白对 AlphaGo 执黑)的棋谱
第四盘棋谱(李世石执白)——「神之一手」就下在这一盘。真实对局棋谱

第四盘,李世石下出第 78 手——一步看起来「毫无道理」的棋,解说员一开始都以为他下错了。可就是这一步,让 AlphaGo 彻底乱了阵脚,它连出昏招,最后投子认输。

人们把这一步称为「神之一手」。最终五盘比分定格在 4:1,AlphaGo 获胜,但李世石赢下了人类尊严的一局。

💡 它靠什么赢 · 棋感与强化学习
AlphaGo 使用的计算机机柜
AlphaGo 的「大脑」:一柜子一起算的计算机。真实照片 · Wikimedia Commons

AlphaGo 靠的不是算得更多,而是学会了「棋感」:它先向人类高手的棋谱学习,再自己跟自己下几百万盘,在无数次输赢里总结经验,练出了像人一样的直觉。

这种「自己和自己对弈、在试错中变强」的方法,就叫强化学习。后来它连人类棋谱都不看了(AlphaGo Zero),照样天下无敌。

✨ 最终影响
李世石和学生们在一起
人机大战之后,李世石成了孩子们眼里的英雄。影响 · 真实照片

李世石输了比赛,却让全世界看清了两件事:机器的棋力已经站上人类顶峰,而他那步绝妙的反击也提醒我们——人的创造力与勇气,依然闪闪发光

从这以后,AI 走进了日常:手机下棋、认人脸、翻译、开车……今天你身边的许多 AI,都用着和 AlphaGo 同一套「自己学」的本事。

🖼️ 图片:围棋棋盘、AlphaGo 计算机机柜、樊麾与李世石对局棋谱、李世石照片等取自维基共享资源(Wikimedia Commons);比赛现场照片来源 mensgear.net,仅作教学使用

📖 知识小课堂 · 记住这个魔法!

点击卡片翻开,看看背后的知识~

AlphaGo👆 点我翻开
谷歌的围棋 AI,2016 年以 4:1 战胜世界冠军李世石
💡为什么难👆 点我翻开
围棋变化比宇宙原子还多,不能只靠「算」
🀄19×19 的棋盘👆 点我翻开
每走一步大约有 250 种选择,深蓝那种「全算一遍」根本行不通
🇪🇺先赢樊麾👆 点我翻开
2015 年 10 月 5:0 赢了欧洲冠军樊麾,第一次有程序战胜职业棋手
📰上了《自然》封面👆 点我翻开
2016 年 1 月登上《自然》杂志封面,全世界才知道围棋也被攻下了
🖐神之一手👆 点我翻开
第四盘李世石下出第 78 手「神之一手」,赢下人类唯一一盘
🔑强化学习👆 点我翻开
自己和自己下几百万盘棋,在试错中总结经验,练出「棋感」
🤖AlphaGo Zero👆 点我翻开
后来它连人类棋谱都不看了,照样天下无敌

🖐️ 动手试一试 · 用五子棋看懂 AlphaGo

围棋的变化比宇宙里的原子还多、根本算不完,AlphaGo 的办法是「价值网络估价 + 蒙特卡洛(自己和自己下很多盘、数胜率)验证」:先用训练好的价值网络给棋盘估个价(看哪一步赢面大),再用蒙特卡洛在脑内自己和自己下很多盘来验证。下面这盘 9×9 五子棋(五子连珠即胜),轮到你下时点空格落 ⭕,轮到大名鼎鼎的迷你 AlphaGo 时,每一步你都能看见它的大脑在想什么~

🎮 五子棋 9×9 · 你 VS 迷你 AlphaGo
五子连珠即胜 | 你执 | AlphaGo 执
轮到你了:点空格落 ⭕

🔑 AlphaGo 的两步思考

  • ⚙️ 前提:价值网络已训练好:不用临场学习,一眼就能给棋盘「估价」。
  • ① 价值网络(估价):看当前棋盘,估出每个空位的「赢面」。
  • ② 蒙特卡洛(验证):在脑内自己和自己下很多盘,找到最合适的落子。
🧠 AlphaGo 的思考过程
⚙️ 前提:价值网络已经训练好了——它不用现场学习,一眼就能给棋盘「估价」。(真实的 AlphaGo 还有一个负责「直觉」的策略网络,这里为了好懂,只演示其中两步。)
价值网络:给当前棋盘估值
蒙特卡洛:自己和自己下,验证并找最佳落子

❓ 小测验 · 你学会了吗?

点选答案,答对会变绿、答错会变红(可重试)~

Q1. 2016 年,AlphaGo 战胜了谁?

Q2. AlphaGo 是怎么变强的?

Q3. 围棋为什么不能像深蓝那样「全算一遍」?

Q4. 在迷你 AlphaGo 里,它每一步要做的是哪两步?

Q5. 「价值网络」做的事情是什么?

Q6. 「蒙特卡洛」这一步做的是什么?

Q7. 在五子棋实验室里,价值网络会把所有空位缩小到几个候选?

Q8. 如果两步的结论不一致,迷你 AlphaGo 会怎么做?

🏁 回顾与完课 · 为自己盖章

我从故事里记住了一个新知识我能把这个故事讲给家人听我完成了一次小任务挑战我想把这一站和下一站连起来想一想

💭 思考一下:「直觉」能教给别人吗?如果机器也有了直觉,人的直觉还值钱吗?

🏅

人工智能简史 · 完课证明

小小学员 完成了 本站AlphaGo:AI 有了棋感

学会:学会了「直觉」的围棋高手

第 10 站
已完课