🖼️ 图片:OpenAI Sora 生成的视频画面(公有领域)· Wikimedia Commons
AI 先学会了「认图」——看一眼就能说出「这是猫」。可人们更想让它自己画。2014 年,研究者伊恩·古德费洛想出「生成对抗网络(GAN)」:让两个 AI 组队,一个拼命画(生成器),一个拼命挑毛病(判别器)。画的一直改、挑的一直评,画出来的东西就越来越像真的——这是 AI 第一次能「画」出这么像真的东西。
2021 年 1 月,OpenAI 发布了 DALL·E:你打一句文字,它还给一张图画。「穿裙子的萝卜」「长着牛油果身体的扶手椅」……这些古怪要求它都画得出来,「文生图」就这样诞生了。不过这时候的图还有点像卡通,普通人也用不上。
2022 年,画图的 AI 突然变得「人手一份」:8 月,Stable Diffusion 把模型免费开源,谁都能下载到自己电脑上用;Midjourney 打开网页就能玩。图片也从「卡通感」升级成了照片级。一夜之间,很多插画、海报、头像都变成了 AI 画的。
图能画了,下一个问题自然就是:能不能让画面动起来?2023 年,一批「文生视频」工具冒了出来(Runway、Pika……),可它们只能生成几秒钟:人一走远就变形,动作也接不上。难在哪儿?视频是每秒二十几张图,每一张都得和前后接得上——这比画一张图难太多了。
2024 年 2 月 15 日,OpenAI 公布了 Sora。它和以前的工具完全不同:只要一句话,就能生成最长约一分钟的视频——画面稳定、有电影感,镜头还会跟着人走。最让人吃惊的是,连早就灭绝的长毛象它都能「拍」出来。这一天,全世界都在讨论这个名字。
Sora 厉害在两个地方。第一,它把视频切成一个个小方块(连时间也算进去),再像拼积木一样,一块一块往后接。第二,看过的视频太多,它慢慢琢磨出现实世界的物理规律:东西会往下掉、水会流动、影子跟着光走。所以科学家说:Sora 更像一个「世界模拟器」,而不只是视频工具。
刚亮相时,Sora 只能排队申请试用。直到 2024 年 12 月 9 日,它才正式对外开放:ChatGPT 的付费用户输入一句话、等上几分钟,视频就出来了。它的一条演示里,一只斑点狗蹲在意大利小镇的窗台上——那条片子被很多人转发。从此,「文生视频」从新闻里的黑科技,变成了人人可用的工具。
不过 Sora 也会犯迷糊:人走过桌子,手指可能「穿过」杯子;画面里人一多,它甚至数不清有多少条腿。因为真实世界太复杂,它学得还不够多。所以看到特别离奇的视频,不妨多看两眼、想一想——这也是 AI 时代我们要练的本事。
Sora 让全世界第一次看到:把脑子里的想法说出来,AI 就能把它「拍」成一段视频。广告、动画、教学片、小电影……做视频的门槛一下子低了。不过新问题也跟着来了——既然视频也能凭空造出来,以后看到的东西,我们还能相信吗?
🖼️ 图片:GAN 结构示意图(CC BY-SA 4.0)、DALL·E 生成的图画(公有领域)、Stable Diffusion 操作界面截图(Apache 2.0)、早期 AI 生成动画画面(CC BY-SA 4.0),以及多张由 OpenAI Sora 生成的视频画面(公有领域)——均为真实技术图纸 / AI 生成作品 / 软件界面截图,仅作教学使用
点击卡片翻开,看看背后的知识~
把滑条往右拉 = 正向加噪:画面被噪点越盖越多,最后变成一团雪花。
💡 诚实小贴士:真正的模型看过成千上万张图才会“去噪”;这里为了演示,把“去噪”简化成一步步回到原图的过程。
把它想成一个二维「图像空间」:原点附近 = 随机噪声,越往外越接近真实的照片——猫聚在右上、狗在左上。看 AI 怎么从原点的一点噪声,一步步「生成」出一张猫的照片。
① 原点:一团随机噪声,什么也看不清。
② 过程:噪声朝「猫的照片」方向走,一边走一边去噪。
③ 终点:变出一张清晰完整的猫照片。
把「图像」想成一只折好的千纸鹤:正向=把它一步步揉成随机纸团(高斯噪声 xT),逆向=「折纸大师」(去噪网络)一步步抚平褶皱,让折痕结构重新「显影」。条件决定折成什么,纸团的随机褶皱决定具体细节。
折纸对照:干净图像=千纸鹤 | 噪声=纸团 | 去噪网络=折纸大师 | 分数函数(往哪个方向抚更像折纸的「指南针」) | 条件=“我要折猫” | 多步=先抚大褶皱、再精修细节
点选答案,答对会变绿、答错会变红(可重试)~
Q1. Sora 最特别的本领是什么?
Q2. 为什么科学家说 Sora 像「世界模拟器」?
Q3. Sora 偶尔会犯的错,下面哪个是对的?
Q4. 扩散模型分成哪两半?
Q5. 扩散模型「生成」一张新图,是从什么出发的?
Q6. 那个折纸演示里,「去噪网络」被比作什么?
Q7. 折纸演示里,那个滑条从 0 拉到 100 代表什么?
Q8. 为什么做视频比画一张图难得多?
💭 思考一下:如果 Sora 能把你说的话变成视频,你最想让它拍什么?为什么这段画面对你很有意义?
小小学员 完成了 本站《Sora:一句话,生成一段视频》
学会:OpenAI 推出文生视频模型 Sora,物理世界模拟能力突破。