🖼️ 图片:多模态输入示意图 · CC BY 4.0 · Wikimedia Commons
那时候的 AI 是单科生:会看图的一直在认图——一圈圈做「卷积、池化」,把图像变成特征;会读字的一直在读字。两边语言不通,谁也说不清对方看到了什么。
OpenAI 的 CLIP 想了个办法:拿 4 亿组「图片 + 说明」一起练。练完以后,图和字被放进同一张「地图」——意思相近的就靠在一起,它第一次把「看到的」和「说出的」对上了。
有了这本事,「文生图」就顺理成章了:你描述「一只戴宇航员头盔的橘猫,在月球上吃冰淇淋」,它就把这句话变成一幅画——这幅画以前从没在世界上出现过。
2022 年夏天,画图工具开始「出圈」:Midjourney 开放使用,Stable Diffusion 干脆把模型开源——下载到自己电脑上就能跑。会打字的人,都能当「画师」。
同年 9 月,OpenAI 开源了 Whisper:先把声音切成一小段一小段(变成频谱图),再转成文字。开会录音、外语视频、课堂笔记,它都能自动听写成文字。
2023 年,AI 不再只会读一种东西:文字、图片、声音、视频可以一起进来。拍一张照片问它「这是什么花」,它认得出;给它一段音乐,它能说出是欢快还是忧伤。它第一次像人一样「多感官」地理解世界。
2024 年 2 月,AI 又跨了一步:给一句话,它能生成一段会动的视频(这就是「文生视频」,下一站细讲)。到这一步,它不只看得见、听得见,还能把画面「造」出来——风吹过、人走动、镜头推进,都能按你说的来。
今天,多模态 AI 已经走进很多行业:帮医生看片子、帮设计师出草图、帮农民认病虫害、帮我们翻译图片上的外文。你脑海里的奇思妙想,说一句话就能变成看得见的画面——这就是它带来的最大变化。
🖼️ 图片:卷积池化示意图(CC BY 4.0)、CLIP 图文配对图(MIT)、DALL·E 生成样本(公有领域)、Stable Diffusion 生成图(公有领域)、声音频谱图(CC BY-SA 4.0)、多模态融合示意图(CC BY 3.0)、文生视频画面(CC BY-SA 3.0)、基础模型+工具示意图(CC BY 4.0)——均为真实技术图纸 / AI 生成图 / 界面截图,仅作教学使用
点击卡片翻开,看看背后的知识~
2021 年 OpenAI 的 CLIP 是 AI 学会「看图又懂字」的关键一步:它用 文字编码器 + 图片编码器,把文字和图片都变成同一个向量空间里的向量,再算「搭不搭」。下面的图库是 真的 MNIST 手写数字(0–9,共 120 张,CLIP 看不到「这是几」的标签)——你说一句话,它凭「长得像不像」帮你把最像的图找出来!
真 · MNIST 测试集(0–9 每类 12 张)。点下面的例子或自己输入一句话,看 CLIP 找图~
每张真 MNIST 手写图配一句它的“名字”(7 / seven / 七…)。CLIP 不背标签——它只从“配对”里自己发现:长得像 7 的图和「7 的话」应该贴在一起。
这些也是真 MNIST,但训练时一次都没喂过(考卷)。CLIP 要是真学会了“数字的样子 ↔ 名字”的规律,没读过的也能认对;要是只会死记硬背就全错。
点选答案,答对会变绿、答错会变红(可重试)~
Q1. 「多模态 AI」的意思是?
Q2. 「文生图」是让 AI 做什么?
Q3. 2023 年起,AI 最大的进步是什么?
Q4. 在迷你 CLIP 实验室里,图库里有多少张手写数字?
Q5. 图库里那些手写数字,CLIP 事先知道「这是几」吗?
Q6. CLIP 是怎么学会把「字」和「图」对上的?
Q7. 在向量空间里,怎么判断一张图和一句话「搭不搭」?
Q8. CLIP 从没学过「偶数」这个词,为什么也能听懂?
💭 思考一下:如果 AI 既能看、又能听、还能画,它最可能帮你完成哪一件「大事」?
小小学员 完成了 本站《多模态 AI:看得见、听得懂、画得出》
学会:AI 长出了「眼睛、耳朵和画笔」