🖼️ 图片来源:公有领域 · Wikimedia Commons
人们早就想让机器替自己干活。可那时候的「自动」都靠人把步骤一条条写死:点哪个按钮、往哪一格填字,全得提前规定好。它也只会重复同一套动作——界面一变、按钮一挪,它就傻在那儿。会「照剧本演」,但不会自己想办法。
2011 年,手机上的语音助手出现了:你说话,它听得懂,还能帮你定闹钟、查天气;后来家里又多了能放在桌上的智能音箱,喊一声就能放歌、开灯。可它们只会做那几件提前定好的事。你说「帮我订张票」「把作业发给老师」,它多半只能回答一句:「抱歉,我还不会。」——会说话,不等于会干活。
2022 年 11 月 30 日,ChatGPT 上线。它和以前的助手很不一样:你想问什么都能问,它像读过很多书的人一样答得上来,还能写作文、写代码、翻译、解释概念——人们第一次觉得:AI 好像有了一个会思考的「大脑」。可它还是只能待在聊天框里:会说,但不会动手。(第 13 课里我们看过:它是到 2024—2025 年才学会「边想边说」的。)
2023 年 3 月,一个开源项目 AutoGPT 突然火遍全网。你只要给它一个目标,它就会自己把大目标拆成一小步一小步:自己上网查资料、自己写文件、自己回头看「这一步成没成」,做错了再换个办法。AI 第一次从「你问一句、它答一句」,变成「你定目标、它自己跑完」——大家给这样的 AI 起了个名字:智能体(Agent)。
智能体要干活,就得会「用工具」:查天气、算数、读文件、发消息……可每接一个新工具都要重做一遍,太麻烦了。2024 年 11 月,Anthropic 公司公开了一个叫 MCP(模型上下文协议)的开放标准:它把各种各样的工具都做成同一种规格。从此智能体接工具,就像给手机插上充电线一样方便——工具越多,它能替你办的事就越多。
到了 2025 年,智能体开始变成普通人也能用上的产品(比如手机上的智能体 App)。你写一句「帮我做一份春游计划的幻灯片」,它会自己找资料、自己排版、自己生成文件,你只要最后检查一下;做表格、画图、写报告,也都可以直接「派」给它。请 AI 干活,从此不再是程序员的专利。
2025 年,开源项目 OpenClaw 又往前走了一大步(在它之前,2024 年 10 月起已经有「会用电脑」的智能体——AI 第一次学会看着屏幕自己动手):它能让 AI 直接看着手机和电脑的屏幕,自己找到按钮、点下去、打字、拖文件;更厉害的是「跨 App 协同」——你说「把相册里的小狗照片发给妈妈,再在日历里记下周六野餐」,它会自己依次打开相册、微信、日历,一件件办完。因为开源,全世界的开发者都能给它添砖加瓦,它很快成了智能体圈里的「现象级明星」。
智能体把三样本事凑到了一起:会思考的「大脑」、会看会听的「眼睛和耳朵」、会操作屏幕的「手」。所以它不再只是回答问题,而是能真的替你把一件事办成。这股力量还在走出屏幕——今天的人形机器人背后,也常常住着一个会看、会想、会动手的智能体。AI 的下一个时代,属于「会办事」的 AI。
🖼️ 图片:实验室机械臂(NIAID,公有领域)、智能音箱 Amazon Echo(The Unwinder,CC BY-SA 2.0)、ChatGPT 界面截图(Lugab89,CC BY 3.0)、AutoGPT 标志(AutoGPT 开发团队,CC BY-SA 4.0)、MCP 官方组件图(modelcontextprotocol,MIT)、Manus 智能体 App 截图(公有领域)、OpenClaw 界面截图(OpenClaw 项目,MIT)、人形机器人 TOCABI(Cadop,CC BY-SA 4.0)——图片文件均取自 Wikimedia Commons,其中的软件界面与标志版权归各自产品所有,仅作教学使用
点击卡片翻开,看看背后的知识~
📚 智能体的权威定义(学术界)
智能体(Agent)是指任何能够通过传感器(Sensor)感知环境、并通过执行器(Actuator)对环境采取行动以实现目标的实体。—— Stuart Russell & Peter Norvig《人工智能:一种现代方法》
🔁 一个完全的自主智能体,必须具备 4 大核心闭环能力
接收环境的多模态信息:文字、图片、声音、屏幕内容。
= 下面流程图里的「看屏幕 · 听声音」把大目标分解成可执行的多步子任务。
= 下面流程图里的「🗺️ 规划」自主调用外部工具(搜索引擎、API、数据库、计算器)补信息或改变环境。
= 下面流程图里的「🛠️ 工具使用」短期工作记忆 + 长期记忆,并能根据行动结果自我纠错。
= 下面流程图里的「💾 记忆」✅ 关键判定标准:目标驱动 + 自主行动——给它一个最终目标(如「帮我订下周二去北京的机票」),它自己决定执行路径,全程不需要人一步一步指挥。
🛠️ 它能调用的真实工具:计算器 · 日期时间 · 单位换算 · 文本统计 · 记忆本
点选答案,答对会变绿、答错会变红(可重试)~
Q1. OpenClaw 是一款什么样的项目?
Q2. OpenClaw 最特别的本领是什么?
Q3. 「跨应用协同」指的是什么?
Q4. 智能体(Agent)的定义里,靠什么「感知环境」?
Q5. 智能体的 4 大能力里,「推理与规划」做的是什么?
Q6. 那个实验室里,OpenClaw 能调用几个真实工具?
Q7. 它把一个任务最多拆成几步来执行?
Q8. 它输出答案之前,最后一步做了什么?
💭 思考一下:如果 AI 能替你操作手机和电脑,你会请它帮你做什么?又有哪些事,你更愿意自己做?
小小学员 完成了 本站《OpenClaw:会自己用手机电脑的 AI 助理》
学会:开源多模态智能体框架,实现手机/电脑自动化操作与跨应用协同,迅速成为 AI Agent 领域现象级项目。