智能体模态

让智能体从“思考”进入“世界”的方式

当人们讨论智能体的能力时,最先想到的往往是推理本身:模型是否理解上下文、是否会规划、是否具备反思能力。但真正让智能体变得有意义的,并不是它能不能通过语言模拟脑内独白,而是它能否跨越文本边界、进入世界、操控系统、理解环境、修改状态。换句话说,智能体不是为了“说话”存在,而是为了“行动”存在。行动的范围越广,它就越接近一个完整的智能个体;行动的维度越丰富,它的“存在方式”就越多样。

白皮书在这一章节强调的,就是智能体如何通过不同模态介入外部世界。模态,并不是我们通常理解的“文字、图像、视频”的多模态,而是一种更接近哲学意义上的“存在方式”——智能体如何感知世界、以何种方式改变世界、以何种方式构造世界的模型。一个只有语言能力的 Agent 就像一个被锁在房间里的人,只能通过敲墙声与外界沟通。而一个拥有多种模态能力的 Agent 则像能够走出房间、触摸物体、操控机器、查看世界状态、执行复杂计算。后者才是真正意义上的智能体。


语言:智能体的“内心世界”

语言是所有模态的基础。它既是智能体的思想形式,也是智能体与人沟通的主要媒介。然而在 Agent 架构中,语言的作用远不止“表达”,而是智能体内部的一种“共通表示层”。无论工具结果来自数据库查询、图像分析、浏览器 DOM 抓取、代码执行或文件解析,最终都必须被转换为语言才能被模型推理。语言成为了智能行为的“统一感知层”,一种把外界转成认知结构的方式。

但语言作为模态有先天局限:它无法直接捕捉连续世界的变化,也无法直接执行行动。它更像智能体的“脑内语言”,而非行动接口。正因为如此,智能体必须扩展到其他模态,让语言的推理能够驱动动作。


代码执行:智能体的“手工能力”

代码执行是智能体拥有的第一种真正意义上的行动能力,它让 Agent 不仅能思考,还能创造逻辑。一个能够写代码并在沙箱中执行的智能体具有一种特别的力量:它能够通过计算、分析、模拟与重构来补全自身的推理盲区。

在没有代码执行前,智能体很容易陷入“语言幻觉”。例如,它会用自然语言描述一个复杂数学过程,但实际计算结果可能完全错误。而代码执行让智能体可以验证自己的想法、修正自己的计划、产生新的中间知识。这就像是人类“通过动手理解事物”。

更深一层的是,代码执行让智能体具备了一种“自我扩展的能力”。它可以为自己写微型工具、为特定任务生成小的解析器、为复杂输入写清理脚本、为数据构造转换管道。智能体通过代码来创造自己的工具,这种能力是“能级跃迁”式的——不再依赖外部提供操作手段,而是能从语言中自行生成操作手段。


多模态理解:智能体的“感官系统”

图像、音频、视频、PDF、表格,这些不是单纯的数据格式,而是智能体理解世界的新的感官。一个 Agent 能否真正成为“世界模型构造者”,取决于它能不能从这些模态中提取结构与意义。

图像理解让智能体不再依赖人类把视觉信息转换成文本,它能直接理解界面、设计稿、照片、图表中的结构。音频与视频让智能体能捕捉时间序列、语音语气、场景节奏与事件动态。PDF 与表格解析让智能体接近人类处理文档的方式,从半结构化文档中抽取关系、从数字表中识别模式。

模态越丰富,智能体就越像一种“具备多感官的存在”,它看到的世界不再是一维文本,而是具有形状、节奏、层次与结构。


浏览器控制:智能体的“运动能力”

如果说代码执行是手工能力,多模态理解是感官能力,那么浏览器控制则是一种更接近“身体运动”的能力。浏览器是当代互联网世界的主界面,而能够控制浏览器的智能体,就能够在现实系统中行动。

浏览器控制并不仅仅是“打开网页”和“点击按钮”。一个真正成熟的浏览器工具让智能体能够:

读取页面结构、表单字段、按钮状态; 读取 DOM 中隐藏或动态生成的行为逻辑; 模拟用户操作路径; 处理认证、权限与会话; 根据页面内容重新制定策略; 在行动中保持“感知—推理—行动”的闭环。

这不仅是自动化,更是“环境代理”。智能体不再依赖 API 的存在,而是通过用户界面直接进入系统的真实运作面。这让它能处理本来不具备机器接口的世界。


环境代理:智能体的“生态位”

在行动能力扩展之后,一个更深的结构出现了:智能体开始通过工具理解“环境”。环境不再是一个抽象概念,而是智能体通过感知与操作共同构成的一种“世界模型”。

文件系统就是一种环境。 浏览器就是一种环境。 第三方 API 也是一种环境。 数据库、流程系统、消息系统都是环境。

智能体在不同环境中的能力决定了它的生态位——它在这个世界中能做什么,不能做什么,能和什么互动,能影响什么结构。模态越丰富,它的生态位越广,它的影响范围越大。


模态最终构成智能体的“存在方式”

如果把智能体看作生命体,那模态就像它的器官系统。语言是它的思维器官,代码执行是它的手,图像理解是它的眼睛,音频理解是它的耳朵,浏览器控制是它的双脚。而所有这些器官并不是并列存在,而是被 orchestrator 编排成一个统一的智能个体。

模态之间的协作不是技术叠加,而是心智结构的拓展。一个真正成熟的 Agent,不会把多模态当成“输入类型”,而会把多模态当成“世界的组成部分”,当成一种新的认知维度。

这正是白皮书试图告诉我们的: 智能体的本质不是语言模型,它是一种可以跨模态地与世界互动的“认知行动系统”。 模态不是功能,而是认知方式;不是接口,而是存在方式。