AI 编程智能体 03:拆解当下主流智能体能力
- Bilibili 同步视频
- 一、溯源:智能体的起源
- 二、主流智能体产品横向盘点
- 1. OpenAI Deep Research
- 2. Manus:瞄准 AGI 的通用智能体
- 案例①:7 天日本旅行规划
- 案例②:简约风格名片设计
- 3. 智谱・橙思
- 4. 通义千问「分析研究」
- 三、智能体核心运行逻辑可视化
- 四、智能体的核心特征:自主性
- 五、小结
✨ 马文・明斯基在 1986 年埋下的种子,在大模型时代终于破土而出。曾经只存在于书本中的「智能体」概念,如今已经诞生多款可上手的产品,不再是纸上谈兵。
Bilibili 同步视频
AI 编程智能体 03:拆解当下主流智能体能力
一、溯源:智能体的起源
早在 1986 年,人工智能之父马文・明斯基就在著作《思维的社会》中首次提出智能体(Agent)的概念。
有趣的是,这个想法沉寂了数十年之久。概念提出很早,但真正工程化落地、迎来爆发式增长,却是最近几年的事情。
普通大语言模型存在一个天然短板:受 Token 输出长度限制 📝。面对简单问题(比如基础计算题)应答流畅;一旦遇上复杂的多步骤调研任务,很容易回答片面、深度不足。
而智能体,正是用来补齐这块短板的技术方案。
二、主流智能体产品横向盘点
目前市面上已经涌现出多款代表性智能体产品,各有侧重,我们一起来看看它们的真实能力差异。
1. OpenAI Deep Research
作为 ChatGPT 背后团队推出的智能体产品,Deep Research 主打深度调研,属于付费能力。
我们拿一个真实调研任务举例:
查询过去十年,按 GDP 排名前十的发达国家、发展中国家安卓与 iOS 系统渗透率,并整理成表格。
普通 GPT 处理该任务:仅简单划分国家、粗略描述系统使用率,信息单薄。
Deep Research 处理该任务:
自主检索数据,输出结构化表格,清晰列出经济体排名、各国移动端系统占比,附带分析建议。例如美国 iOS 占 58%、安卓 42%;中国 iOS 占 24%、安卓 75%,信息详实规整。
2. Manus:瞄准 AGI 的通用智能体
Manus 是今年热度极高的智能体项目,目标直指 AGI,想要打造能够处理各类现实任务的通用 AI。
它的核心玩法:任务规划 + 虚拟机环境执行。
在虚拟机开辟独立运行空间,先创建 Markdown 格式 TODO 清单,把复杂大任务拆解成一个个子任务,按顺序逐步执行;每完成一项,就标记完成,直到全部任务闭环,输出最终成果。
案例①:7 天日本旅行规划
当我们提出需求,左侧展示模型思考、推理交互全过程,右侧实时展示检索状态。
它会自动访问各类旅游网站抓取公开信息,调研景点、路线、配套资源,完成全部子任务后,输出一份japan handbook旅行手册,也可以导出文档。
💡 对比:直接丢给普通大模型相同需求,很难自动做到如此细致的行程编排、景点信息整理。
当然 Manus 也并非完美,仍然存在部分任务无法完整收尾的瑕疵,但交互形式和解决问题的能力,已经非常贴近大家想象中的智能体。
案例②:简约风格名片设计
同样遵循「先规划 TODO 清单,再分步执行」的流程。
Manus 自主寻找设计资源,最终一次性输出两份产物:名片预览网页(正反面完整设计),以及可直接打印的名片 PDF 文件。
从调研规划到产出可交付文件,整套流程自动完成,生产力属性拉满。
3. 智谱・橙思
国内智谱 AI 开源的橙思,主打长程深度推理。
开启橙思模式后,相比普通推理模型,它更擅长复杂问题深度思考、长文本写作。
⚠️ 能力边界:橙思擅长推理思考,但不具备 Manus 那样在虚拟环境里新建网页、生成 PDF 文件的能力,聚焦在文本推理链路的强化。
4. 通义千问「分析研究」
阿里通义千问也上线了长程推理类智能体能力「分析研究」,同样面向复杂调研场景。
国内大厂陆续入局,智能体产品正在快速变多,形态持续轻量化。
📌 一个重要提醒:这些公有云智能体,全部基于已有公开数据训练。如果直接搬到企业内部业务场景使用,落地会遇到不小阻碍。这也是智能体开发领域需要攻克的核心课题。
三、智能体核心运行逻辑可视化
图表说明:这张流程图展示了 Manus 这类智能体的典型工作流。和普通大模型一次性生成文本不同,智能体采用任务拆解 + 分步执行的模式,循环完成子任务,最后整合交付成果,以此突破大模型单次输出 Token 上限的限制。
四、智能体的核心特征:自主性
看完产品案例,我们可以提炼智能体最关键的特征:自主性。
智能体可以在没有人类持续介入、实时干预的前提下,自主拆解目标、检索信息、一步步执行一系列动作,完成复杂任务。
普通大模型是「一问一答」,被动响应;智能体则是拿到目标之后,自己规划路线、主动行动,这是二者最本质的区别。
五、小结
从 1986 年的概念提出,到如今多款产品落地,智能体已经从学术猜想,走向真实可用的生产力工具。
OpenAI Deep Research 深耕调研,Manus 尝试通用任务自动化,橙思、通义千问补齐国内长程推理赛道。
当然现阶段智能体远不是完美形态,任务执行存在瑕疵,企业私有化落地依旧存在挑战。
但技术方向已经清晰:依靠任务规划、环境交互,突破原生大模型的能力边界。未来轻量化智能体,会渗透进更多开发、办公、研究场景。