分享
(一)Agent-破局意义
输入“/”快速插入内容
(一)
Agent
-
破局意义
用户5069
用户5069
用户5083
用户5083
2025年10月10日修改
一、大模型的 “先天局限” 与 Agent 的 “破局意义”
🗨️
大模型的出现,让 AI 首次具备了接近人类的语言理解与生成能力。但本质上,早期的大模型更像一个 “封闭的语言黑盒”—— 它依赖训练数据中的统计规律生成内容,却缺乏与真实世界的交互能力:
•
它能背诵历史日期,却无法实时告诉你 “今天的天气”;
•
它能分析合同条款,却不能直接调用系统修改合同中的错误;
•
它能规划旅行路线,却不会自己打开订票软件完成预订。
这些局限的核心,在于大模型缺少三个关键能力:感知世界的 “眼”、自主决策的 “脑”、执行行动的 “手”。而 Agent 的兴起,正是为大模型补上这三块拼图 —— 让 AI 从 “能说” 进化为 “能做”,从 “被动应答” 升级为 “主动解决问题”。
•
静态知识依赖
:
仅能依赖训练截止日期前的固化知识(如两年前GPT无法回答“今天是几号”)
•
纯文本交互局限
:
只能通过语言输入输出与世界互动
•
有限计算与记忆
:
上下文窗口限制了短期记忆,缺乏长期存储能力
•
无工具使用能力
:无法调用外部API或执行具体操作
二、Agent 的 “三原色”:眼、脑、手的协同机制
如果把 Agent 比作一个 “数字人”,那么 “眼、脑、手” 就是它的核心器官,三者协同构成完整的智能闭环。
1.
“眼”:感知系统 —— 连接世界的传感器
“眼” 是 Agent 的感知入口,
负责收集环境信息、用户需求和任务上下文
。
它的核心功能是
“将模糊的输入转化为可处理的信息”
,具体包括:
🗨️
•
外部环境感知
通过 API 接口(如天气 API、地图 API)获取实时数据,通过网页爬虫抓取动态信息(如股票价格、新闻热点),甚至通过物联网设备读取物理世界状态(如室温、设备运行参数)。
例:旅游 Agent 的 “眼” 会盯着目的地未来 3 天的降水概率、景区实时人流数据,以及用户手机定位显示的当前位置。
•
用户意图理解
不仅能识别用户的显性需求(如 “订明天去上海的机票”),还能捕捉隐性需求(如用户提到 “带老人出行”,暗示需要选靠窗座位、避免红眼航班)。
例:客服 Agent 通过用户语气(如 “着急”“多次催促”)判断优先级,优先处理紧急工单。
•
状态追踪
实时监控任务执行中的关键节点(如 “订单是否支付成功”“邮件是否发送到位”),确保流程不中断。
2.
“脑”:认知系统 —— 决策与记忆的核心
“脑” 是 Agent 的智能中枢,
负责规划任务、存储记忆、优化决策,对应人类的 “思考” 能力
。
它由三个核心模块构成:
🗨️
(1)
规划模块:把 “大目标” 拆成 “小步骤”
复杂任务往往需要分阶段完成,规划模块的作用是 “拆解目标 + 制定路线”:
•
子目标分解:将用户的原始需求转化为可执行的子任务。
•
例:用户说 “帮我准备下周的商务出差”,规划模块会拆解为:①确定出差日期和目的地 ②查询往返航班(匹配用户 “偏好直飞” 的习惯) ③预订酒店(靠近会议地点) ④预约接送机 ⑤整理行程表。
•
动态调整:根据执行中的变化实时优化计划。
•
例:若预订时发现首选航班已满,自动切换到下一班,并同步调整接送机时间。
•
优先级排序:当多个任务冲突时,按重要性排序。
•
例:同时收到 “订餐厅” 和 “回复紧急邮件” 的需求,优先处理邮件(基于 “工作优先” 的用户设定)。
(2)记忆模块:存储信息,沉淀经验
记忆是 Agent “学习” 的基础,分为短期记忆和长期记忆:
•
短期记忆(In-Context Learning):临时存储当前任务的上下文,确保对话或流程的连贯性。
•
例:用户先问 “北京天气如何”,接着问 “那需要带伞吗”,短期记忆会关联前一句的天气信息(如 “中雨”),给出 “需要带伞” 的答案。