关于Agent的一些名词解释
1、核心大脑和基础沟通
这是AI可以运行的基础,底层逻辑是“概率预测”
(1)LLM(大语言模型):本质上是超大型的“文字接龙”程序。并不具备真正意识,知识通过海量数据学会了概率最高的说法方式。
(2)Prompt(提示词):用户对AI说的每一句话
(3)Context(上下文):像AI的“短期内存”。AI每次回答都要重新阅读这部分内容。
(4)Memory(记忆):这是一个“名词诈骗”。AI模型本身是无记忆的(stateless)。目前的“记忆”实现方式,起始就是程序自动把你们之前的对话历史重新塞进Context里。
2、增强大脑:赋予它知识与工具
AI训练完后知识就固定了,之后的事他就不知道,因此需要:
(1)RAG(检索增强生成):思想是“开卷考试”,AI不知道答案?没关系,先去私有文档或数据库里搜一下相关段落,把段落塞进上下文,让AI“看着文档回答”。
(2)Search(搜索):RAG的互联网版。AI联网搜索,把网页内容塞进上下文。
(3)Function Calling(函数调用):AI只会说话,不会操作。底层逻辑是:AI回复一段特定格式的代码(如JSON),外部程序识别到这段代码后去执行动作(如发邮件、查天气),然后再把结果传给AI。
3、连接协议:如何让工具标准化
当工具多了,就需要统一的“插口”。
(1)MCP(模型上下文协议):这是最近很火的概念。它的底层思想是“解耦”。以前每个AI助手都要单独写一套查天气、查数据库的代码;有了MCP,开发者写一个标准的“MCP服务器”,任何知识该协议的AI(如Claude、Cursor)都能直接连接使用这些工具,就像USB接口一样。
4、进化形态:聪对话框到智能体
这是目前竞争最激烈的领域,底层思想是从“你说我做”到“目标导向”。
(1)Agent(智能体):AI+规划能力+工具使用+自省能力。你给他一个目标(如“帮我写个网站并部署”),他会自己思考步骤、调工具、报错了自己改。
(2)SubAgent(子智能体):拆分任务。主Agent负责分工,子Agent负责具体执行(如一个写代码,一个找BUG),防止单一AI陷入上下文混乱。
(3)SKILL(技能):介于“死板代码”和“全自动Agent”之间。它把常用的复杂流程固化成一个“技能包”(包含提示词、脚本、工具说明),让Agent调用时更稳定。
5、总结一句话
所有的AI新词汇,本质上都在做同一件事:试图用自动化的程序,不断把“有用的信息”和“操作的权限”塞进那个只会玩文字接龙的LLM大脑里,从而让它显得像一个无所不能的专家。
