当前位置: 首页 > news >正文

初识Agent

目录

Agent的分类:

从架构来分:

Workflow Agent(工作流智能体):

ReAct Agent(推理性智能体):

从应用场景来分:

通用Agent(General Agent):

专业Agent(Specialized Agent):

Agent的组成:

1)大模型

2)工具

3)知识库

扩展:Action,Tools,Skills,Function Call名词解释


上节RAG的工作流程与目标,介绍了RAG(Retrieval-Augmented Generation)检索增强生成的全工作流程,了解到RAG是依靠知识库检索,提升了大模型输出内容的质量。但是,我们也发现了RAG只在问答场景中出现,而真实业务往往需要调用接口、执行多步操作完成任务。AI Agent(智能体)就是用来解决这一问题的核心技术,Agent 是一套以大模型为大脑,可以理解用户需求、调用各类工具、执行多步动作,最终完成完整业务任务的 AI 系统。Agent 的核心作用,就是打通大模型与真实业务之间的鸿沟,把 “回答问题” 升级为 “办成事情”。

Agent的分类:

从架构来分:

Workflow Agent(工作流智能体):

开发者预先把全部步骤、分支逻辑提前定义完毕,大模型只能在指定节点完成局部任务,无权决定整体流程走向。优势是可控、可追溯、幻觉风险低,适合金融、审批这类对准确性要求极高的业务。

ReAct Agent(推理性智能体):

ReAct = Reasoning(推理) + Acting(行动),用于完成的无法提前设定步骤的任务。由大模型(LLM)自主思考,运行时动态决定下一步调用什么工具(推理)、执行什么操作(行动),观察获得反馈,根据反馈再去推理,行动,获得反馈。。。循环操作(Loop)直到完成任务。这种在完成任务时,模拟人类推理过程的方式是思维链(Chain Of Thought,COT)。

ReAct是目前非常主流的 Agent 基础架构,使用React技术的AI产品有AutoGPT,Perplexity,Manus,Cursor,GenSpark等,优点是执行流程不预先写死,灵活性高,面对流程不确定的任务可以自动调整策略。但结果存在不确定性,每一轮循环都要调用大模型,步骤多的时候 token 消耗大,响应变慢,极端情况陷入死循环,反复做无效调用。

从应用场景来分:

通用Agent(General Agent):

以通用基座大模型为大脑,工具集丰富,不绑定某一个行业,面向广泛、开放的各类任务,什么类型的问题都可以尝试处理,偏向 “全能助手”。它的优势是“广度”,什么都能干,可以处理跨领域、开放式、探索性任务。

专业Agent(Specialized Agent):

聚焦某一个行业、某一类固定业务场景,为特定业务目标定制。会绑定行业私有知识库、业务工具、工作流、业务规则。它的优势是“深度”和“精确性”,能真正解决特定行业的痛点。如Harvey(法律垂直专业 Agent),Glean(企业横向通用 Agent 平台)等。

Agent的组成:

1)大模型

大模型是不需要我们训练和调整的,有一些基座模型公司直接训练好,我们可以直接使用,如OpenAI, DeepSeek, Qwen等。具体有哪些可以参考什么是AI这一节的扩展部分。

2)工具

由于大模型没有能力去做任何的执行工作,它只能靠文字告诉Agent推理结果,然后Agent调用工具去帮他真正的去执行,从而完成各种工作(如读取文件,联网搜索等)。而大模型

的很多工具就是通过API接口提供的,所以上手大模型的应用,最快的方法的话就是调API了。

3)知识库

知识库为Agent提供了记忆能力。在如何与大模型交互?从提示词工程到RAG这篇文章的扩展部分,我们知道了大模型是无状态的,记不住任何内容的。记忆其实本质上也是个外挂,有两种存储的格式:

第一种是短期记忆,也把它称之为叫上下文;即你前几轮的对话内容。

第二种是长期记忆,例如你的操作风格、职业等信息,都可以被记录下来,存入专属数据库中,从而形成长期且关键的记忆。

可以简单理解为Agent = 大语言模型(LLM) + 工具 + 知识库。

扩展:Action,Tools,Skills,Function Call名词解释

这几个词均为 AI Agent 领域高频术语,相互关联但含义不同。

Action(行动)通常指智能体(Agent)经过思考后,最终决定并执行的具体操作。比如 Agent 判断需要先查资料,于是它发起了一个“搜索网页”的 Action。它是意图转化为实际执行的最终落地。

Tools(工具)是 AI 的“手脚”,是它连接外部世界的接口。AI 本身只会生成文本,但有了 Tools,它就能真正动手做事。比如:联网搜索、读取本地文件、调用天气API、执行 Python 代码等。

Skills(技能)是多个 Tools 和领域知识打包在一起的“能力模块”。比如“写一份竞品分析报告”这个技能,内部封装了:先调用搜索工具找资料 -> 再调用抓取工具读网页 -> 最后调用文档工具生成 PDF。它让 AI 从“只会用单件工具”进化为“能独立完成复杂任务”。

Function Call(函数调用)这是 AI 调用 Tools 的底层技术动作。当用户问“明天北京天气如何”,AI 通过 Function Call 机制,精准地向系统发出指令:“请调用天气查询工具,参数是北京”。它是连接 AI 大脑和 Tools 手脚的神经反射。

总结:Action,Tools,Skills三个几乎一样,是提前准备的功能模块;Function Call描述了大语言模型所具备的一种能力,即面对用户任务,能够自主判断是调用功能模块还是自己回答。

http://www.cnnetsun.cn/news/4242877.html

相关文章:

  • OCR It:为LLM应用打通不可复制文档的文本提取链路
  • 动态规划实战:从编辑距离到字符串最优包含问题解析
  • DAC实战选型与电路设计:从PWM到Σ-Δ,避坑指南与调试实录
  • 智能家电动态设计实战:从动效拆解到洗烘一体机状态可视化
  • 5A级景区在哪里?分享一个可以查询景区经纬度、海拔、天气和地图位置的网站
  • 为何AI对企业的描述常常偏离实际?根源多在信息基础
  • 品牌海外发稿如何选择有效媒体?如何制定海外媒体投放策略?
  • LLM+Function Calling开发助手Picodevil实战
  • AI Agent时代,企业即时通讯的数据安全体系如何重新设计?从聊天工具到智能通信入口
  • 40人小公司从零搭一套OA+手机App,我是怎么过的坑(全过程实战)
  • 通用CRC校验实现:参数化设计与嵌入式通信协议应用
  • AI Skill加载失效?从环境变量到配置文件的排查指南
  • eNSP实战 | Filter-Policy 路由策略过滤 —— 用 ip-prefix 精准 “屏蔽“ 一条路由
  • Unity性能优化_粒子特效(Particle System)
  • MATLAB高温防护服热传导建模实战:从数模竞赛到工程复现
  • 驳斥关于 ML-KEM 的误解
  • 蓝牙传感器开发新范式:Lynx库如何统一固件与App数据链路
  • 生物医学信号处理(北京工业大学)第二章
  • SPADE框架:可执行环境+自对弈+共进化,让AI自己生成训练环境
  • 用 Python 驱动 COMSOL 自动化仿真:6 行代码跑通
  • 刚刚,ChatGPT 开始卖广告了!
  • 什么是 SAP HANA Cloud 内置的 Property Graph Engine(属性图引擎)
  • BiliTools 开源 B站下载工具:把番剧、音乐、弹幕存到本地
  • 多模态图Transformer预训练:构建下一代推荐系统基础架构
  • E27灯座电流钳测试实战:从原理到精准测量的完整指南
  • AI服务器涨价超15%:内存成本飙升背后的工程应对之道
  • AI问答努力程度选择器实现指南:从粒度设计到前后端参数映射
  • Lodash.js核心函数实战指南:提升JavaScript工程效率
  • 医疗AI Agent执行层为何绕不开X12标准?工程实践指南
  • 零基础入门具身智能:从运动控制到ROS2工程实践