AI 编程不得不知道的二三事
一句话记忆:模型是「大脑」,IDE/终端 Agent 是「手脚」,范式是「怎么用它」,MCP 等协议是「接口标准」,Coze/Dify 是「搭积木的台子」。
以下内容仅为一家之言,旨在统计AI相关的东西,目前以2026年8月份的数据进行整理:
一、大语言模型
1.1 国外模型
| 模型 | 厂商 | 核心优势 | 短板 | 适合场景 |
|---|---|---|---|---|
| ChatGPT / GPT(GPT-5.x 系列) | OpenAI | 综合最均衡,推理、数学、端到端编程都很强;生态(Codex、API、Copilot)最完整 | 中文语感略逊;强模型价格偏高 | 全能型主力,英语场景首选 |
| Claude(Opus / Sonnet / Haiku,最新为 Claude 5 家族) | Anthropic | 编程 + 长文本的「天花板」;Agent 能力(工具调用、自主任务)业界公认最强;代码质量、代码审查口碑好 | 多模态相对基础(图文为主);价格较高 | 复杂编码、代码重构、Agent 开发 |
| Gemini(Gemini 3.x) | 多模态原生最强;科学推理强;与 Google 全家桶(搜索/Workspace)深度集成;性价比高 | 编码 Agent 手感略逊 Claude/GPT | 多模态、文档/图表理解、长上下文 | |
| Grok(Grok 4.x) | xAI | 实时联网(X 数据)、风格活泼、多模态 | 生态与工具链不如前三家 | 实时信息、社交媒体相关任务 |
| Llama / Mistral | Meta / Mistral | 开源可私有化,是大量本地部署/微调的底座 | 旗舰能力略逊闭源头部 | 自建/私有化部署、垂直微调 |
1.2 国内模型
| 模型 | 厂商 | 核心优势 | 适合场景 |
|---|---|---|---|
| DeepSeek(V4 / R 系列) | 深度求索 | 成本效益之王,开源 MoE 架构;中文/数学/代码强;价格极低,是国产编程 Agent 首选「大脑」之一 | 编程、低成本规模化、开源生态 |
| 通义千问 Qwen(Qwen3.x) | 阿里 | 国产第一梯队,Agent/工具调用能力突出;全尺寸开源,生态好 | 智能体、工程化部署、To B |
| Kimi(K2/K3) | 月之暗面 | 长上下文国产领跑,多智能体协作能力强 | 长文档分析、多 Agent 任务 |
| 智谱 GLM(GLM-5.x) | 智谱 AI | 清华系,代码与 Agent 能力均衡,开源积极 | 学术/研究、国产替代 |
| 豆包 Doubao | 字节 | 与 Trae/扣子生态绑定,编程模型 Doubao-Seed-Code 成本极低 | 字节生态内开发 |
| 文心一言 ERNIE | 百度 | 中文理解 + 百度搜索/地图生态 | 中文内容、搜索增强 |
| 其他 | MiniMax、阶跃星辰、百川、讯飞星火、腾讯混元 | 各有垂直优势(语音/多模态/政务等) | 特定行业/垂直场景 |
1.3 选型建议
二、AI IDE 与编辑器
2.1 国外
| 工具 | 厂商 | 形态 | 定位与优势 |
|---|---|---|---|
| Cursor | Anysphere | IDE(VS Code 分支) | 独立 AI IDE 的综合最强;Tab 补全是行业标杆;并行子 Agent、插件/MCP 生态最全 |
| Claude Code | Anthropic | 终端 CLI | 终端 Agent 的代表;大型多文件重构、代码库级理解的王者;被大量资深开发者选作主力 |
| OpenAI Codex | OpenAI | 终端 CLI | 开源终端 Agent(Rust 重写,性能强);与 ChatGPT/API 深度绑定;/goal长时域任务、多 Agent 并行 |
| Windsurf(→Devin Desktop) | Cognition | IDE(VS Code 分支) | Cascade 结对编程体验好;2026 年 6 月已更名为 Devin Desktop,路线图有不确定性 |
| GitHub Copilot | GitHub/微软 | 插件(各 IDE 通用) | 老牌补全助手,覆盖面最广、上手成本最低;企业集成好 |
| Cline | 开源 | VS Code 插件 | 开源自主 Agent,模型自由切换、MCP 生态成熟 |
| Aider | 开源 | 终端 CLI | 轻量终端 Agent,git 集成好,适合脚本化 |
| Zed | Zed | 编辑器 | 性能极致,ACP 协议的推动者 |
| Antigravity | IDE | Google 的 Agentic IDE,与 Gemini 深度绑定 | |
| Devin | Cognition | 云端自主 Agent | 「AI 软件工程师」,云端独立完成整块工程任务 |
2.2 国内
| 工具 | 厂商 | 形态 | 定位与优势 |
|---|---|---|---|
| Trae(含 SOLO) | 字节跳动 | 独立 AI IDE | 国内首个 AI 原生 IDE;SOLO 模式多智能体协同、白盒可监督;月活数百万 |
| Qoder / Qoder CN(原通义灵码) | 阿里 | 插件 + IDE + CLI | 2026 年 5 月通义灵码更名;国产模型自由切换(Qwen/DeepSeek/Kimi/GLM);企业合规强 |
| CodeBuddy | 腾讯 | 插件 + IDE + CLI | 国内首款同时支持三种形态;混元+DeepSeek 底座;微信生态集成深;引入 Skills/Plan 模式 |
| 文心快码 | 百度 | 插件 + IDE | 百度 Comate,中文场景、百度生态 |
| Kiro | AWS(亚马逊) | 独立 IDE | 主打 Spec-Driven 规范驱动开发 + Hooks 自动化 |
2.3 选型流程图
三、开发范式
3.1 Vibe Coding(氛围编程)
提出者:OpenAI 联合创始人 Andrej Karpathy,2025 年 2 月;被《柯林斯词典》评为 2025 年度词汇。
定义:用自然语言描述需求,让 AI 直接生成/修改代码,人不再逐行审查、甚至不完全理解代码,「感觉对了就行」。
典型做法:下指令 → 点「全部接受」→ 报错直接贴给 AI → 修不好就绕过去。
优点:门槛极低、原型产出极快。
风险:技术债、安全漏洞、难以维护大项目。
适用:周末 demo、一次性脚本、验证想法。
3.2 Spec-Driven Development(规范驱动开发)
定义:先让 AI 写「规格文档」(需求 → 设计 → 任务清单),人确认后再写代码。
代表:Kiro 的 Specs 机制、Trae SOLO 的 Plan 模式、Claude Code/Codex 的 plan。
优势:解决 Vibe Coding「边做边想、反复返工」的问题,更可控、更适合工程化项目。
3.3 Agentic Engineering(智能体工程)
趋势:Karpathy 2026 年提出的新阶段——99% 的时间不再直接写代码,而是指挥、监督 AI 智能体干活,并加入审查与质量控制。
本质:Vibe Coding 的「进阶成熟版」——保留了自然语言驱动的高效,但补回了工程严谨性。
四、核心概念 / 热词
4.1 Agent(智能体)
定义:能自主规划、调用工具、多步执行、自我纠错的 AI 系统。区别于「你问一句它答一句」的聊天模型,Agent 是「给目标,它自己干完」。
关键能力:任务拆解(Plan)、工具调用(Tool use / Function calling)、记忆、循环执行(直到目标达成)。
在编程里:Claude Code、Codex、Cline 本质都是「编码 Agent」。
4.2 Skill(技能)
定义:把「一类任务的固定做法」沉淀成可复用的指令文件(如
SKILL.md),Agent 遇到对应任务时自动加载执行。意义:让 AI 从「每次都重新摸索」变成「调用已知套路」,质量更稳定。
关联:Claude Code、CodeBuddy、OpenClaw、Hermes 等都已支持 Skill 机制。
4.3 Superpowers(超能力技能库)
定义:一个开源「技能包」(由 Jesse Vincent/obra 发起),给 Claude Code 等 Agent 装上一套结构化的工程方法论——brainstorming(头脑风暴)、TDD(测试驱动)、systematic-debugging(系统化调试)、writing-plans(写计划)等。
本质:把「资深工程师的工作流程」做成一个个可调用的 Skill,让 AI 干活时先想清楚再动手,而不是瞎写。
一句话:Superpowers = 「教你 AI 按工程纪律干活」的一套技能集合。
4.4 MCP(Model Context Protocol,模型上下文协议)
定义:Anthropic 发起的开放协议,标准化AI Agent 如何连接外部工具/数据/API。
类比:「AI 的 USB-C 接口」——一个 MCP 服务器(如 GitHub、数据库、文件系统)可以被任何支持 MCP 的 Agent 复用。
地位:已成为事实标准,几乎所有主流 AI 工具都支持。
4.5 ACP / A2A(容易混淆,务必分清)
| 协议 | 全称 | 解决什么 | 类比 |
|---|---|---|---|
| MCP | Model Context Protocol | Agent ↔ 工具/数据 | AI 的 USB-C |
| ACP | Agent Client Protocol | 编辑器 ↔ 编码 Agent | Agent 的 LSP(语言服务器协议) |
| A2A | Agent-to-Agent | Agent ↔ Agent 协作 | Agent 间的「通信协议」 |
ACP(Zed/JetBrains 发起):让「任何 Agent 都能跑在任何编辑器里」。
A2A(Google 发起,已捐 Linux 基金会):让多个 Agent 互相通信协作。
注意:缩写 ACP 其实对应三个不同协议,编码语境下通常指Agent Client Protocol。
4.6 小龙虾(OpenClaw)
全称:OpenClaw(曾用名 ClawdBot → Moltbot),因图标是红龙虾被国内叫「小龙虾/龙虾」。
作者:奥地利程序员 Peter Steinberger。
定位:本地优先、开源的自主 AI Agent 框架(TypeScript/MIT),被称为「AI Agent 的操作系统」——让 AI 真正在电脑上「动手」:操作文件、终端、浏览器,自主拆解任务、纠错、重试。
与聊天 AI 的区别:聊天 AI「动口」,OpenClaw「动手」。
风险:权限大、误判可能误删文件;Skill 供应链安全;算力消耗大。
4.7 Hermes Agent(「爱马仕」)
厂商:美国 Nous Research(2026 年 2 月开源)。
定位:终端原生、可「自进化」的 AI 编程智能体——口号「与你一同成长的智能体」。
四大特色:① 持久记忆迭代(跨会话记住项目/习惯);② 自主任务拆解;③技能自我沉淀(自动生成
SKILL.md);④ 安全沙箱。对比:Claude Code「活在仓库里读写代码」;OpenClaw「记忆静态、技能靠手写」;Hermes「自己长出能力,越用越懂你」。
4.8 扣子(Coze)
厂商:字节跳动/火山引擎。
定位:零代码/低代码 AI Agent 平台(SaaS),拖拽式编排,上手最快(约 15 分钟搭一个 Agent)。
优势:插件生态丰富(800+)、一键发布到微信/飞书/豆包等渠道。
局限:不支持私有化部署,数据过字节云。
适合:业务人员/非技术用户、智能客服、内容创作、快速验证创意。
4.9 Dify
厂商:开源社区(GitHub 50k+ Stars)。
定位:开源 LLMOps / Agent 开发平台,API 优先、支持 Docker 一键私有化部署。
优势:RAG 引擎深度可调(混合检索、分段、Embedding 可换)、20+ 模型供应商、每个应用自动生成 REST API。
适合:需要私有化/数据合规、复杂业务逻辑、深度二次开发、嵌入自有系统的团队。
| 维度 | Coze 扣子 | Dify |
|---|---|---|
| 类型 | 零代码 SaaS | 开源 LLMOps |
| 用户 | 非技术/业务人员 | 开发者/企业 |
| 核心 | 易用 + 生态分发 | 工程化 + RAG + 私有化 |
| 部署 | 仅 SaaS | 可私有化 |
4.10 其他关键概念
RAG(检索增强生成):让模型「先查知识库再回答」,解决幻觉、私有知识问答的核心技术。
AGENTS.md / CLAUDE.md:项目级「AI 记忆文件」,告诉 Agent 项目的规则、命令、约定。
Function calling / Tool use:让模型能调用外部函数/API 的能力,是 Agent 的基石。
Embedding / 向量数据库:把文本转成向量做语义检索,RAG 的底层。
SLOP(Structured Output Protocol):开源社区推动的「用 prompt 声明输出结构」的轻量协议,与 MCP 互补。
五、开发 AI 应用需要学什么
按优先级展开:
Prompt 工程(必学,门槛最低):怎么写清楚需求、怎么给上下文、怎么让输出稳定。这是所有 AI 开发的「基本功」。
Function calling / Tool use(必学):让模型能查数据库、调 API、操作工具——没有它模型只是个「聊天框」。理解 JSON Schema 定义工具。
RAG + 向量数据库(高频刚需):私有知识问答、企业知识库都靠它。理解「分块 → 向量化 → 检索 → 拼进 prompt」这条链路。
Agent 框架(进阶):LangChain / LangGraph(编排工作流)、CrewAI / AutoGen(多智能体)、或直接用 Claude Agent SDK / OpenAI Agents SDK 手写循环。建议先手写一个最简 Agent 循环再上框架,理解本质。
MCP(工程化必备):会写/会接 MCP Server,就能把任何工具「插」进任何 Agent。
评测与微调(高级):用基准(如 SWE-bench 测编程 Agent)、构建 eval 集评估你的应用;必要时做 Fine-tuning(微调)或 LoRA。
一个务实的建议:不要一上来啃框架。真正的核心链路只有一句话——「模型 + 工具调用 + 循环/记忆」。手写一个小 Agent(10 分钟能跑通)比背 LangChain 文档有用得多。
六、其他值得关注的热门
6.1 网页/应用「一句话生成」类(Vibe Coding 的产物)
v0(Vercel):一句话生成 React 前端 UI。
bolt.new(StackBlitz):浏览器内一句话生成并运行全栈应用。
Lovable:面向非程序员的「想法 → 可上线产品」。
Replit Agent:云端一体化「从想法到部署」。
6.2 智能体/工作流框架
LangChain / LangGraph:最主流的 LLM 应用与有状态工作流编排框架。
CrewAI:多智能体「角色协作」框架。
AutoGen / Semantic Kernel(微软):多智能体对话/编排。
Anthropic Agent SDK / OpenAI Agents SDK:官方 SDK,手写 Agent 循环的首选。
6.3 基础设施
向量数据库:Pinecone、Weaviate、Milvus、Qdrant、Chroma,以及 pgvector。
模型网关/聚合:OpenRouter、硅基流动 SiliconCloud(国内)、OneAPI。
评测基准:SWE-bench / SWE-bench Verified(编程 Agent 能力)、Aider Polyglot、LMArena(模型盲测排行榜)。
6.4 趋势性概念
Agentic IDE:IDE 从「补全工具」升级为「可自主完成任务的智能体环境」(Kiro、Antigravity 等都主打这个概念)。
长时域 Agent(Durable Goals):让 Agent 跨会话、跨中断持续干一个长期目标(如 Codex 的
/goal)。AGENTS.md / 项目记忆:把项目规则写进文件,让 Agent「懂你的项目」。
七、快速选型建议
几句话总结:
写代码主力:国外 Cursor / Claude Code,国内 Trae / Qoder / CodeBuddy。
模型「大脑」:编程+Agent 选 Claude;全能均衡选 GPT;多模态选 Gemini;性价比/中文/私有化选 DeepSeek、Qwen、GLM、Kimi。
搭应用:快速上线选 Coze 扣子;私有化/深度定制选 Dify。
后台数字助手:OpenClaw(小龙虾)动手能力强;Hermes(爱马仕)记忆/自进化强。
底层协议:MCP(连工具)、ACP(连编辑器)、A2A(Agent 协作)——分清三者是理解现代 Agent 生态的关键。
拓展
cpu,gpu有什么区别?对于ai部署本地模型都有哪些影响?
简单说:CPU 擅长通用、复杂的串行任务;GPU 擅长大量重复的并行计算。
本地运行大语言模型时,GPU 通常决定速度,内存/显存决定模型能不能装下。
对比项 | CPU | GPU |
|---|---|---|
核心数量 | 少量强核心 | 大量并行小核心 |
擅长任务 | 系统逻辑、数据处理、控制流程 | 矩阵乘法、神经网络推理和训练 |
内存 | 系统内存 RAM,通常容量大、便宜 | 独立显存 VRAM,容量较小但带宽很高 |
AI 推理速度 | 通常较慢 | 通常明显更快 |
AI 生态 | 通用性好 | NVIDIA CUDA 支持通常最完善 |
功耗与价格 | 相对低 | 高性能显卡价格、功耗都较高 |
对本地 AI 模型部署的影响
1. 能否运行:主要看内存或显存
模型参数需要被加载到内存中。可以粗略理解为:
模型占用 ≈ 参数量 × 每个参数的字节数 + 上下文缓存 + 运行时开销
使用常见的 4-bit 量化时,大致需求为:
模型规模 | 模型文件/基础内存 | 建议可用内存 |
|---|---|---|
7B/8B | 4~6 GB | 8 GB以上 |
14B | 8~10 GB | 12~16 GB |
32B | 18~22 GB | 24 GB以上 |
70B | 40~48 GB | 48~64 GB以上 |
实际占用还受模型架构、量化格式、上下文长度和并发数量影响。上下文越长,KV Cache 占用越大。
如果显存不够,可以:
把部分模型放到系统内存,由 CPU 计算。
一部分层放 GPU、一部分层放 CPU,即 GPU offload。
使用更低精度量化,例如 8-bit、6-bit、4-bit。
缩短上下文长度或降低并发。
换更小的模型。
但显存溢出到系统内存后,速度通常会明显下降。
2. 运行速度:GPU 通常优势明显
大语言模型推理主要包含两个阶段:
提示词处理(prefill):需要大量计算,GPU 并行优势明显。
逐字生成(decode):很依赖内存带宽,GPU 显存带宽通常远高于普通内存。
因此,同一个模型:
纯 CPU:能运行,但速度可能只有每秒几 token,具体取决于模型和内存带宽。
全部放入 GPU:通常会快很多。
CPU + GPU 混合:性能介于两者之间,并受 CPU/GPU 数据传输影响。
3. 显存容量与算力,哪个更重要?
对个人本地大模型推理来说,通常优先级是:
显存或统一内存容量
内存带宽
GPU 算力
CPU 性能
原因很简单:模型装不下,再高的 GPU 算力也发挥不了。比如高算力但只有 8 GB 显存的显卡,往往不如较慢但拥有 24 GB 显存的显卡适合运行大模型。
4. 不同硬件平台
NVIDIA 显卡
CUDA 生态成熟。
兼容 PyTorch、Transformers、vLLM、TensorRT-LLM 等大量工具。
适合推理、微调和训练。
主要限制通常是显存容量和价格。
AMD 显卡
可以通过 ROCm、Vulkan 等方式运行。
部分系统和软件兼容性不如 CUDA,需要确认具体显卡和框架支持。
性价比可能不错,但部署折腾成本可能更高。
Apple Silicon Mac
CPU、GPU 共用统一内存,没有传统意义上的独立显存限制。
例如 32 GB 统一内存可以在系统允许的范围内同时供 CPU 和 GPU 使用。
MLX、llama.cpp、Ollama 等工具体验较好。
内存容量和带宽很重要,适合安静、低功耗的本地推理。
不适合依赖 CUDA 的工作流,大规模训练能力也有限。
只有 CPU
通过 llama.cpp、Ollama 等仍然可以运行量化模型。
适合 3B~8B 小模型、低频使用、后台摘要或隐私场景。
模型越大,生成等待越明显。
多通道高频内存对性能帮助很大。
5. 推理、微调和训练的要求不同
日常聊天/推理:4-bit 量化最实用,显存要求较低。
LoRA/QLoRA 微调:比推理占用更多显存,通常更适合 NVIDIA GPU。
全参数训练:显存、算力和显卡互联要求极高,个人电脑通常不现实。
多人并发服务:除了模型本身,还要为每个请求预留 KV Cache,因此显存需求会继续增加。
实用选择建议
偶尔本地聊天:CPU 或 16 GB 统一内存的 Mac,可运行小型量化模型。
希望响应流畅:优先 GPU,并确保模型能完整进入显存。
运行 7B/8B:建议 8~12 GB 显存。
运行 14B:建议 16 GB左右显存。
运行 32B:建议 24 GB以上显存。
运行 70B:通常需要 48 GB以上显存/统一内存,或多 GPU、CPU 混合。
准备做微调:优先考虑 NVIDIA 及其 CUDA 生态。
一句话总结:CPU 决定系统是否顺畅以及模型的最低运行能力;GPU 决定 AI 推理速度;RAM/VRAM 容量决定能运行多大的模型。
能适应本地模型开发或者部署的电脑最低配置参考?
本地大语言模型(LLM)开发、推理或微调,可以按下面配置参考。关键不是 CPU 型号,而是显存/统一内存容量。
配置档位
使用目标 | 最低配置参考 | 大致适用模型 |
|---|---|---|
学习、接口开发、验证流程 | 6 核 CPU、16GB 内存、512GB NVMe;可无独显 | 1B~3B 量化模型;7B 可纯 CPU 跑,但较慢 |
实用入门 | 8 核 CPU、32GB 内存、NVIDIA 12~16GB 显存、1TB NVMe | 7B/8B 很舒适;14B 4-bit 推理 |
本地开发推荐 | 12 核左右 CPU、64GB 内存、24GB 显存、2TB NVMe | 7B~32B 量化推理;7B/14B QLoRA 微调 |
大模型工作站 | 128GB 内存、48GB 以上总显存、2~4TB NVMe | 32B 高精度、70B 4-bit 推理及多并发 |
训练基础模型 | 多张专业 GPU/服务器 | 通常不适合普通个人电脑 |
以上是单用户、文本模型、4-bit 量化情况下的经验值。上下文越长、并发越高,额外显存消耗越大。
按模型规模估算显存
模型规模 | 4-bit 推理最低显存/可用内存 | 比较稳妥 |
|---|---|---|
1B~3B | 3~4GB | 6~8GB |
7B/8B | 6~8GB | 10~12GB |
14B | 10~12GB | 16GB |
30B~32B | 20~24GB | 32GB |
70B | 42~48GB | 64~96GB |
实际内存占用包括模型权重、KV Cache、运行框架和系统开销。建议至少保留约 20% 余量。Hugging Face 举例说明,8B 模型以 FP32 加载约需 32GB,而 FP16/BF16 每参数约占 2 字节;4-bit 量化还能进一步降低占用。Hugging Face Transformers
如果现在配一台“最低但能认真干活”的电脑
我会建议:
CPU:现代 8 核以上,支持 AVX2
内存:32GB,最好可升级到 64GB
显卡:NVIDIA 16GB 显存
硬盘:1TB NVMe,最好预留第二个 M.2 插槽
系统:Ubuntu 24.04 LTS,或者 Windows 11 + WSL2
电源:根据显卡选型留足余量
例如当前 RTX 5060 Ti 有 16GB 版本,官方建议整机电源最低约 600W;对本地模型而言,应优先选择 16GB 版本,而不是显存更小但游戏性能略高的卡。NVIDIA 官方规格
如果预算允许,24GB 显存的显卡会明显延长机器寿命,因为它可以容纳32B级4-bit模型。
Mac 怎么选
Apple Silicon 也很适合安静、低功耗的本地推理,llama.cpp对 Apple Silicon、Metal 和 CPU/GPU 混合推理有原生优化。llama.cpp 官方项目
建议:
绝对入门:24GB 统一内存
实用开发:48GB 统一内存
32B模型或长期使用:64GB以上
硬盘:至少512GB,推荐1TB
以 Mac mini M4 Pro 为例,官方配置可选48GB或64GB统一内存,内存带宽为273GB/s。Apple 技术规格
需要注意:Mac 很适合 Ollama、MLX、llama.cpp 推理,但如果重点是 PyTorch/CUDA微调、训练和复现研究项目,NVIDIA + Linux 的兼容性通常更好。
微调配置
微调和推理不是一个量级:
7B/8B QLoRA:建议16GB显存起,24GB更从容
14B QLoRA:建议24GB显存
32B QLoRA:通常需要48GB左右或激进的内存优化
全参数微调:个人显卡通常不现实
在极限设置下,4-bit双重量化甚至能让13B模型在16GB T4上进行微调,但需要短上下文、batch size 1和梯度累积,不能视为舒适配置。Hugging Face量化文档
一句话结论:仅学习可从“16GB内存、无独显”开始;准备长期做本地模型开发,建议直接上“64GB内存+16~24GB NVIDIA显存+2TB SSD”。
