03-vibe-coding-工具生态与模型选择
先看懂格局:工具的分类坐标系
2026 年的 AI 编程工具市场已经从"有没有可用"进入"选哪个才对"的阶段。打开任何一个技术社区,你会看到 Claude Code、Codex、Cursor、Trae、Qoder、Devin、Copilot、Windsurf 等十几个名字轮番出现。这些工具看似都在"用 AI 写代码",但定位、能力边界和适用场景差异巨大。选错工具不只是浪费几十美元订阅费的问题,而是整个开发流程被持续拖慢——用对话式工具去搭后端架构,或用补全型工具去跑全自动任务,都会让人陷入"AI 似乎在帮忙,却总差一口气"的泥潭。
要在工具丛林中找到方向,需要两个分类坐标系:一个是交互模式,回答"你用什么方式和 AI 协作";一个是能力层级,回答"AI 能替你干到什么程度"。两个维度交叉,才能精确锁定每个工具的真实定位,也才能理解为什么社区里"双工具流"会成为共识而非偶然。
按交互模式分四类
当前主流 AI 编程工具,按人和 AI 的协作方式可以归纳为四大类。下表基于各工具 2026 年 5 月的公开形态整理,具体功能入口会随版本迭代变化,正式选用前以官网为准。
| 类型 | 代表工具 | 核心特征 | 适合场景 | 形象比喻 |
|---|---|---|---|---|
| Agent 工具(终端/桌面) | Claude Code、Codex | 能读写文件、运行命令、自主推进任务 | 后端开发、全栈项目、自动化 | 随叫随到的远程程序员 |
| IDE 集成型 | Cursor、Copilot、Trae、Windsurf | 嵌入编辑器,实时辅助 | 日常编码、代码补全 | 坐在你旁边的搭档 |
| 平台型 Agent | Qoder、Devin、Bolt.new | Web/桌面平台,多 Agent 协同 | 复杂项目管理 | 一个 AI 开发团队 |
| 对话式 | ChatGPT、Claude.ai | 对话界面,问答式生成 | 学习、问题解答 | 编程百科全书 |
四类的本质差异在于"主动权在谁手里"。对话式工具里主动权始终在人——你问一句、AI 答一句、对话结束;Agent 工具把主动权交给 AI——你给一个目标,它自己拆步骤、调工具、看结果、决定下一步,循环到完成。IDE 集成型介于两者之间,人主导编辑,AI 实时补全和提示。平台型 Agent 则更进一步,内部用多个 Agent 分工协作,人只看最终交付。
理解了这个差异,就能解释一个常见困惑:为什么有人觉得"AI 编程不过如此",有人却觉得"AI 编程彻底改变了工作方式"。答案往往是前者用对话式工具(L2 层级),后者用了 Agent 工具(L3 层级)——工具的交互模式直接决定了能力天花板。
逐类细看,差异更加清晰。Agent 工具的核心壁垒在于"工具调用权限"——它能通过命令行读写文件、执行脚本、安装依赖,这意味着 AI 不再只是"出主意"的人,而是"动手干活"的人。Claude Code 和 Codex 都属于这一类,区别在于开源策略和安全模型。IDE 集成型的优势是"零迁移成本"——开发者不需要切换到陌生环境,AI 能力直接嵌在熟悉的编辑器里。Cursor 基于 VS Code 改造,原有扩展和快捷键几乎全部保留,迁移门槛极低;Trae 和 CodeBuddy 则主打国内直连和中文优化,适合不想折腾网络配置的开发者。平台型 Agent 适合复杂项目的团队协作场景,多个 Agent 分工处理编码、测试、审查,人只参与需求定义和最终验收,但这类工具对需求描述的精度要求更高,需求不清时多 Agent 协同反而放大混乱。对话式工具最适合学习和答疑——查 API 用法、理解报错含义、学习新框架概念,它的即时性和低门槛无可替代,但拿它做项目级开发就像用字典写小说,效率极低。
按能力层级分 L1 到 L5
交互模式只回答"怎么协作",能力层级才回答"AI 到底能替你做到哪一步"。业界把 AI 编程能力归纳为五个层级,从低到高依次递进。
| 层级 | 名称 | 能力描述 | 代表工具 | 人的角色 |
|---|---|---|---|---|
| L1 | 代码补全 | 行级/函数级联想 | Copilot、TabNine | 亲自写每一行,AI 补全细节 |
| L2 | 代码生成 | 生成完整代码块 | ChatGPT、Claude.ai | 亲自搬运代码到项目 |
| L3 | 任务执行 | 自主改文件、运行命令 | Claude Code、Cursor Agent | 审核方案、监督执行 |
| L4 | 多 Agent 协同 | 任务分解、多角色协作 | Qoder | 拆需求、验收交付 |
| L5 | 自主工程 | 端到端自主完成项目 | 探索中 | 定义目标、最终验收 |
L5 自主工程 ─── 端到端自主完成项目(探索中)
↑
L4 多Agent协同 ─── 任务分解、多角色协作(Qoder)
↑
L3 任务执行 ─── 自主修改文件、运行命令(Claude Code、Cursor Agent)
↑
L2 代码生成 ─── 生成完整代码块(ChatGPT、Claude.ai)
↑
L1 代码补全 ─── 行级/函数级补全(Copilot、TabNine)
层级之间不是简单的"高一级就更好",而是每跨一级,AI 的自主性和人的介入方式都发生质变。L1 的 Copilot 像一个高级输入法联想,你打 func 它补全 function,但你得逐行确认、逐行敲下;L2 的 ChatGPT 能生成整段函数,但代码得你手动复制粘贴回项目,跑不通还得自己调试;L3 的 Claude Code 拿到"加一个软删除字段"的指令后,会自己改数据库 Schema、改模型定义、改 API、跑迁移命令、报告结果——人从"写代码的人"变成"审核方案、监督执行的人"。
Vibe Coding 真正成立需要 L3 以上
一个关键判断:Vibe Coding(凭感觉驱动编程)真正成立,需要 L3 以上能力。原因在于 L1 和 L2 的工具无法消除"代码搬运"这个环节——你问 ChatGPT 要一段登录逻辑,它生成得很好,但你得自己粘贴到项目里、自己调整导入、自己修运行时报错。这个过程里你并没有"忘记代码存在",你时刻都在和代码细节打交道。
只有 L3 的 Agent 能真正"动手"——它直接在你的项目里改文件、跑命令、看报错、自我纠错。这时你才有资格说"我只要描述想要什么效果,代码交给 AI"。这也是为什么本系列把 Claude Code(L3)作为核心工具——它是目前日常开发中实用性和成熟度最高的层级。L4 的多 Agent 协同更适合复杂项目但学习成本更高,L5 的端到端自主工程仍处于探索阶段,两者都不能作为日常开发的稳定依赖。
能力层级还隐含一条选型铁律:不要用低层级工具干高层级的活。用 L2 的对话式工具去搭一个完整后端,意味着你要在浏览器和编辑器之间反复搬运代码、手动调试每一处报错,效率远不如直接开一个 L3 的 Agent 让它自主推进。反过来说,简单的代码补全也没必要动用 L3 Agent——杀鸡用牛刀只会增加成本和等待时间。匹配任务复杂度与工具层级,是工具选型的第一原则。
两个维度的交叉理解
交互模式和能力层级不是相互独立的两个标签,而是可以交叉组合的矩阵。同一个交互模式下,不同工具可能处于不同层级。比如 IDE 集成型里,Copilot 早期只做 L1 补全,Cursor 已经进化到 L3 的 Agent 模式(Cursor Agent 能自主改文件和跑命令),Trae 也在向 L3 靠拢。这说明交互模式是"壳",能力层级是"核"——选工具不能只看它是 IDE 还是 CLI,更要看它的 Agent 能力到了哪一层。
交叉理解还能帮你识别"伪 Agent"。有些工具打着 Agent 旗号,实际还停留在 L2——它能生成代码片段,但不能自主执行、不会自我纠错、无法跨文件连贯修改。判断方法很简单:给它一个需要修改三个文件并跑通测试的任务,如果 AI 只能生成代码让你手动粘贴,它就是 L2;如果 AI 自己改完三个文件、跑了测试、根据报错自我修正,它才是 L3。2026 年的工具市场,L3 是实用门槛,L4 是竞争前沿,L5 仍是探索方向。
三大主流工具深度横评
工具格局里,真正占据开发者日常的是三款工具:Claude Code、Codex 和 Cursor。它们分别代表了 Agent 工具、开源 Agent 和 AI 原生 IDE 三个方向,也是 2026 年社区讨论最密集的三款产品。下面逐一拆解它们的核心机制、定位隐喻,以及各自适合什么场景的深层原因。
Claude Code:全自主执行的 CLI Agent
Claude Code 是 Anthropic 公司推出的 AI 编程智能体,经典入口是终端 CLI,现已扩展到 IDE、桌面客户端和 Web 形态。它能够读取项目代码、修改文件、运行命令、安装依赖——你用自然语言告诉它做什么,它自己动手干活。
用一个交通工具类比来理解它的定位:ChatGPT 和 Claude.ai 像公交车,你问路它告诉你怎么走,但你得自己走;Cursor 像共享单车,你骑着它走它帮你加速;Claude Code 像出租车,你说目的地它自己开到。这个类比点出了 Agent 与聊天机器人的本质区别——Agent 拥有"手",能在你授权后直接触碰项目文件和开发工具。
Claude Code 的核心特征可以概括为五点。多入口使用,支持终端、IDE、桌面和 Web,终端仍是开发者最常用形态。全自主执行,能自己读文件、写文件、运行命令。项目级理解,借助 Agentic Search(智能体式检索)机制,它会像人类工程师冷启动项目一样现场浏览目录、读关键文件、用 grep 搜索、跟引用关系,而不是依赖预建索引。200K 到 1M 上下文窗口(具体上限取决于模型),一次能"记住"大量项目背景。权限确认机制,执行危险操作前会先征求你同意。
Agentic Search 是 Claude Code 区别于传统 RAG(Retrieval-Augmented Generation,检索增强生成)工具的关键机制。传统 RAG 需要预先把代码库嵌入为向量、建立索引,查询时按相似度拼凑结果;代码一变动索引就过期,可能返回已删除或重命名的代码。Claude Code 不需要任何预建索引,它现场读文件、grep 搜索、追引用——这意味着它天生适合活跃开发中的项目,代码改了立刻生效,也不需要 IT 部门部署向量数据库。代价是被读取进上下文的代码片段仍会发送给模型服务,处理敏感代码时需遵守企业安全规范。
Codex:开源的 CLI Agent
Codex 是 OpenAI 推出的 AI 编程 Agent,是 Claude Code 最主要的竞争对手。其中 Codex CLI 是开源项目(Apache 2.0 许可证),而 Codex Desktop 和 IDE 插件更偏产品化入口。
Codex 的定位可以类比为"带教练的驾驶课"。它同样能自主执行,但通过 sandbox(沙箱,一种隔离执行环境)加 approval(审批)的安全模型,把每一步操作的风险控制做得比 Claude Code 更显式。你可以在三档自主级别间切换:suggest 档每次操作都问你确认,auto-edit 档自动编辑文件但命令执行仍需确认,full-auto 档完全自主。这就像驾校教练车有副刹车,学员(AI)可以放手开,教练(你)随时能踩停。
Codex 的核心亮点集中在六个方面。CLI 开源透明,可以阅读源码理解工具原理,对安全敏感团队意味着可审计。沙箱与审批机制,通过 sandbox 和 approval mode 控制文件修改和命令执行风险。AGENTS.md 项目说明文件,这是一种开放标准,用于记录项目规则和上下文,与 Claude Code 的 CLAUDE.md(专用标准)互不干扰,可在同一项目中共存。多模型提供商支持,原生支持 GPT 系列,也可接入 DeepSeek、Ollama、Mistral 等任何兼容 OpenAI API 的服务。三档自主级别,灵活控制自动化程度。推理强度可控,low/medium/high 三档,根据任务复杂度平衡速度与质量。
| 维度 | Codex | Claude Code |
|---|---|---|
| 开源 | CLI 开源(Apache 2.0) | 否(闭源) |
| 安全模型 | sandbox + approval mode | 权限规则与模式配置 |
| 指令文件 | AGENTS.md(开放标准) | CLAUDE.md(专用) |
| 配置文件格式 | TOML | JSON |
| 模型生态 | GPT 系列 + 任意 OpenAI 兼容 | Claude 系列 + Anthropic 兼容接口 |
| 国内 Coding Plan | 需自行配置中转 | 国内厂商原生支持 |
Codex 的 sandbox 加 approval 安全模型值得单独展开。sandbox 是一种隔离执行环境——AI 运行的命令被限制在一个受控沙箱里,对文件系统的写入、网络访问、进程创建都受约束,即使 AI 误执行了危险命令,影响范围也被限制在沙箱内。approval 机制则在沙箱之上加了一层"人确认"环节:关键操作执行前,Codex 会暂停并把操作内容展示给你,你批准后才继续。三档自主级别正是对"人确认频率"的调节——suggest 档每步都问,auto-edit 档文件编辑放行但命令仍问,full-auto 档基本放行。这种"分级放权"的设计让开发者能根据任务信任度和风险承受度灵活调整,新手从最保守的 suggest 档起步,熟悉后逐步放权。
AGENTS.md 作为开放标准,其价值在于跨工具复用。团队用 AGENTS.md 写好一份项目规范后,无论是 Codex 还是其他支持该标准的工具都能读取,不必为每个工具重复维护配置。与 Claude Code 专用的 CLAUDE.md 相比,AGENTS.md 更像一个"行业公约",适合需要多工具协作或不想被单一工具锁定的团队。两者在同一项目中共存时互不干扰,各自被对应工具读取。
Cursor:AI 原生 IDE
如果说 Claude Code 是命令行中的远程程序员,Cursor 就是坐在你旁边、和你共用一个屏幕的编程搭档。Cursor 是一个基于 VS Code 改造的 AI 原生 IDE(Integrated Development Environment,集成开发环境),把 AI 能力直接嵌入代码编辑器。
Cursor 的定位类比为"坐在你旁边的搭档"。它不接管整个任务,而是在你写代码的每个瞬间提供实时辅助。Tab 补全是它最核心的体验,延迟控制在 200 毫秒以内(2026-05 核对,以官网为准),让补全感觉像肌肉记忆而非等待。它还支持实时可视化编辑——选中一段代码用自然语言描述要改什么,直接在编辑器里看到 diff 预览再决定接受。
| 维度 | Claude Code | Cursor |
|---|---|---|
| 界面 | 终端命令行 | 图形化编辑器 |
| 交互方式 | 纯文字对话 | 鼠标+键盘+对话 |
| 核心优势 | 全自主执行、项目级理解 | 实时补全、可视化编辑 |
| 适合场景 | 后端开发、全栈架构 | 前端开发、日常编码 |
| 学习曲线 | 需要熟悉终端 | 和 VS Code 几乎一样 |
Tab 补全能做到 200 毫秒以内的延迟,背后是一套"预测性补全"的工程优化。传统补全工具等你停下来才开始生成建议,Cursor 的做法是在你打字的同时就预测下一个可能的修改位置并预生成补全内容,等你停顿时建议已经准备好,按 Tab 即时接受。这种"预测先行"的设计把 AI 推理的延迟藏在了你打字的时间里,让补全体验接近"零等待"。代价是会有一些预测落空时消耗的算力,但对使用者而言,只要延迟感消失了,体验就是顺畅的。
Cursor 的另一个杀手锏是 Composer 模式——它能同时编辑多个文件,在一份 diff 里展示跨文件的协同改动。这让前端开发中"改一个组件要同步改样式、改路由、改类型定义"的场景变得自然:你描述一次意图,Composer 在多个文件里生成配套修改,你统一审核接受。这种多文件编辑能力让 Cursor 从单纯的补全工具向 Agent 方向靠拢,但它的交互模式仍以编辑器内操作为主,不像 Claude Code 那样以终端命令和自主循环为核心。
为什么 Claude 适合后端、Cursor 适合前端
社区里流传着一个"双工具流"最佳实践:Claude Code 做后端、架构和数据库,Cursor 做前端和 UI 细节。这并非随意搭配,背后有深层的技术原因。
后端开发的核心挑战是跨文件的逻辑连贯性——改一个数据库 Schema 要同步改模型定义、API 路由、迁移脚本和测试用例,这些文件分散在项目各处。Claude Code 的 Agentic Search 能自主追踪这些引用关系,在一个任务里连贯修改多个文件并运行验证命令,这种"项目级理解加全自主执行"恰好匹配后端场景。架构设计更需要 AI 理解全局结构,1M 上下文窗口让它能同时"看到"足够多的代码。
前端开发的核心挑战则不同——它更多是像素级精调和即时视觉反馈。设计师给一张稿,你要把按钮间距从 16px 调到 12px、把阴影从 2px 模糊改成 4px、把主色调微调一个色阶。这类任务单次改动很小,但需要高频迭代和实时预览。Cursor 的 Tab 补全让每敲一个字符都有联想,可视化编辑让你选中元素直接描述改动,diff 预览让你改之前就能看到效果。这种"人在编辑器里主导、AI 实时贴身辅助"的模式,与前端的高频微调工作流天然契合。
理解了这个深层原因,就能解释为什么"双工具流"比单工具更高效:不是工具功能有重叠,而是两类任务的工作模式根本不同——后端要跨文件连贯,前端要单文件高频迭代,没有一款工具能同时在两种模式上都做到最优。
三工具核心对比表
| 维度 | Claude Code | Codex CLI | Cursor |
|---|---|---|---|
| 类型 | CLI Agent | CLI Agent | AI IDE |
| 开源 | 否 | 是(Apache 2.0) | 否 |
| 自主性 | 极高 | 高 | 中 |
| 上下文窗口 | 200K~1M | 取决于所选 GPT 模型 | 大 |
| 安全模型 | 权限规则 | sandbox + approval | IDE 内置 |
| 国内直连 | 需配置 | 需配置 | 需配置 |
| 学习曲线 | 中 | 中 | 低 |
| 适合场景 | 后端/全栈/架构 | 开源/GPT 生态/安全敏感 | 前端/日常编码 |
三款工具的安装与首次使用
Claude Code 安装与首次启动
前提条件是已安装 Node.js(v18+)。通过 npm 全局安装:
npm install -g @anthropic-ai/claude-code
国内用户若官方源下载慢,可先切镜像再安装:
npm config set registry https://registry.npmmirror.com
npm install -g @anthropic-ai/claude-code
验证安装:
claude --version
预期输出:
claude-code v1.x.x
配置 API Key 后首次启动。进入项目目录运行 claude:
cd D:\ai-coding-projects
claude
预期输出:
╭──────────────────────────────────────────╮
│ │
│ Welcome to Claude Code! │
│ │
│ /help for available commands │
│ │
╰──────────────────────────────────────────╯
>
光标等待输入,输入第一条消息验证连通性:
> 你好,请介绍一下你自己
正常回复说明 API 配置成功。用 /cost 可实时查看当前会话的 Token 消耗与费用,用 /init 可让 AI 自动扫描项目生成 CLAUDE.md 初稿。
Codex CLI 安装与首次启动
Codex CLI 同样通过 npm 安装:
npm install -g @openai/codex
验证安装:
codex --version
预期输出:
codex v1.x.x
Codex CLI 使用本地 ~/.codex/ 配置目录。首次运行会引导你登录 OpenAI 账号或配置 API Key。进入项目目录启动:
cd ~/my-project
codex
首次交互可在三档自主级别间选择。建议新手从 suggest 档开始(每次操作确认),熟悉后切到 auto-edit,复杂任务才用 full-auto。Codex 通过 AGENTS.md 文件记录项目规则,格式与 Claude Code 的 CLAUDE.md 不同但可共存于同一项目。
Cursor 安装与首次使用
Cursor 不需要命令行安装,直接访问官网下载对应操作系统的安装包。Windows 运行 .exe 安装器,macOS 拖入 Applications 文件夹,Linux 下载 .AppImage 或 .deb。
首次打开 Cursor,它会提示导入 VS Code 的扩展和设置(因为基于 VS Code 改造,扩展大多兼容)。配置模型和 API Key 后即可开始使用。核心体验是 Tab 补全——在编辑器里正常写代码,AI 会在你停顿时用灰色文字提示补全,按 Tab 接受。选中代码按 Cmd+K(macOS)或 Ctrl+K(Windows)呼出对话框,用自然语言描述要改什么,Cursor 会显示 diff 预览。
Harness 七层框架:决定工具上限的不是模型
很多人以为 AI 编程效果好不好,完全取决于背后的大模型够不够强。这个直觉只对了一半。Anthropic 官方反复强调一个论断:模型能力决定下限,围绕模型搭建的脚手架 Harness 决定上限。实际生产中,同样的模型,配不配 Harness、Harness 搭得好不好,最终表现可以差出几个量级。
理解方式是这样的:模型本身是地板,你站在地板上能拿到基础能力;而项目上下文、工具权限、规则文件和工作流这些"脚手架"一层层往上叠,每叠一层你就站得更高一点。一个配好七层 Harness 的 Agent,表现会显著超过一个裸跑的模型。
七层架构总览
Harness 的七层扩展点从底到顶依次叠加,下三层是"纪律",上四层是"武器"。
下三层(CLAUDE.md、Hooks、Skills)解决"纪律"问题——给 AI 立规矩、灌上下文、备知识,让它每次开工都知道项目背景和操作边界。上四层(Plugins、LSP、MCP、Subagents)解决"武器"问题——给 AI 装上能分发、能导航、能接外部工具、能分身的扩展能力。官方特别提醒:顺序重要,基础没搭好别急着上 MCP 或 Subagents,先把 CLAUDE.md、Hooks、Skills 三层基本功做扎实。
"纪律先于武器"这条原则有现实依据。不少团队一上来就接 MCP、配 Subagents,但 CLAUDE.md 还是空的、Hooks 没配格式化——结果 AI 接入了外部工具却不知道项目禁区在哪,Subagent 调研回来的结论因为没有规范约束而南辕北辙。底盘没搭好就堆武器,武器反而放大失控。正确做法是先把下三层跑顺:CLAUDE.md 写到 AI 不用问就知道去哪找代码、Hooks 配到每次写文件自动格式化和检查、Skills 备好常用任务的方法论,然后再逐层往上加武器。每加一层,验证一遍整体行为是否符合预期,不急于求成。
第一层:CLAUDE.md
CLAUDE.md 是项目上下文文件,相当于给新来的实习生写的入职手册。它告诉 AI 这个项目的背景、技术栈、编码规范和当前进度。没有它,Claude Code 每次开工都要花时间重新认识项目;有了它,启动即知全貌。
CLAUDE.md 在每次会话自动加载,分三个层级叠加生效:全局级(~/.claude/CLAUDE.md,所有项目都读,放个人习惯和身份)、项目级(项目根目录,仅本项目,放技术栈和规范,可提交 Git 团队共享)、文件夹级(子目录下,仅该子目录,放模块专属约定)。
# 项目:在线书签收藏工具
## 技术栈
- 后端:Node.js + Express + Prisma + PostgreSQL
- 前端:React + TypeScript + Tailwind CSS
## 项目结构
- src/auth/ 认证逻辑
- src/api/ API 路由
- prisma/ 数据库 Schema 和迁移
- src/components/ React 组件
## 编码规范
- 所有 API 返回 { success, data, error } 格式
- 数据库迁移文件不要修改,只用 prisma migrate 生成
- 使用函数式组件 + React Hooks
## 禁区
- 不要修改 prisma/migrations/ 目录
- 不要动 vendor/ 第三方依赖
用 /init 命令可让 AI 自动扫描项目生成初版,然后手工补充三类必补信息:项目目录地图(让 AI 知道去哪找代码)、不要碰的禁区(防止改坏)、团队约定(风格统一)。
第二层:Hooks
Hooks(钩子)是会话生命周期的事件触发器。它在特定时机自动执行,比如会话启动、文件写入、命令执行前后。与 CLAUDE.md 的"静态上下文"不同,Hooks 是"确定性触发"——满足条件必然执行,不依赖 AI 是否记得。
典型用途包括:每次写完文件自动跑 lint(代码检查工具)格式化;每次运行命令前检查是否触发了禁区命令;会话结束时自动生成进度摘要写入文件。Hooks 的价值在于把"最好每次都做但容易忘"的纪律固化为自动行为,减少人为疏漏。
{
"hooks": {
"PostToolUse": [
{
"matcher": "Write|Edit",
"hooks": [
{
"type": "command",
"command": "npx prettier --write $FILE_PATH"
}
]
}
]
}
}
上面这段配置的含义是:每次 AI 写入或编辑文件后,自动用 Prettier 格式化该文件。AI 不需要每次提醒自己格式化,Hook 替它完成。
第三层:Skills
Skills 是按需加载的专业知识包,本质是可复用的任务方法论。与 CLAUDE.md 的"始终加载"不同,Skills 只在任务相关时才被调入上下文,避免占用宝贵的上下文窗口。
一个 Skill 可以是"代码审查"方法论(包含审查清单、常见问题、修复建议模板),也可以是"部署到生产环境"的步骤手册。AI 在接到相关任务时按需加载对应 Skill,用完即释放。这种设计让 AI 在不撑爆上下文的前提下拥有广泛的专业能力。
.claude/skills/
├── code-review.md 代码审查方法论
├── deploy.md 部署步骤手册
└── db-migration.md 数据库迁移规范
第四层:Plugins
Plugins 把 Skills、Hooks 和 MCP 配置打包成一个可分发的整体。装上后始终生效,无需逐项配置。这层的价值在于"复用和分发"——一个团队把最佳实践打包成 Plugin,新成员装上即获得全部配置,不必从零搭建。
第五层:LSP
LSP(Language Server Protocol,语言服务器协议)给 AI 装上 IDE 级别的导航能力——跳到定义、查找引用、重命名符号。没有 LSP 时,AI 只能用 grep 做文本搜索,遇到同名变量在不同作用域会混淆;有了 LSP,AI 能像 IDE 一样精确理解符号的作用域和引用关系,改一个函数名时能找到所有真正的调用点而非同名字符串。
第六层:MCP Servers
MCP(Model Context Protocol,模型上下文协议)Servers 让 AI 接入外部工具和数据源——数据库、Jira(项目追踪工具)、Figma(设计稿)、GitHub PR、Sentry(错误监控)。这层把 AI 的视野从"项目内代码"扩展到"代码之外的真实世界":查 Jira 上的需求详情、读 Figma 设计稿的尺寸标注、查 Sentry 上的线上报错堆栈。AI 不再只靠你转述外部信息,而是能自己去看。
第七层:Subagents
Subagents(子代理)是拥有独立上下文窗口的 Claude 实例。当主 Agent 需要做大量调研(比如"读遍整个 src/ 目录找出所有用了废弃 API 的地方")时,如果自己做会把调研过程塞满主上下文,导致后续任务被噪声淹没。Subagent 的做法是派出一个独立实例去完成调研,只把结论回传给主 Agent,调研过程的细节不污染主上下文。
这层解决的是"上下文保护"问题——主上下文是稀缺资源,能卸载的调研型任务就卸载给子代理,让主 Agent 始终保持清爽聚焦。
模型选型:发动机比车架更重要
工具是车架,模型是发动机。同一台 Claude Code,换不同模型跑,体验可以天差地别。选型时工具和模型必须一起考虑——就像买车不能只看车架不看发动机。下面逐个拆解 2026 年主流模型系列的特点、适用场景和价格区间,所有数据按 2026 年 5 月核对,正式使用前以各厂商官网为准。
Claude 系列:代码质量标杆
Claude 系列由 Anthropic 公司开发,是本系列推荐的主力模型,也是 Claude Code 的原生搭档。
| 模型 | 上下文 | 速度 | 代码能力 | 费用档位 | 定位 |
|---|---|---|---|---|---|
| Claude Haiku 4.5 | 200K | 极快 | 良好 | $ | 轻量任务、批处理 |
| Claude Sonnet 4.6 | 1M | 快 | 优秀 | $$ | 日常开发主力 |
| Claude Opus 4.7 | 1M | 中等 | 顶级 | $$$ | 复杂规划、架构 |
Claude 系列的核心优势在于四点。超长上下文(200K 到 1M,1M 大约相当于一个中小型项目的全部代码),项目级代码理解能力强。代码生成质量业界领先,Claude Opus 4.7 在 SWE-bench(软件工程基准测试)上取得 80.9% 的通过率(2026-05 核对,以官网为准)。指令遵循精确——你说什么它做什么,不像某些模型爱自作主张。安全对齐好,不容易生成危险代码。
三档模型对应不同场景:Haiku 处理补全、格式化、简单修改等轻量任务,速度极快成本极低;Sonnet 是日常开发主力,性价比最高,绝大多数功能实现和 Bug 修复用它就够;Opus 留给复杂架构设计、疑难 Bug 和需要深度推理的场景,能力最强但成本也最高。
三档之间的切换不是手动选模型那么简单,而是 Claude Code 内部根据任务复杂度自动路由。你发一条"帮我格式化这个文件"的指令,Claude Code 判断为轻量任务,自动调用 Haiku 槽位,消耗极低;你发"重构整个认证模块,从 session 迁移到 JWT,保证向后兼容",它判断为复杂任务,调用 Opus 槽位,消耗高但质量有保障。这种自动分层机制是 Claude Code 相比其他工具的核心优势之一——你不需要每次手动选模型,系统帮你做成本与质量的平衡。第三方模型接入时能否支持这种自动路由,就成了衡量兼容性好坏的关键指标。智谱 GLM 之所以被称为"国内最省心",正是因为它的三个模型能分别映射到三个槽位,保留自动路由能力;而只提供单一端点的模型服务,无论任务大小都用同一个模型,轻量任务也按高档计费,成本差异在月度账单上会非常明显。
按量计费价格(2026-05 核对,以 Anthropic 官方价格页为准):
| 模型 | 输入费用 | 输出费用 |
|---|---|---|
| Claude Haiku 4.5 | $1 / 百万 Token | $5 / 百万 Token |
| Claude Sonnet 4.6 | $3 / 百万 Token | $15 / 百万 Token |
| Claude Opus 4.7 | $5 / 百万 Token | $25 / 百万 Token |
GPT 系列:多模态强项
GPT 系列由 OpenAI 开发,是 Codex 的原生模型。
| 模型 | 定位 | 适用场景 |
|---|---|---|
| GPT-5.5 | 最新旗舰 | 复杂开发、架构设计、疑难调试 |
| GPT-5.x mini/nano | 轻量模型 | 简单任务、批量处理 |
| o 系列推理模型 | 深度推理 | 算法题、复杂约束问题 |
GPT 系列的核心优势是多模态能力强——把 UI 截图转成代码、理解设计稿的视觉布局,这类需要"看图"的任务 GPT 表现突出。工具调用生态成熟,和 Codex、ChatGPT、OpenAI API 的集成最完整。适合将 UI 截图转换为代码、需要视觉理解的任务,以及深度推理场景。
GLM 系列:国内省心之选
智谱 AI 的 GLM 系列配套 CodeGeeX 代码助手,中文能力和代码能力均衡,国内可用。关键优势在于 Anthropic 兼容接口做得完整——Claude Code 内部有 Opus、Sonnet、Haiku 三个模型槽位,GLM 可以自动映射到这三个槽位,免去手动配置的麻烦。
| 模型 | 特点 | 在 Claude Code 中的角色 |
|---|---|---|
| GLM-4.7 | 默认主力,代码与推理均衡 | 默认占用 Opus/Sonnet 槽位 |
| GLM-4.5-Air | 轻量高速 | 默认占用 Haiku 槽位 |
| GLM-5.1 | 高阶推理,能力更强 | 需手动覆盖三槽位才启用 |
GLM 系列适合国内开发者——注册简单、国内直连、无需国际支付。智谱提供固定套餐的 Coding Plan,套餐价格和额度以智谱官网为准。高峰期 GLM-5.1 会按 3 倍消耗计费,使用前需留意。
DeepSeek 系列:极致性价比
DeepSeek 官方为 Claude Code 提供了专用的 Anthropic 兼容端点,适配度高,是目前性价比最突出的国产选择。
| 模型 | 特点 | 适用场景 |
|---|---|---|
| deepseek-v4-pro[1m] | 官方接入示例主力模型 | 通过兼容端点接入 Claude Code |
| deepseek-v4-flash | 轻量高速 | Haiku/Subagent 等轻量槽位 |
核心优势是价格远低于官方 Claude,代码能力接近 Claude Sonnet 水平,国内直连注册简单。适合动手能力强、追求性价比的学生和个人开发者。模型名会迭代更新,以 DeepSeek 官方文档为准。
DeepSeek 接入 Claude Code 的实操体验值得单独说明。配置完成后,日常使用体感和官方 Claude 几乎一致——Agent 循环、工具调用、文件读写都正常工作,差异主要体现在复杂推理和长上下文理解上。对于"帮我加一个 CRUD 接口"“修复这个报错”"按这个模式重构"这类常规任务,DeepSeek 与 Sonnet 的差距很小,但成本只有后者的几分之一。差距在边界场景才显现:处理超过 50 万 Token 的超大上下文时,DeepSeek 的注意力衰减比 Claude 明显;遇到需要跨多个文件做复杂依赖推理的架构问题时,Claude Opus 的准确率更高。这意味着合理的用法是日常任务用 DeepSeek 省钱,遇到复杂架构或疑难 Bug 时临时切换到 Claude Opus 处理,用完再切回来。这种"日常经济型、关键场景旗舰型"的混合策略,是极客组用户实际摸索出来的最佳实践。
通义千问与 Qwen-Coder
阿里云的通义千问系列,中文理解能力出色,国内直连,与阿里云生态集成紧密。Qwen-Plus 和 Qwen-Max 适合中文项目的日常开发,Qwen3-Coder 系列代码专精,适合纯编程任务和代码生成。适合在阿里云生态中开发的团队。
其他值得关注的选择
| 模型 | 开发者 | 特点 | 场景 |
|---|---|---|---|
| Gemini Pro | 超大上下文、多模态 | 超长代码库分析 | |
| Kimi/Moonshot | 月之暗面 | 长上下文、中文好 | 中文长文档处理 |
| Llama | Meta | 开源旗舰、可本地部署 | 离线/隐私敏感场景 |
| Mistral | Mistral AI | 欧洲开源、代码能力强 | 本地部署替代方案 |
Gemini 的超大上下文适合分析超长代码库;Kimi 的中文长文档处理能力强;Llama 系列可本地部署,适合隐私要求高的企业;Mistral 是欧洲开源选择,代码能力不俗。
模型与工具的兼容性逻辑
理解了各模型系列的特点,还需要理解模型和工具的匹配逻辑。Claude Code 内部设计了一套"三级槽位"机制——它把模型调用分为 Opus、Sonnet、Haiku 三个槽位,分别对应复杂任务、日常任务和轻量任务。使用官方 Claude 模型时,三个槽位自然映射到对应模型;接入第三方模型时,关键就是看这家厂商能否把自家模型映射到这三个槽位。智谱 GLM 能自动映射三个槽位,所以接入体验最省心;DeepSeek 需要手动配置槽位映射但官方文档清晰;其他国产模型如果只支持单一端点,就只能所有任务用同一个模型,无法享受分层省钱的红利。这套兼容性逻辑解释了为什么"不是所有模型都能无缝接入 Claude Code"——工具和模型的适配深度,直接决定了日常使用体验。
Codex 的兼容逻辑类似但走 OpenAI API 标准——任何兼容 OpenAI 接口的服务都能接入,覆盖面更广,但同样面临多模型分层配置的问题。选型时如果看重"开箱即用的多模型分层",GLM Coding Plan 是国内最省心的选择;如果看重"模型选择自由度",DeepSeek 或 OpenRouter 这类聚合服务更灵活。
选型决策树
面对一个具体任务,按以下流程选择模型:
你的任务是什么?
│
├── 简单任务(补全、格式化、小修改)
│ ├── 追求最快速度 → Claude Haiku / GLM-4.5-Air / 本地 Qwen
│ ├── 追求最低成本 → DeepSeek API / 本地 Ollama
│ └── 完全免费 → 本地 Ollama 模型
│
├── 日常开发(功能实现、Bug 修复、代码生成)
│ ├── 英文项目 → Claude Sonnet(首选)
│ ├── 中文项目 → Claude Sonnet 或 通义千问 / GLM-4.7
│ └── 预算紧张 → DeepSeek V4 / GLM / Kimi
│
├── 复杂任务(架构设计、算法难题、疑难 Bug)
│ ├── 深度推理 → Claude Opus / GPT-5.5 / DeepSeek V4 Pro
│ └── 超长代码库 → Gemini Pro(1M 上下文)
│
└── 特殊场景
├── 离线/隐私要求 → 本地 Ollama + Llama/Qwen
├── 截图转代码 → GPT-5.5 系列(多模态)
└── 国内直连要求 → DeepSeek / 千问 / GLM
成本优化与四套组合方案
用好 AI 编程不只是选对模型,更是把成本控制在合理范围。很多人第一次用 Agent 工具,几天就被账单吓到——原因往往是所有任务都用最贵的模型、对话越拉越长不清理、从不看实时消耗。下面四条策略能把月费压到合理区间。
成本优化四策略
第一条是分层使用。不要所有任务都用最贵的模型,就像不是每次出门都需要打专车。简单任务(补全、格式化、小修改)用 Haiku、GLM-4.5-Air 或本地 Qwen,成本只有 $;日常任务(功能实现、Bug 修复)用 Sonnet 或 DeepSeek V4 Pro,成本是 ;只有复杂任务(架构设计、算法难题)才上 O p u s 或 G L M − 5.1 ,成本是 ;只有复杂任务(架构设计、算法难题)才上 Opus 或 GLM-5.1,成本是 ;只有复杂任务(架构设计、算法难题)才上Opus或GLM−5.1,成本是$$。这条策略单独就能省下 30% 到 50% 的费用。
第二条是 Prompt Cache(提示缓存)。Claude 和 GPT 都支持这项机制——如果你发送的上下文中有大量重复内容(比如每次会话都加载同一个 CLAUDE.md),后续请求可以复用缓存,显著降低重复上下文的输入成本。CLAUDE.md 越长、会话越频繁,缓存省下的钱越多,这也从成本角度解释了为什么"写好 CLAUDE.md"不是可选项。
第三条是本地模型补充。对于代码格式化、注释生成、简单重命名等轻任务,用 Ollama 部署的本地模型处理,完全免费,数据也不出本机。这既省钱又解决隐私问题。
第四条是实时监控。用 /cost 命令随时查看当前会话消耗:
> /cost
当前会话费用统计:
输入 Token: 15,234
输出 Token: 8,721
估算费用: $0.18
看到消耗异常就及时切换模型或清理上下文。在 Anthropic Console 后台还可以设置月度预算上限,防止意外超支。
月费预估
| 使用强度 | 推荐模型 | 月费用估算 |
|---|---|---|
| 轻度(每天 1-2 小时) | DeepSeek API / GLM / Kimi | ¥5-30(视模型与套餐) |
| 轻度 | Claude Sonnet | $10-30(约 ¥70-210) |
| 中度(每天 3-5 小时) | Claude Sonnet | $30-80(约 ¥210-560) |
| 重度(全天使用) | Claude Sonnet + Haiku 分层 | $80-200(约 ¥560-1400) |
费用估算基于 2026 年 5 月的模型定价,实际消耗因使用习惯和项目规模而异。
四套组合方案
下面四套方案覆盖了从零成本到追求极致的主要场景,配置步骤以各平台当前文档为准。
性能组:Claude Code + Claude Sonnet/Opus
这是综合体验最好的组合。Claude Code 的 Agent 能力与 Claude 模型的代码理解能力深度适配,两者原生搭档配合最默契。Anthropic 官方 API 按量计费,也可选订阅制 Coding Plan。
适合有国际支付能力、对代码质量要求高的开发者。配置步骤是注册 Anthropic Console、创建 API Key、设置 ANTHROPIC_API_KEY 环境变量、启动 Claude Code。优点是体验最佳、功能最全;缺点是需要国际支付方式,按量付费需留意用量。
免费组:Codex CLI + ChatGPT 账号额度
Codex CLI 可通过 ChatGPT 账号使用,具体额度取决于账号套餐和官方策略。开源透明、沙箱审批机制清晰,适合零成本入门。
适合想低成本体验高质量 AI 编程的新手。配置步骤是安装 Codex CLI、登录 OpenAI 账号、从 suggest 档开始体验。优点是零成本或订阅内使用、安全模型清晰;缺点是不同地区和套餐的可用额度可能变化。
性价比组:Claude Code + GLM Coding Plan
智谱的 Anthropic 兼容接口做得完整,三个模型槽位(Opus/Sonnet/Haiku)自动映射到 GLM 系列,免去手动配置。固定套餐省心,国内直连无需代理。
适合国内大多数开发者,不想折腾配置、追求稳定省心。配置步骤是注册智谱开放平台、开通 Coding Plan、获取 API Key 和端点地址、在 Claude Code 中设置 ANTHROPIC_BASE_URL 和 ANTHROPIC_AUTH_TOKEN。优点是省心稳定、国内直连、中文好;缺点是高峰期可能有限流,GLM-5.1 高峰期按 3 倍消耗计费。
# Windows PowerShell 配置示例
$env:ANTHROPIC_BASE_URL = "https://open.bigmodel.cn/api/anthropic"
$env:ANTHROPIC_AUTH_TOKEN = "你的智谱API-Key"
# macOS / Linux 配置示例
export ANTHROPIC_BASE_URL="https://open.bigmodel.cn/api/anthropic"
export ANTHROPIC_AUTH_TOKEN="你的智谱API-Key"
极客组:Claude Code + DeepSeek API
DeepSeek 官方提供 Claude Code 的 Anthropic 兼容接入方式,主力模型用 deepseek-v4-pro[1m],轻量任务映射到 deepseek-v4-flash。价格通常远低于官方 Claude,代码能力接近 Sonnet 水平。
适合动手能力强、追求极致性价比的学生和个人开发者。配置步骤是注册 DeepSeek 开放平台、创建 API Key、按官方文档设置端点和环境变量、把 Haiku 槽位映射到 flash 模型省钱。优点是极致性价比、国内直连;缺点是需要自己配置端点和槽位映射,模型名会迭代更新需留意官方文档。
# macOS / Linux 配置示例
export ANTHROPIC_BASE_URL="https://api.deepseek.com/anthropic"
export ANTHROPIC_API_KEY="你的DeepSeek-API-Key"
export ANTHROPIC_MODEL="deepseek-v4-pro[1m]"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="deepseek-v4-flash"
四套方案没有绝对优劣,关键看预算、支付能力和动手意愿。新手从性价比组或免费组零风险起步,熟悉工作流后再升级到性能组。工具和模型组合选定后,真正决定日常效率的,是 Harness 七层框架搭得扎不扎实——这正是本系列从工具生态深入到工程实践的核心线索。
更多推荐
所有评论(0)