案例拆解
四个明星产品,三种取舍:Cursor 为什么长在 IDE 里,Claude Code 为什么选了终端,Manus 把过程摊开给你看,Devin 的争议又提醒我们什么。
为什么拆这四个产品
概念学得再多,不如拆几个真实产品。Cursor、Claude Code、Manus、Devin 是过去几年 AI Native 产品里最有代表性的四个样本:它们用的底层模型大同小异,但产品形态天差地别——一个长在 IDE 里,一个住在终端里,一个跑在云端虚拟机上,一个号称要当你的「AI 同事」。
同样的模型,为什么做出了完全不同的东西?因为真正的差异化不在模型,而在三个产品决策上。把这四个产品拆透,比读十篇「Agent 十大趋势」有用得多——你会获得一套可以套用在任何新 AI 产品上的分析框架。
先声明信息边界:以下分析全部基于官方文档、官方博客、公开访谈和公开的社区讨论,不揣测任何内部信息;涉及数字和二手报道的地方,我会标注「据公开资料」或「据公开报道」,定价这类易变信息以官网为准。
分析框架:三个问题
每看一个 AI Native 产品,我只问三个问题:
- 载体选什么——AI 住在哪?IDE、终端、浏览器、还是一台云主机?载体决定了 AI 能看到什么上下文、能用什么工具,也决定了它离用户的工作流有多近。
- 自主性放多大——AI 是只给建议,还是直接动手?动手之前要不要请示?这是一条连续的滑杆,不是非黑即白的开关。
- 信任怎么建立——用户凭什么敢让 AI 动手?靠 diff 审查、权限确认、过程回放,还是靠品牌信仰?
打个比方,这像招一个新人:在哪给他安排工位(载体)、敢放多少权给他(自主性)、怎么验收他的活(信任)。四个产品的全部差异,都能映射到这三个答案上。下面我们逐个拆。
Cursor:把 AI 缝进人的主战场
载体决策:IDE。 程序员的上下文——打开的文件、光标位置、报错信息、整个代码库——全在 IDE 里。AI 想帮人写代码,就得去上下文最富的地方上班,而不是让人把代码复制粘贴到聊天框里。Cursor 干脆 fork 了 VS Code,把 AI 做成编辑器的一等公民,顺带继承了整个 VS Code 插件生态,降低了老用户的迁移成本。
自主性决策:一根完整的滑杆。 Cursor 的产品线几乎就是一张「自主性刻度表」:
- Tab 补全:自主性最低。模型预测你下一步要改哪、改成什么,以灰色幽灵文本呈现,按 Tab 接受、继续打字即拒绝。官方把它描述为「预测你的下一次编辑」——不只是补全当前行,而是跨位置、跨文件的编辑预测。它不打断你,否决成本是零。
- Cmd+K 局部改写:选中一段代码让它改,自主性升一档,改动范围被人为圈定。
- Agent 模式:自主性最高。给它一个任务(「给这个模块补上单元测试」),它自己搜代码、改多个文件、跑命令,连续执行多步。
一个容易被忽视的细节:Tab 和 Agent 背后是两套模型策略。 据 Cursor 团队公开的技术博客,Tab 用的是他们自训的专用小模型——补全场景对延迟极其敏感(几百毫秒内必须出结果,否则打断心流),调用大模型既慢又贵,所以他们自己训练针对「编辑预测」优化的模型,按次计费不心疼。而 Agent 模式是长程推理任务,直接调用 Claude、GPT 这类前沿大模型。按任务形态分配合适的模型,而不是一个大模型包打天下——这是 AI Native 产品成本控制的基本功。
另一个细节:代码库索引。 Agent 要在几万文件的项目里找到相关代码,靠的是预建索引:据官方文档,Cursor 在本地把代码切块、计算向量嵌入,用 Merkle 树做增量同步——只有改动的文件才重新计算和上传,且官方声称上传的是嵌入和元数据而非明文代码(有隐私模式可选)。这套「嵌入索引 + 增量同步」的做法,如今几乎是代码类 AI 产品的标配。
定价与增长(据公开报道)。 Cursor 采取订阅制(免费额度 + Pro 档约 20 美元/月,之上还有更高档位),超出额度按用量计费。它是增长最快的开发者产品之一:据公开报道,其年化收入(ARR)在 2025 年内从约 1 亿美元级别攀升至数亿美元级别,融资估值接近百亿美元。这个数字的意义在于:它证明了「AI 深度嵌入现有工作流」这条路线,用户是真金白银买账的。
信任机制:diff 是核心 UI。 所有改动都以 diff 块呈现,可以逐块接受(Accept)或拒绝(Reject)。Cursor 的信任哲学是:AI 可以动手,但每一处改动都必须经人眼过一遍,而且拒绝要足够便宜。
Claude Code:为什么是终端
很多人第一反应是:都什么年代了还做命令行产品?但站在「模型视角」想,终端是深思熟虑的选择:
- 终端是纯文本界面,而文本正是 LLM 的母语。不需要解析像素、不需要模拟点击,读写文件、跑命令、看报错,输入输出天然是 token。
- 工具现成且可组合。bash、git、grep、测试框架……几十年积累的 Unix 工具链直接变成 Agent 的工具箱,还能用管道自由拼接——这正契合 Unix 哲学:小程序、做一件事、能组合。
- 住在工程师的真实工作流里。git 提交、CI 脚本、远程服务器,终端都能直接触达,不存在「第二个工作区」的割裂感。
CLAUDE.md:把项目规矩变成持久记忆。 Claude Code 启动时会自动加载 CLAUDE.md 文件注入上下文,而且是分层的:用户级(~/.claude/CLAUDE.md,放个人偏好)、项目级(仓库根目录,放项目约定,通常提交进 git 全员共享),还支持用 @路径 语法引入其他文件。这是一个「用文档工程替代微调」的典型设计——不改模型,只喂纪律。
权限模式:自主性的四个档位。 据官方文档,Claude Code 有明确的权限模式:默认模式(写文件、执行命令逐个请求确认)、acceptEdits(自动接受文件编辑,命令仍需确认)、plan mode(只读规划不动手,先出方案再执行)、以及 bypassPermissions(完全放开,官方建议只在隔离容器里用)。再配合允许列表(把 npm test 这类安全命令加白名单),用户可以精确地把滑杆停在自己舒服的位置。
Headless 与 SDK 化:从工具变成平台。 这是 Claude Code 最容易被低估的一步棋。claude -p "你的任务" 这条命令让 Claude Code 以非交互模式运行,支持 JSON 输出,可以直接塞进 CI 流水线、git hook 和脚本里——比如「每次 PR 自动做一轮代码审查」。再进一步,Anthropic 把同一套 Harness 开放为 Claude Agent SDK(TypeScript/Python),让开发者用同样的 Loop、工具和权限系统搭自己的 Agent。同一个 Agent 内核,既是终端工具,又是自动化组件,还是开发平台——载体的复利效应在这里体现得淋漓尽致。
信任机制:git 就是安全网。 终端场景的所有改动天然落在 git 仓库里,git diff 随时可查、git checkout 一键回滚。Claude Code 的信任公式是:先充分读代码再动手 + 危险动作逐个请示 + 全部改动可回滚。
Manus:通用 Agent 的产品化
Cursor 和 Claude Code 都服务程序员,Manus(2025 年 3 月发布,华人团队 Butterfly Effect 出品)想回答一个更大的问题:通用 Agent 怎么做成普通人能用的产品?
载体决策:一人一台云端虚拟机。 每个 Manus 任务跑在一台独立的云主机沙箱里,有自己的文件系统、浏览器和命令行。载体不再是「你的工具」,而是「它自己的电脑」。这个选择有两个直接收益:一是安全隔离(Agent 折腾得再狠也碰不到你的本机),二是天然支持长任务(云主机不随你关浏览器而停止)。
自主性决策:异步任务制。 你像给同事派活一样提交一个任务(「调研一下东南亚的跨境电商市场,出一份报告」),然后就可以关掉页面走人——几小时后回来收结果。这是和 Chatbot 的根本区别:从「对话」变成「委托」。异步意味着任务时长不再有上限,Agent 可以跑几十分钟甚至几小时的多步流程。
信任机制:过程可视化。 这是 Manus 最值得拆的设计——它把 Agent 的操作过程完整摊开:「Manus 的电脑」面板实时展示它正在浏览什么网页、写什么文件、跑什么命令,任务结束后还能回放全过程。为什么这重要?因为通用任务没有 diff 可以审查——你没法像审查代码那样审查一份市场调研。当结果难以验证时,信任的来源从「检查结果」变成「看见过程」。这和现实中的管理一模一样:对看不懂细节的工作,你只能要求下属把过程透明化。
公开访谈与工程博客里的取舍(据公开资料)。 Manus 团队后来发布过一篇被广泛传播的工程博客,总结他们构建 Agent 的教训,几条核心取舍值得记住:
- 围绕 KV-cache 设计上下文:Agent 的上下文每步只增不改(append-only),因为前缀稳定才能命中缓存,否则长任务的成本会爆炸;
- 文件系统就是外存:上下文塞不下的东西写进文件,需要时再读回来,把「记忆」卸载到磁盘;
- 用 todo 清单对抗跑偏:让 Agent 反复把任务清单「复述」进上下文的尾部,防止长程任务中忘记最初目标;
- 少结构、多智能:不要预先用僵化流程框死 Agent,保留模型的自主决策空间,只在其犯错的点上加结构。
这几条几乎可以当作通用 Agent Harness 设计的检查清单。
顺带一提,「回放」在 Manus 这里不只是信任 UI,还是一个低成本的调试资产:团队自己和用户都能拿着失败任务的回放去定位 Agent 在哪一步跑偏,相当于把航空业的黑匣子引入了 Agent 产品。对异步长任务来说,这种可追溯性几乎是一切改进的前提——没有它,你连「任务为什么会失败」都回答不了。
Devin:自治的边界与争议
Devin(Cognition 出品)2024 年 3 月发布时自我定位为「AI 软件工程师」——不是助手,是工程师:给它一个 issue,它自己规划、写码、调试、部署。它把三个问题都推到了极端:载体是一整套独立工作环境(自带编辑器、shell、浏览器);自主性是四者中最高的,目标是端到端交付;信任则几乎完全押在「结果可运行」上。
SWE-bench 成绩的口径,值得掰开看。 发布博客报告 Devin 在 SWE-bench(用真实 GitHub issue 评测 Agent 的公开基准)上端到端解决了 13.86% 的 issue,远超此前最好成绩的 1.96%。但注意两个口径细节:其一,这是在随机抽取的 25% 子集上测的,不是完整测试集;其二,「unassisted」指评测过程中不人工喂答案,但任务本身来自经过筛选的开源仓库。后来 OpenAI 推出了人工校验过的 SWE-bench Verified 子集,各家成绩才逐渐有了更可比的对齐口径。基准分数是重要信号,但先问口径再比较——这是读一切 Agent benchmark 宣传的基本素养。
社区复现争议的时间线(据公开资料)。 2024 年 3 月发布后反响热烈;4 月,YouTube 频道 Internet of Bugs 发布了一条逐帧拆解视频,分析 Devin 官方演示中的一个 Upwork 接单任务,指出:任务需求其实是演示者自己简化生成的、Devin 修的是自己写出来的 bug、实际耗时远超宣传的人类对照。此后一年多里,陆续有试用者公开反馈真实任务的成功率和耗时与演示存在差距。这里给正反两方:
- 批评方:演示存在选择性呈现,「AI 软件工程师」的叙事跑在了能力前面;自治意味着失败也端对端——一次翻车抵掉十次成功。
- 辩护方:抛开营销话术,Devin 确实率先验证了「Agent 端到端完成软件任务」的可能性边界,而且在持续迭代——据公开报道,它后来以按任务计量(ACU)的方式正式商用,并拿到了一些企业级部署案例;基准分数也随版本稳步提升。
我的看法:Devin 的价值不在于它成功或失败,而在于它用真金白银试出了自治性的当前边界。现阶段「AI 工程师」更现实的形态是「强自主 + 关键节点请示」,而不是「完全不管」。
放在一起看
| 产品 | 载体 | 自主性 | 信任机制 | 计费模式 | 更适合谁 |
|---|---|---|---|---|---|
| Cursor | IDE(VS Code fork) | 滑杆:Tab → Cmd+K → Agent | diff 逐块审查 | 订阅制 + 超量按用量(约 $20/月起) | 日常写码的个人开发者与团队 |
| Claude Code | 终端 + CI + SDK | 权限模式四档 + 允许列表 | 逐次确认 + git 回滚 | 订阅(Pro/Max)或 API 按 token | 工程师、自动化流水线 |
| Manus | 每任务一台云端虚拟机 | 高:异步委托整个任务 | 过程直播 + 全程回放 | 订阅 + 积分(credits)计量 | 非技术知识工作者 |
| Devin | 独立工作环境(编辑器/shell/浏览器) | 最高:端到端交付 | 押注结果可运行(受争议) | 按任务计量(ACU,据公开资料) | 愿意试水的工程团队 |
(计费信息据各官网公开资料,此类价格变动频繁,以官网实时信息为准。)
一条清晰的规律浮现出来:自主性每升一档,信任机制就必须跟着换一种形态。补全级别靠「拒绝免费」,改动级别靠「diff 审查」,任务级别靠「过程透明」,自治级别……目前还没有公认答案,这正是 Devin 争议的根源。
工程实践要点
如果你在设计自己的 Agent 产品(或给团队引入这些工具),这几条是四个案例共同验证过的:
1. 自主性要和可验证性匹配。 结果越容易被机器验证(测试通过、编译成功),自主性就可以放得越大;结果越依赖人判断(报告质量、设计好坏),就越要把自主性收回来或加强过程透明。用一个简单的审批策略表达:
type Risk = "read-only" | "reversible" | "destructive";
function needsApproval(action: { risk: Risk; verified: boolean }): boolean {
if (action.risk === "read-only") return false; // 读操作直接放行
if (action.risk === "reversible" && action.verified) return false; // 可回滚且机器验证过
return true; // 其余一律请示
}
Cursor 的 Tab(read-only 级,零审批)和对生产环境的操作(destructive 级,必审批)之间,隔着的就是这张表。
2. 上下文比模型更值得投入。 四个产品都在上下文工程上花了大力气:Cursor 的嵌入索引、Claude Code 的 CLAUDE.md、Manus 的「文件系统即外存」。同一模型,喂给它的上下文质量不同,表现判若两人。
3. 按任务形态分配模型。 低延迟高频场景(补全)用自训小模型,长程推理场景(Agent)用前沿大模型。成本和体验同时受益。
4. 信任 UI 是产品的一部分,不是附属品。 diff 视图、权限弹窗、过程回放,这些不是「锦上添花的安全提示」,而是用户敢不敢用的决定性因素。预算里要给它留位置。
常见误区
- 把 demo 当能力:单点演示证明的是「上限存在」,不是「下限可靠」。评估任何 Agent 产品,先看它失败时什么样。
- 自主性越高越好:自主性是有成本的——每升一档,验证成本和翻车成本都指数上升。合适的档位取决于任务的可验证性,不是越高越先进。
- 只比模型,不比载体和 Harness:四个产品证明,同一个模型在不同载体里的能力差,可能大于不同模型在同一载体里的能力差。
- 看 benchmark 不看口径:子集比例、是否 unassisted、用什么脚手架,口径不同分数没有可比性。
- 忽视信任设计:很多团队把精力全花在「让 Agent 做对」,却忘了「让用户敢用」。后者往往才是瓶颈。
术语表
| 名词 | 定义 | 一句话直觉 | 常见混淆 |
|---|---|---|---|
| 载体(Form Factor) | AI 栖身并作用于世界的界面形态,如 IDE、终端、云虚拟机 | AI 在哪上班 | 不等于「模型部署位置」,载体是产品概念不是基础设施概念 |
| 自主性滑杆 | 从「只建议」到「完全动手」的连续自主性刻度 | 放权不是开关,是旋钮 | 自主性 ≠ 能力:同一个模型可以放在不同档位上 |
| Tab 补全(编辑预测) | 预测用户下一次编辑并以幽灵文本呈现,按键接受 | 猜你下一步改哪 | 与 Agent 模式混淆:前者零风险秒级响应,后者多步执行可改多文件 |
| diff 审查 | 把所有 AI 改动以差异块呈现,逐块接受或拒绝 | 改可以,先给我看改了啥 | 不是事后 code review,是执行过程中的即时关卡 |
| CLAUDE.md | Claude Code 自动加载的项目说明书文件,注入上下文 | 写在仓库里的项目规矩 | 不是微调也不是系统提示词,是会话级的持久上下文 |
| 权限模式 | Claude Code 对写文件/执行命令的四档确认策略 | 每档对应不同的请示频率 | 与「允许列表」混淆:模式是总开关,白名单是逐项豁免 |
| Headless 模式 | 以非交互方式运行 Agent(如 claude -p),供脚本和 CI 调用 | 把人从回路里临时拿掉 | 不是「无头浏览器」,指无人工交互的批处理运行 |
| 代码库索引 | 对代码切块算嵌入向量并增量同步,供语义检索 | 给代码库建一张可搜索的地图 | 不等于全文搜索(grep):索引理解语义,grep 只匹配字符 |
| 异步委托 | 提交任务后离开,Agent 在云端独立完成再交付结果 | 派活给同事而不是盯着他干活 | 与「后台任务」混淆:异步委托包含完整的自主执行与交付 |
| 过程回放 | 完整记录并回放 Agent 的操作过程供人检查 | 看不见结果的价值,就看见过程的诚意 | 不是日志:回放是给人看的产品 UI,日志是给机器的排查材料 |
| SWE-bench | 用真实 GitHub issue 评测软件工程 Agent 的公开基准 | Agent 界的公开考卷 | 分数必须带口径(子集、是否 unassisted),裸分数不可比 |
| 自治(Autonomous) | Agent 端到端完成任务,中途不请示 | 放手让它跑完全程 | 与「自动(Automated)」混淆:自动是固定脚本照做,自治是模型自己决策路径 |
| ACU | Devin 的任务计量单位,按消耗计费 | 按工作量付工资的「AI 工时」 | 不是 token 计费:ACU 试图对齐「完成一件事」而非「烧了多少算力」 |
参考材料
- Cursor 官方文档 — Tab 补全、Agent 模式与代码库索引的官方说明
- Claude Code 最佳实践 — Anthropic 官方总结的终端 Agent 用法与权限设计
- Claude Code 官方文档 — CLAUDE.md、权限模式、headless 用法的完整定义
- Claude Agent SDK 文档 — 把 Claude Code 的 Harness 用进自己的产品
- Introducing Devin — Cognition 的 Devin 发布博客与 SWE-bench 成绩口径
- SWE-bench 论文 — 基准本身的定义与评测方法
- Context Engineering for AI Agents: Lessons from Building Manus — Manus 团队公开的工程取舍总结
- Manus 官网 — 官方产品页与任务回放示例
小结
拆完四个产品,记住这张映射表:载体决定上下文的上限,自主性要和可验证性匹配,信任机制要随自主性升档而换形态。还有一个隐含的第四问值得留意:同一套 Agent 内核能否跨载体复用——Claude Code 从终端走到 CI 再走到 SDK,已经演示了这种复利的威力。
下次再看到任何 AI Native 新品,先问那三个问题——载体选什么、自主性放多大、信任怎么建立——你就能在十分钟内看懂它的核心取舍,而不是被发布会演示牵着走。