博客.
博客.
(联系方式)

保持联系

如果你想联系我,无论是讨论合作机会、分享想法,还是只是打个招呼,都可以通过以下方式找到我。

(最后更新)

版权所有 / 2026

(快捷键)C
返回学习路线
(03 · AI Native)2026年8月

案例拆解

四个明星产品,三种取舍:Cursor 为什么长在 IDE 里,Claude Code 为什么选了终端,Manus 把过程摊开给你看,Devin 的争议又提醒我们什么。

案例拆解

为什么拆这四个产品

概念学得再多,不如拆几个真实产品。Cursor、Claude Code、Manus、Devin 是过去几年 AI Native 产品里最有代表性的四个样本:它们用的底层模型大同小异,但产品形态天差地别——一个长在 IDE 里,一个住在终端里,一个跑在云端虚拟机上,一个号称要当你的「AI 同事」。

同样的模型,为什么做出了完全不同的东西?因为真正的差异化不在模型,而在三个产品决策上。把这四个产品拆透,比读十篇「Agent 十大趋势」有用得多——你会获得一套可以套用在任何新 AI 产品上的分析框架。

先声明信息边界:以下分析全部基于官方文档、官方博客、公开访谈和公开的社区讨论,不揣测任何内部信息;涉及数字和二手报道的地方,我会标注「据公开资料」或「据公开报道」,定价这类易变信息以官网为准。


分析框架:三个问题

每看一个 AI Native 产品,我只问三个问题:

  1. 载体选什么——AI 住在哪?IDE、终端、浏览器、还是一台云主机?载体决定了 AI 能看到什么上下文、能用什么工具,也决定了它离用户的工作流有多近。
  2. 自主性放多大——AI 是只给建议,还是直接动手?动手之前要不要请示?这是一条连续的滑杆,不是非黑即白的开关。
  3. 信任怎么建立——用户凭什么敢让 AI 动手?靠 diff 审查、权限确认、过程回放,还是靠品牌信仰?

打个比方,这像招一个新人:在哪给他安排工位(载体)、敢放多少权给他(自主性)、怎么验收他的活(信任)。四个产品的全部差异,都能映射到这三个答案上。下面我们逐个拆。


Cursor:把 AI 缝进人的主战场

载体决策:IDE。 程序员的上下文——打开的文件、光标位置、报错信息、整个代码库——全在 IDE 里。AI 想帮人写代码,就得去上下文最富的地方上班,而不是让人把代码复制粘贴到聊天框里。Cursor 干脆 fork 了 VS Code,把 AI 做成编辑器的一等公民,顺带继承了整个 VS Code 插件生态,降低了老用户的迁移成本。

自主性决策:一根完整的滑杆。 Cursor 的产品线几乎就是一张「自主性刻度表」:

  • Tab 补全:自主性最低。模型预测你下一步要改哪、改成什么,以灰色幽灵文本呈现,按 Tab 接受、继续打字即拒绝。官方把它描述为「预测你的下一次编辑」——不只是补全当前行,而是跨位置、跨文件的编辑预测。它不打断你,否决成本是零
  • Cmd+K 局部改写:选中一段代码让它改,自主性升一档,改动范围被人为圈定。
  • Agent 模式:自主性最高。给它一个任务(「给这个模块补上单元测试」),它自己搜代码、改多个文件、跑命令,连续执行多步。

一个容易被忽视的细节:Tab 和 Agent 背后是两套模型策略。 据 Cursor 团队公开的技术博客,Tab 用的是他们自训的专用小模型——补全场景对延迟极其敏感(几百毫秒内必须出结果,否则打断心流),调用大模型既慢又贵,所以他们自己训练针对「编辑预测」优化的模型,按次计费不心疼。而 Agent 模式是长程推理任务,直接调用 Claude、GPT 这类前沿大模型。按任务形态分配合适的模型,而不是一个大模型包打天下——这是 AI Native 产品成本控制的基本功。

Cursor 的自主性滑杆:Tab 补全、Cmd+K 局部改写、Agent 模式逐级升高,Tab 背后是自训专用小模型,Agent 背后是前沿大模型

另一个细节:代码库索引。 Agent 要在几万文件的项目里找到相关代码,靠的是预建索引:据官方文档,Cursor 在本地把代码切块、计算向量嵌入,用 Merkle 树做增量同步——只有改动的文件才重新计算和上传,且官方声称上传的是嵌入和元数据而非明文代码(有隐私模式可选)。这套「嵌入索引 + 增量同步」的做法,如今几乎是代码类 AI 产品的标配。

定价与增长(据公开报道)。 Cursor 采取订阅制(免费额度 + Pro 档约 20 美元/月,之上还有更高档位),超出额度按用量计费。它是增长最快的开发者产品之一:据公开报道,其年化收入(ARR)在 2025 年内从约 1 亿美元级别攀升至数亿美元级别,融资估值接近百亿美元。这个数字的意义在于:它证明了「AI 深度嵌入现有工作流」这条路线,用户是真金白银买账的

信任机制:diff 是核心 UI。 所有改动都以 diff 块呈现,可以逐块接受(Accept)或拒绝(Reject)。Cursor 的信任哲学是:AI 可以动手,但每一处改动都必须经人眼过一遍,而且拒绝要足够便宜。


Claude Code:为什么是终端

很多人第一反应是:都什么年代了还做命令行产品?但站在「模型视角」想,终端是深思熟虑的选择:

  • 终端是纯文本界面,而文本正是 LLM 的母语。不需要解析像素、不需要模拟点击,读写文件、跑命令、看报错,输入输出天然是 token。
  • 工具现成且可组合。bash、git、grep、测试框架……几十年积累的 Unix 工具链直接变成 Agent 的工具箱,还能用管道自由拼接——这正契合 Unix 哲学:小程序、做一件事、能组合。
  • 住在工程师的真实工作流里。git 提交、CI 脚本、远程服务器,终端都能直接触达,不存在「第二个工作区」的割裂感。

CLAUDE.md:把项目规矩变成持久记忆。 Claude Code 启动时会自动加载 CLAUDE.md 文件注入上下文,而且是分层的:用户级(~/.claude/CLAUDE.md,放个人偏好)、项目级(仓库根目录,放项目约定,通常提交进 git 全员共享),还支持用 @路径 语法引入其他文件。这是一个「用文档工程替代微调」的典型设计——不改模型,只喂纪律。

权限模式:自主性的四个档位。 据官方文档,Claude Code 有明确的权限模式:默认模式(写文件、执行命令逐个请求确认)、acceptEdits(自动接受文件编辑,命令仍需确认)、plan mode(只读规划不动手,先出方案再执行)、以及 bypassPermissions(完全放开,官方建议只在隔离容器里用)。再配合允许列表(把 npm test 这类安全命令加白名单),用户可以精确地把滑杆停在自己舒服的位置。

Headless 与 SDK 化:从工具变成平台。 这是 Claude Code 最容易被低估的一步棋。claude -p "你的任务" 这条命令让 Claude Code 以非交互模式运行,支持 JSON 输出,可以直接塞进 CI 流水线、git hook 和脚本里——比如「每次 PR 自动做一轮代码审查」。再进一步,Anthropic 把同一套 Harness 开放为 Claude Agent SDK(TypeScript/Python),让开发者用同样的 Loop、工具和权限系统搭自己的 Agent。同一个 Agent 内核,既是终端工具,又是自动化组件,还是开发平台——载体的复利效应在这里体现得淋漓尽致。

信任机制:git 就是安全网。 终端场景的所有改动天然落在 git 仓库里,git diff 随时可查、git checkout 一键回滚。Claude Code 的信任公式是:先充分读代码再动手 + 危险动作逐个请示 + 全部改动可回滚


Manus:通用 Agent 的产品化

Cursor 和 Claude Code 都服务程序员,Manus(2025 年 3 月发布,华人团队 Butterfly Effect 出品)想回答一个更大的问题:通用 Agent 怎么做成普通人能用的产品?

载体决策:一人一台云端虚拟机。 每个 Manus 任务跑在一台独立的云主机沙箱里,有自己的文件系统、浏览器和命令行。载体不再是「你的工具」,而是「它自己的电脑」。这个选择有两个直接收益:一是安全隔离(Agent 折腾得再狠也碰不到你的本机),二是天然支持长任务(云主机不随你关浏览器而停止)。

自主性决策:异步任务制。 你像给同事派活一样提交一个任务(「调研一下东南亚的跨境电商市场,出一份报告」),然后就可以关掉页面走人——几小时后回来收结果。这是和 Chatbot 的根本区别:从「对话」变成「委托」。异步意味着任务时长不再有上限,Agent 可以跑几十分钟甚至几小时的多步流程。

信任机制:过程可视化。 这是 Manus 最值得拆的设计——它把 Agent 的操作过程完整摊开:「Manus 的电脑」面板实时展示它正在浏览什么网页、写什么文件、跑什么命令,任务结束后还能回放全过程。为什么这重要?因为通用任务没有 diff 可以审查——你没法像审查代码那样审查一份市场调研。当结果难以验证时,信任的来源从「检查结果」变成「看见过程」。这和现实中的管理一模一样:对看不懂细节的工作,你只能要求下属把过程透明化。

公开访谈与工程博客里的取舍(据公开资料)。 Manus 团队后来发布过一篇被广泛传播的工程博客,总结他们构建 Agent 的教训,几条核心取舍值得记住:

  • 围绕 KV-cache 设计上下文:Agent 的上下文每步只增不改(append-only),因为前缀稳定才能命中缓存,否则长任务的成本会爆炸;
  • 文件系统就是外存:上下文塞不下的东西写进文件,需要时再读回来,把「记忆」卸载到磁盘;
  • 用 todo 清单对抗跑偏:让 Agent 反复把任务清单「复述」进上下文的尾部,防止长程任务中忘记最初目标;
  • 少结构、多智能:不要预先用僵化流程框死 Agent,保留模型的自主决策空间,只在其犯错的点上加结构。

这几条几乎可以当作通用 Agent Harness 设计的检查清单。

顺带一提,「回放」在 Manus 这里不只是信任 UI,还是一个低成本的调试资产:团队自己和用户都能拿着失败任务的回放去定位 Agent 在哪一步跑偏,相当于把航空业的黑匣子引入了 Agent 产品。对异步长任务来说,这种可追溯性几乎是一切改进的前提——没有它,你连「任务为什么会失败」都回答不了。


Devin:自治的边界与争议

Devin(Cognition 出品)2024 年 3 月发布时自我定位为「AI 软件工程师」——不是助手,是工程师:给它一个 issue,它自己规划、写码、调试、部署。它把三个问题都推到了极端:载体是一整套独立工作环境(自带编辑器、shell、浏览器);自主性是四者中最高的,目标是端到端交付;信任则几乎完全押在「结果可运行」上。

SWE-bench 成绩的口径,值得掰开看。 发布博客报告 Devin 在 SWE-bench(用真实 GitHub issue 评测 Agent 的公开基准)上端到端解决了 13.86% 的 issue,远超此前最好成绩的 1.96%。但注意两个口径细节:其一,这是在随机抽取的 25% 子集上测的,不是完整测试集;其二,「unassisted」指评测过程中不人工喂答案,但任务本身来自经过筛选的开源仓库。后来 OpenAI 推出了人工校验过的 SWE-bench Verified 子集,各家成绩才逐渐有了更可比的对齐口径。基准分数是重要信号,但先问口径再比较——这是读一切 Agent benchmark 宣传的基本素养。

社区复现争议的时间线(据公开资料)。 2024 年 3 月发布后反响热烈;4 月,YouTube 频道 Internet of Bugs 发布了一条逐帧拆解视频,分析 Devin 官方演示中的一个 Upwork 接单任务,指出:任务需求其实是演示者自己简化生成的、Devin 修的是自己写出来的 bug、实际耗时远超宣传的人类对照。此后一年多里,陆续有试用者公开反馈真实任务的成功率和耗时与演示存在差距。这里给正反两方:

  • 批评方:演示存在选择性呈现,「AI 软件工程师」的叙事跑在了能力前面;自治意味着失败也端对端——一次翻车抵掉十次成功。
  • 辩护方:抛开营销话术,Devin 确实率先验证了「Agent 端到端完成软件任务」的可能性边界,而且在持续迭代——据公开报道,它后来以按任务计量(ACU)的方式正式商用,并拿到了一些企业级部署案例;基准分数也随版本稳步提升。

我的看法:Devin 的价值不在于它成功或失败,而在于它用真金白银试出了自治性的当前边界。现阶段「AI 工程师」更现实的形态是「强自主 + 关键节点请示」,而不是「完全不管」。


放在一起看

产品载体自主性信任机制计费模式更适合谁
CursorIDE(VS Code fork)滑杆:Tab → Cmd+K → Agentdiff 逐块审查订阅制 + 超量按用量(约 $20/月起)日常写码的个人开发者与团队
Claude Code终端 + CI + SDK权限模式四档 + 允许列表逐次确认 + git 回滚订阅(Pro/Max)或 API 按 token工程师、自动化流水线
Manus每任务一台云端虚拟机高:异步委托整个任务过程直播 + 全程回放订阅 + 积分(credits)计量非技术知识工作者
Devin独立工作环境(编辑器/shell/浏览器)最高:端到端交付押注结果可运行(受争议)按任务计量(ACU,据公开资料)愿意试水的工程团队

(计费信息据各官网公开资料,此类价格变动频繁,以官网实时信息为准。)

一条清晰的规律浮现出来:自主性每升一档,信任机制就必须跟着换一种形态。补全级别靠「拒绝免费」,改动级别靠「diff 审查」,任务级别靠「过程透明」,自治级别……目前还没有公认答案,这正是 Devin 争议的根源。

自主性四级与信任机制的对应关系:补全级靠拒绝免费,改动级靠 diff 逐块审查,任务级靠过程直播与回放,自治级尚无公认答案


工程实践要点

如果你在设计自己的 Agent 产品(或给团队引入这些工具),这几条是四个案例共同验证过的:

1. 自主性要和可验证性匹配。 结果越容易被机器验证(测试通过、编译成功),自主性就可以放得越大;结果越依赖人判断(报告质量、设计好坏),就越要把自主性收回来或加强过程透明。用一个简单的审批策略表达:

type Risk = "read-only" | "reversible" | "destructive";

function needsApproval(action: { risk: Risk; verified: boolean }): boolean {
  if (action.risk === "read-only") return false;      // 读操作直接放行
  if (action.risk === "reversible" && action.verified) return false; // 可回滚且机器验证过
  return true;                                        // 其余一律请示
}

Cursor 的 Tab(read-only 级,零审批)和对生产环境的操作(destructive 级,必审批)之间,隔着的就是这张表。

2. 上下文比模型更值得投入。 四个产品都在上下文工程上花了大力气:Cursor 的嵌入索引、Claude Code 的 CLAUDE.md、Manus 的「文件系统即外存」。同一模型,喂给它的上下文质量不同,表现判若两人。

3. 按任务形态分配模型。 低延迟高频场景(补全)用自训小模型,长程推理场景(Agent)用前沿大模型。成本和体验同时受益。

4. 信任 UI 是产品的一部分,不是附属品。 diff 视图、权限弹窗、过程回放,这些不是「锦上添花的安全提示」,而是用户敢不敢用的决定性因素。预算里要给它留位置。


常见误区

  • 把 demo 当能力:单点演示证明的是「上限存在」,不是「下限可靠」。评估任何 Agent 产品,先看它失败时什么样。
  • 自主性越高越好:自主性是有成本的——每升一档,验证成本和翻车成本都指数上升。合适的档位取决于任务的可验证性,不是越高越先进。
  • 只比模型,不比载体和 Harness:四个产品证明,同一个模型在不同载体里的能力差,可能大于不同模型在同一载体里的能力差。
  • 看 benchmark 不看口径:子集比例、是否 unassisted、用什么脚手架,口径不同分数没有可比性。
  • 忽视信任设计:很多团队把精力全花在「让 Agent 做对」,却忘了「让用户敢用」。后者往往才是瓶颈。

术语表

名词定义一句话直觉常见混淆
载体(Form Factor)AI 栖身并作用于世界的界面形态,如 IDE、终端、云虚拟机AI 在哪上班不等于「模型部署位置」,载体是产品概念不是基础设施概念
自主性滑杆从「只建议」到「完全动手」的连续自主性刻度放权不是开关,是旋钮自主性 ≠ 能力:同一个模型可以放在不同档位上
Tab 补全(编辑预测)预测用户下一次编辑并以幽灵文本呈现,按键接受猜你下一步改哪与 Agent 模式混淆:前者零风险秒级响应,后者多步执行可改多文件
diff 审查把所有 AI 改动以差异块呈现,逐块接受或拒绝改可以,先给我看改了啥不是事后 code review,是执行过程中的即时关卡
CLAUDE.mdClaude Code 自动加载的项目说明书文件,注入上下文写在仓库里的项目规矩不是微调也不是系统提示词,是会话级的持久上下文
权限模式Claude Code 对写文件/执行命令的四档确认策略每档对应不同的请示频率与「允许列表」混淆:模式是总开关,白名单是逐项豁免
Headless 模式以非交互方式运行 Agent(如 claude -p),供脚本和 CI 调用把人从回路里临时拿掉不是「无头浏览器」,指无人工交互的批处理运行
代码库索引对代码切块算嵌入向量并增量同步,供语义检索给代码库建一张可搜索的地图不等于全文搜索(grep):索引理解语义,grep 只匹配字符
异步委托提交任务后离开,Agent 在云端独立完成再交付结果派活给同事而不是盯着他干活与「后台任务」混淆:异步委托包含完整的自主执行与交付
过程回放完整记录并回放 Agent 的操作过程供人检查看不见结果的价值,就看见过程的诚意不是日志:回放是给人看的产品 UI,日志是给机器的排查材料
SWE-bench用真实 GitHub issue 评测软件工程 Agent 的公开基准Agent 界的公开考卷分数必须带口径(子集、是否 unassisted),裸分数不可比
自治(Autonomous)Agent 端到端完成任务,中途不请示放手让它跑完全程与「自动(Automated)」混淆:自动是固定脚本照做,自治是模型自己决策路径
ACUDevin 的任务计量单位,按消耗计费按工作量付工资的「AI 工时」不是 token 计费:ACU 试图对齐「完成一件事」而非「烧了多少算力」

参考材料


小结

拆完四个产品,记住这张映射表:载体决定上下文的上限,自主性要和可验证性匹配,信任机制要随自主性升档而换形态。还有一个隐含的第四问值得留意:同一套 Agent 内核能否跨载体复用——Claude Code 从终端走到 CI 再走到 SDK,已经演示了这种复利的威力。

下次再看到任何 AI Native 新品,先问那三个问题——载体选什么、自主性放多大、信任怎么建立——你就能在十分钟内看懂它的核心取舍,而不是被发布会演示牵着走。