知识卡片:Cursor Router 如何为任务选择合适模型
英文标题: How Cursor Router chooses the right model for the task
英文关键词: Cursor Router; Auto Intelligence; Auto Balance; Compass; task router; model routing; cost-performance; real developer traffic
一句话结论
Cursor Router 不依赖基准分数,而是从真实开发者流量中学习模型选择:先用 Compass 预测任务复杂度,再用任务分类器挑选最合适的前沿模型。发布后持续改进,目前 Auto Intelligence 达到超过 Fable 的用户满意度且成本低 68%;Auto Balance 优于 Opus 4.8,成本低 41%。
事件概述或研究问题
2026 年 7 月 22 日,Cursor 推出 Router 的两种新配置:Auto Intelligence 和 Auto Balance。8 月 6 日,Cursor 发布技术博文解释其工作原理,核心问题是:如何根据真实开发者工作,而不是 benchmark 分数,为每个任务选择成本与质量最优的模型。
方法/产品要点
- 数据来源:使用来自 Cursor 真实流量的数十万次会话轮次构建数据集,保留任务分布、上下文和模型切换的影响,并遵守用户隐私模式和数据保留设置。
- 信号特征:路由决策使用当前轮次和近期对话状态,包括任务类别、最近工具调用和更广泛的工作上下文。
- Compass 复杂度预测器:通过预测用户是否对响应满意来估计任务复杂度。分数越高,代表用户越可能满意;简单任务很少被用户纠正,复杂任务更可能引发后续请求。
- 路由算法:Compass 分数高于阈值时,走价格更高效的模型;低于阈值时,交给任务路由器选择前沿模型。
- 任务分类体系:从真实流量中学习,包含三个维度:
- Domains:backend、database schemas、frontend 等;
- Tasks:fixing bugs、running commands、writing tests 等;
- Modifiers:bounded edits、product questions、visual-heavy changes 等。
- 任务路由规则:
- 只有候选模型在某个任务标签上的表现明显更好时才路由,要求单侧 75% 的提升阈值,约等于需要 75% 置信度认为改进真实存在;
- 在预算内选择预期质量提升最大、平均每次成本不超预算的流量加权组合。
- 两种模式:Auto Balance 让更多流量留在性价比路径,并给任务路由器较小预算;Auto Intelligence 给任务路由器更大空间,在预期收益合理时选择前沿模型。
主要结果或产业意义
- Auto Intelligence:用户满意度超过 Fable 水平,成本低 68%;自上线以来成本进一步降低 18%。
- Auto Balance:表现优于 Opus 4.8,成本低 41%;同期成本再降 8%,用户满意度进一步提高 3%。
- Compass 在线验证:被 Compass 评为最可能成功的轮次中,96% 收到正向性能信号;评为最不可能成功的轮次中,该比例为 71%。
- 模型优势差异:材料认为没有任何模型在所有任务上都占优。
- Grok:适合广泛、常规的工作,成本低,尤其适合 Git 命令和通用数据库操作;
- Sol:在规划和代码库理解上表现好,某些实现任务上也以更低成本取得强结果;
- Opus:适合执行密集型工作,如 devops、数据库查询、性能优化;
- Fable:擅长调试和视觉实现,在复杂任务上质量优势值得更高成本。
- 持续演进:上线后已将 Opus 5 加入路由池,并改进了 Compass 预测;长期目标是让路由系统根据生产结果持续更新。
为什么重要
Cursor Router 展示了一种不同于“单一最强模型”的工程思路:用真实开发者行为信号训练模型选择器,而不是仅看 benchmark。它把成本控制放在与质量同等重要的位置,并尝试在每一次任务上动态组合多个前沿模型。对行业而言,这意味着模型能力的竞争之外,还出现了“模型路由”这一层新的系统级优化空间。
与既有脉络的关系
本条是 Cursor Router 的机制说明,与已有“Grok 4.5”卡片相关但不重复。增量信息在于:Grok 4.5 卡片介绍模型本身,本条则说明 Cursor 如何在生产环境中把 Grok、Sol、Opus、Fable 等模型放进统一路由系统,并用 Compass 和任务分类器决定何时使用哪个模型。材料还披露了各模型在不同类别任务上的相对优势。
局限与不确定性
- 性能信号来自用户后续行为,例如继续下一个任务或纠正智能体,属于间接推断,不是直接满意度测量。
- 离线评估和 benchmark 都不能完全预测线上表现;真实流量仍是最具代表性的测试环境。
- 具体 Compass 阈值、各模式成本预算、75% 置信度计算细节未在材料中完全展开。
- 文中“68% 更低成本”的比较对象在文字中不够明确,图表说明以 Opus 4.8 为相对基准;如需引用,具体口径待核实。
- 以上收益数据来自 Cursor 自述,尚未提供独立第三方验证。
可用于图书/PPT/简报的角度
- “模型路由”作为 LLM 成本优化层:不是所有任务都需要最贵的模型。
- 用真实用户行为信号代替 benchmark 来做模型选择。
- Cursor Router 的两阶段决策:先判复杂度,再选模型。
- 模型没有全能冠军:路由系统可以利用不同模型的相对优势。
- 从“上线后继续降低成本”看生产环境中持续评估的重要性。
原始材料
- 原文标题:How Cursor Router chooses the right model for the task · Cursor
- 作者:Connor O'Keefe & Yuri Volkov
- 发布日期:Aug 6, 2026
- 来源:https://cursor.com/blog/how-cursor-router-works