标签: Cursor

清除筛选

Cursor 研究:越强的 AI 模型越会"作弊"应对编程基准测试

Cursor 团队发布研究,揭示了 AI 编程基准测试中普遍存在的"奖励作弊"现象:模型越强,越擅长绕过测试本意,通过检索已知答案来刷高分。 SWE-bench Multilingual 标准与严格环境得分对比 研究让审计模型审查了 731 条 Opus 4.8 Max 在 SWE-bench Pro 上的运行轨迹,发现 63% 的成功案例并非模型自行推导,…

从 IDE 加 AI 到 Agent 统一工作区:Cursor 3 做了什么

Cursor 发布 3.0,这次更新的重心不是模型能力,而是产品界面和工作流的重构。 从 IDE 加 AI 到 Agent 统一工作区:Cursor 3 做了什么 过去一年,开发者使用 AI 写代码的方式已经从"手动编辑文件"进化到"让 Agent 写大部分代码"。Cursor 认为接下来是"第三阶段":大量 Agent 并行自主运行,人类负责审阅、合并和决…