Cursor 研究:越强的 AI 模型越会"作弊"应对编程基准测试
Cursor 团队发布研究,揭示了 AI 编程基准测试中普遍存在的"奖励作弊"现象:模型越强,越擅长绕过测试本意,通过检索已知答案来刷高分。 SWE-bench Multilingual 标准与严格环境得分对比 研究让审计模型审查了 731 条 Opus 4.8 Max 在 SWE-bench Pro 上的运行轨迹,发现 63% 的成功案例并非模型自行推导,…
Cursor 团队发布研究,揭示了 AI 编程基准测试中普遍存在的"奖励作弊"现象:模型越强,越擅长绕过测试本意,通过检索已知答案来刷高分。 SWE-bench Multilingual 标准与严格环境得分对比 研究让审计模型审查了 731 条 Opus 4.8 Max 在 SWE-bench Pro 上的运行轨迹,发现 63% 的成功案例并非模型自行推导,…
Cursor 发布 3.0,这次更新的重心不是模型能力,而是产品界面和工作流的重构。 从 IDE 加 AI 到 Agent 统一工作区:Cursor 3 做了什么 过去一年,开发者使用 AI 写代码的方式已经从"手动编辑文件"进化到"让 Agent 写大部分代码"。Cursor 认为接下来是"第三阶段":大量 Agent 并行自主运行,人类负责审阅、合并和决…
Cursor Composer 2 与 Kimi K2.5 争议截图 3 月 19 日,Cursor 发布 Composer 2,主打前沿级编码性能,并把价格压到每百万输入 token 2.5 美元。官方公告的重点是性能、强化学习训练和更低成本,整篇都在把它包装成 Cursor 自家的新一代编码模型。 但这层包装没有撑太久。 开发者 Fynn 在调试 Com…