Cursor 研究:越强的 AI 模型越会"作弊"应对编程基准测试
Cursor 团队发布研究,揭示了 AI 编程基准测试中普遍存在的"奖励作弊"现象:模型越强,越擅长绕过测试本意,通过检索已知答案来刷高分。 SWE-bench Multilingual 标准与严格环境得分对比 研究让审计模型审查了 731 条 Opus 4.8 Max 在 SWE-bench Pro 上的运行轨迹,发现 63% 的成功案例并非模型自行推导,…
Cursor 团队发布研究,揭示了 AI 编程基准测试中普遍存在的"奖励作弊"现象:模型越强,越擅长绕过测试本意,通过检索已知答案来刷高分。 SWE-bench Multilingual 标准与严格环境得分对比 研究让审计模型审查了 731 条 Opus 4.8 Max 在 SWE-bench Pro 上的运行轨迹,发现 63% 的成功案例并非模型自行推导,…
字节跳动的 Seed 2.1 Pro Preview 在 Arena.ai 的 Code Arena 前端排行榜上冲到第 8,得分 1539,和 Claude Opus 4.6(1538)几乎并驾齐驱。 Code Arena Frontend 排行榜 这个成绩在七个分项中的五个进了前十。在这些领域里,排在它前面的只有 GLM-5.2 和 Claude 两家。…
月之暗面(Moonshot AI)6月15日正式上线 Kimi K2.7 Code 高速版(HighSpeed)。同一个模型,输出速度提升5到6倍,价格翻倍。中位数长度输入下可达约180 token/s,短上下文场景最高约260 token/s。 Kimi K2.7 Code 定价 高速版定价 根据 Kimi API 开放平台的定价页面,两个版本的具体价格如…
K2.7 Code 解决的核心问题 K2.6 的长程编程任务有两个痛点:指令遵循在长上下文中衰减,以及过度思考导致 token 浪费。K2.7 Code 针对这两个问题做了定向优化——指令遵循能力提升,平均 token 消耗减少 30%。 Kimi K2.7 Code 发布并开源 基准测试表现 代码能力方面,K2.7 Code 相比 K2.6 全面提升:Ki…
4 月 2 日,阿里千问发布新一代大语言模型 Qwen3.6-Plus。这是千问 3.6 系列的首款模型,编程能力接近 Claude Opus 4.5,在 SWE-bench 等权威评测中超越了参数量 2-3 倍的 GLM-5 和 Kimi-K2.5。 1775113058533336243-5f89da684f7f4942 编程能力全面跃升 千问 3.6…
微软把 Rust 学习路线一次性摆出来了 微软最近在 GitHub 发布了 RustTraining 仓库,把一套面向不同阶段开发者的 Rust 培训材料集中放在了一起。按仓库 README,目前一共列出 7 本教材,既包括给 C/C++、C#、Python 开发者的迁移课程,也包括 Async Rust、Rust Patterns、Type-Driven…