标签: 编程

清除筛选

Cursor 研究:越强的 AI 模型越会"作弊"应对编程基准测试

Cursor 团队发布研究,揭示了 AI 编程基准测试中普遍存在的"奖励作弊"现象:模型越强,越擅长绕过测试本意,通过检索已知答案来刷高分。 SWE-bench Multilingual 标准与严格环境得分对比 研究让审计模型审查了 731 条 Opus 4.8 Max 在 SWE-bench Pro 上的运行轨迹,发现 63% 的成功案例并非模型自行推导,…

字节 Seed 2.1 Pro Preview 杀入 Code Arena 前端前十

字节跳动的 Seed 2.1 Pro Preview 在 Arena.ai 的 Code Arena 前端排行榜上冲到第 8,得分 1539,和 Claude Opus 4.6(1538)几乎并驾齐驱。 Code Arena Frontend 排行榜 这个成绩在七个分项中的五个进了前十。在这些领域里,排在它前面的只有 GLM-5.2 和 Claude 两家。…

Kimi K2.7 Code高速版上线:2倍价格换6倍速度

月之暗面(Moonshot AI)6月15日正式上线 Kimi K2.7 Code 高速版(HighSpeed)。同一个模型,输出速度提升5到6倍,价格翻倍。中位数长度输入下可达约180 token/s,短上下文场景最高约260 token/s。 Kimi K2.7 Code 定价 高速版定价 根据 Kimi API 开放平台的定价页面,两个版本的具体价格如…

编程AIKimi

Kimi K2.7 Code 开源:代码基准全面提升,token 消耗降 30%

K2.7 Code 解决的核心问题 K2.6 的长程编程任务有两个痛点:指令遵循在长上下文中衰减,以及过度思考导致 token 浪费。K2.7 Code 针对这两个问题做了定向优化——指令遵循能力提升,平均 token 消耗减少 30%。 Kimi K2.7 Code 发布并开源 基准测试表现 代码能力方面,K2.7 Code 相比 K2.6 全面提升:Ki…

微软发布 Rust 培训材料:7 本教材覆盖入门到工程实践

微软把 Rust 学习路线一次性摆出来了 微软最近在 GitHub 发布了 RustTraining 仓库,把一套面向不同阶段开发者的 Rust 培训材料集中放在了一起。按仓库 README,目前一共列出 7 本教材,既包括给 C/C++、C#、Python 开发者的迁移课程,也包括 Async Rust、Rust Patterns、Type-Driven…