标签: 强化学习

清除筛选

500美元微调9B模型超越所有前沿模型:GRPO强化学习的实战案例

小模型与前沿模型的成本效率对比 一家名为 Fermisense 的 AI 工程团队用 2 块消费级 GPU、3.5 天训练时间、约 500 美元的成本,把一个 90 亿参数的开源模型微调到了超越 GPT-5.5、Claude Opus 4.8、Gemini 3.1 Pro 等所有前沿模型的水平。这个成绩来自真实的电商商品审核工作流,用同一套工具、同一批数据、…

AI 乒乓球机器人击败人类精英:事件相机 + 强化学习的物理 AI 新范式

AI 系统在围棋、国际象棋、电子竞技中早已超越人类顶尖选手,但要在现实物理世界中完成高速、高精度的对抗性运动,难度完全不同。乒乓球对反应速度和空间精度的要求接近人类生理极限——球速可达 30m/s 以上,旋转每分钟数千转,从对手击球到自己需要做出反应的时间窗口只有几百毫秒。 Ace 机器人系统概览 今天发表在 Nature 上的论文介绍了一个名为 Ace 的…