14MB 运行完整 AI Agent:Cactus Needle 2 的边缘设备函数调用引擎
一个 45M 参数的模型,压缩到 14MB 的单一二进制文件,28MB 内存跑完整个推理会话。Cactus Compute 发布的 Needle 2 在树莓派 5 上达到 500 tokens/s 的解码速度,在 Meta Quest 3S 和 Apple Vision Pro 上跑出 400 到 1,500 tokens/s,在 200 美元以下的 And…
一个 45M 参数的模型,压缩到 14MB 的单一二进制文件,28MB 内存跑完整个推理会话。Cactus Compute 发布的 Needle 2 在树莓派 5 上达到 500 tokens/s 的解码速度,在 Meta Quest 3S 和 Apple Vision Pro 上跑出 400 到 1,500 tokens/s,在 200 美元以下的 And…
Cloudflare 在其 Agent Cloud 平台中正式接入 OpenAI 的前沿模型,包括 GPT-5.4 和 Codex。企业客户现在可以直接在 Cloudflare 的全球边缘网络上构建和部署 AI 智能体,用于自动处理客户响应、系统更新及报告生成等业务场景。 这则消息是 Cloudflare "Agents Week" 的核心发布,由联合创始人…