微软开源 Agent Governance Toolkit:用确定性代码拦截 AI Agent 的每一次工具调用
当 AI Agent 可以自主调用工具、查询数据库、发送邮件甚至编写代码时,一个绕不开的问题浮出水面:怎么确保它不做不该做的事? 微软开源的 Agent Governance Toolkit(AGT)给出的答案是:别指望提示词约束,用确定性代码在应用层拦截每一次工具调用。 2026 年 3 月创建至今,这个项目在 GitHub 收获 5,392 个 Star…
当 AI Agent 可以自主调用工具、查询数据库、发送邮件甚至编写代码时,一个绕不开的问题浮出水面:怎么确保它不做不该做的事? 微软开源的 Agent Governance Toolkit(AGT)给出的答案是:别指望提示词约束,用确定性代码在应用层拦截每一次工具调用。 2026 年 3 月创建至今,这个项目在 GitHub 收获 5,392 个 Star…
开源 Agent 框架 OpenClaw 发布 2026.4.24 版本,主要更新如下: 模型层:正式接入 DeepSeek V4 Flash 和 V4 Pro,V4 Flash 设为默认模型。修复了 DeepSeek 在多轮工具调用后续回合中的 thinking/replay 行为问题。 语音能力:Talk、Voice Call 和 Google Meet…
DeepSeek 今日正式发布 V4 系列模型预览版,同步开源。两个版本——V4-Pro 和 V4-Flash——均支持 1M 上下文长度,并在 Agent 能力上进行了专项优化。 V4-Pro 与顶级闭源模型评测对比 两个版本,两个定位 V4-Pro 是性能旗舰。在数学、STEM、竞赛型代码的评测中,V4-Pro 超越了当前所有已公开评测的开源模型,成绩追…
Anthropic 正在针对约 2% 的新注册 Pro 用户测试一项改变:Claude Code 不再包含在每月 $20 的 Pro 计划中。虽然范围不大,但信号明确——AI Agent 的 token 消耗已经超出了固定订阅模式的承受边界。 变了什么 本周一,Anthropic 的定价页面还写着 Pro 计划"includes Claude Code"。到…
OpenAI 内部编码代理监控系统配图 OpenAI 最近公开了一套它们内部已经在运行的编码代理监控系统。 按官方说法,这套系统会在一次代理交互结束后 30 分钟内回看完整轨迹,范围包括对话、工具调用、动作,以及模型的思考链,重点筛查两类问题:一类是是否偏离用户原始意图,另一类是是否触碰内部安全、合规和权限边界。 这件事之所以值得看,不只是因为它披露了一组看…
2026年3月19日,小米在 MiMo 开放平台同步上线三款大模型——MiMo-V2-Pro、MiMo-V2-Omni、MiMo-V2-TTS。这是小米首次以模型矩阵而非单一模型的方式对外亮相,三款产品分别对准 Agent 应用的不同核心能力:推理、全模态感知、语音合成。 小米三款大模型齐发:MiMo-V2-Pro、Omni、TTS 完整解读 MiMo-V2…
智谱发布 GLM-5-Turbo:面向 OpenClaw 场景优化,价格较 GLM-5 上调约一到两成 智谱在 3 月 16 日上线了新模型 GLM-5-Turbo。和常规的 Turbo 命名不同,这次官方给出的定位非常明确:它是一个“面向 OpenClaw 龙虾场景深度优化的基座模型”。与此同时,BigModel 官网还同步上线了“龙虾套餐 · 团队协作版…