DeepSeek 发布视觉基元推理报告,用点和框解决多模态 Reference Gap
2026 年 4 月 30 日,DeepSeek 公开技术报告《Thinking with Visual Primitives》,提出一种新的多模态推理范式——将点(point)和框(bounding box)等视觉基元作为思维的最小单元,交错嵌入推理链中。 问题:Reference Gap 当前多模态大模型虽然在「感知差距」(Perception Gap)…
2026 年 4 月 30 日,DeepSeek 公开技术报告《Thinking with Visual Primitives》,提出一种新的多模态推理范式——将点(point)和框(bounding box)等视觉基元作为思维的最小单元,交错嵌入推理链中。 问题:Reference Gap 当前多模态大模型虽然在「感知差距」(Perception Gap)…
苹果与 UCSD 研究团队提出 LaDiR 框架,将扩散模型引入 LLM 推理阶段,通过并行探索多条推理路径来提升数学、代码生成和复杂规划任务的准确率。 核心思路 LaDiR(Latent Diffusion enhances Reasoning)的切入点在于推理阶段而非训练阶段。它在已有的 LLM 基础上,于推理时用扩散过程并行生成多条候选推理路径——每条…
Anthropic 近期悄然更新了 Claude Code 官方文档中的成本预估数据,企业开发者的日均 Token 费用估算从此前的约 6 美元大幅上调至约 13 美元——涨幅超过一倍。 封面图 数据变更 根据 Claude Code 官方文档(code.claude.com/docs/en/costs)的当前版本与此前归档版本的对比: 日均成本(企业均值)…
iOS 27 将新增 Apple Intelligence 照片编辑工具 据 Bloomberg 的 Mark Gurman 报道,苹果将在 iOS 27、iPadOS 27 和 macOS 27 的照片 App 中引入多项 Apple Intelligence 编辑工具,大幅升级内置的照片编辑能力。 iOS 27 概念图 三项新工具 照片 App 的编辑界…
NVIDIA Nemotron 3 Nano Omni:一个开放模型统一视觉、音频和语言 4 月 28 日,NVIDIA 发布 Nemotron 3 Nano Omni,一个开放权重的全模态理解模型,将视觉、音频和语言处理统一到单一架构中。模型采用 30B-A3B 混合专家(MoE)架构,总参数 300 亿,每个 token 仅激活 35 亿参数,支持 25…
欧盟委员会发布拟议措施,要求谷歌向第三方 AI 助手开放安卓系统的语音唤醒、后台运行及深度交互等核心功能,使其获得与 Gemini 同等的访问权限。此外,谷歌须向第三方搜索引擎和 AI 聊天机器人开放排名、查询和点击等搜索数据。上述措施正处于公众咨询阶段,关于 AI 助手和搜索数据的意见征求将分别于 5 月 13 日和 5 月 1 日截止。若谷歌最终被认定不…
小米正式开源 MiMo-V2.5 系列模型,采用 MIT 协议,支持免授权商业部署、持续训练和微调。该系列包含两款模型:MiMo-V2.5-Pro 专注于复杂 Agent 和代码任务,MiMo-V2.5 为原生全模态模型。两款模型均支持 1M token 上下文窗口。 Benchmark 对比分析 Benchmark Results 官方公布的 benchm…
AI 创业公司 LifePrompt 最新测试显示,OpenAI 的 ChatGPT 5.2 Thinking 模型在东京大学和京都大学的本科入学考试中取得了超过人类最高考生的成绩。 ChatGPT 5.2 东京大学入学考试 具体成绩 东京大学: 文科三类:452/550 分(人类最高分 434 分) 理科三类(医学,竞争最激烈):503/550 分(人类最…
开发者 Andrew Vos 发布了一款名为 Endless Toil 的 GitHub 插件,支持 Claude 和 Codex 等 AI 编程代理。该插件会实时扫描代理处理的代码,并根据代码质量触发不同程度的人类呻吟声——声音级别从轻微呜咽一路升级到凄惨哀嚎。 Endless Toil Endless Toil 提供三个级别的声音反馈:groan(呻吟)…
开源 Agent 框架 OpenClaw 发布 2026.4.24 版本,主要更新如下: 模型层:正式接入 DeepSeek V4 Flash 和 V4 Pro,V4 Flash 设为默认模型。修复了 DeepSeek 在多轮工具调用后续回合中的 thinking/replay 行为问题。 语音能力:Talk、Voice Call 和 Google Meet…