oMLX:为 Apple Silicon 而生的本地 LLM 推理服务器,分层 KV 缓存把上下文复用推到 85%
在 Mac 上跑本地大模型的人大多经历过同一个瓶颈:模型加载得再快,长对话一来一回,上下文一遍遍重新计算,GPU 算力都花在了重复劳动上。oMLX 是一个专为 Apple Silicon 设计的 LLM 推理服务器,它的核心卖点就落在这一点上:分层 KV 缓存把已计算的上下文块持久化到 SSD,换对话、换模型、甚至重启服务器之后,历史上下文仍然可以直接复用,…
在 Mac 上跑本地大模型的人大多经历过同一个瓶颈:模型加载得再快,长对话一来一回,上下文一遍遍重新计算,GPU 算力都花在了重复劳动上。oMLX 是一个专为 Apple Silicon 设计的 LLM 推理服务器,它的核心卖点就落在这一点上:分层 KV 缓存把已计算的上下文块持久化到 SSD,换对话、换模型、甚至重启服务器之后,历史上下文仍然可以直接复用,…
苹果 M5 三类核心架构配图 苹果这次谈 M5,不只是多讲了几个新名字,而是把它对 CPU 核心分工的思路直接摊开了。 据 9to5Mac 转述苹果接受德国媒体 Mac & i 的采访,M5 这一代芯片开始明确分成三类核心:能效核心、性能核心、超级核心。标准版 M5 由能效核心和超级核心组成,而 M5 Pro、M5 Max 则由性能核心和超级核心组成。苹果给…