标签: 开源

清除筛选

Swiftlet:让 80B 大模型跑在 4.3GB 内存里的专家流式推理

一台 16GB 内存的 Mac mini 跑 80B 参数的大模型,一台 iPhone 17 跑 35B 参数的模型——而且不是靠云端中转,全部在本地完成。开源项目 Swiftlet 用一种叫做「专家流式推理」(Expert Streaming)的技术做到了这一点,峰值内存占用分别只有 4.3GB 和 2.5GB。 Swiftlet 项目主页 Swiftle…

开源AI推理

MiniMax H3:全模态视频生成与开源权重本地部署

MiniMax H3 7 月 31 日,MiniMax 发布了第三代视频生成模型 H3。这不是又一个文生视频工具:H3 将文本、图像、视频、音频作为统一上下文输入,生成带原生立体声音轨、最高 2K 分辨率、最长 15 秒的视频片段。两天后,模型权重在 HuggingFace 上线,ComfyUI 完成首日适配。 核心规格 | 参数 | 规格 | |---|-…

Qwen3.8-Max 技术解读:长程智能体如何持续交付

Qwen3.8-Max 的发布重点落在长程任务。Qwen 官方将它定义为 Qwen-Max 系列首次开放权重的模型,参数规模为 2.4 万亿,激活参数 950 亿,基于 Qwen3.5 的架构基础构建,现已通过 QwenCloud 提供 API。官方公告还列出了 Hugging Face 和 ModelScope 的权重发布安排。 这组信息的技术含义,可以从…

Agent Reach:AI Agent 互联网接入指南

Agent Reach 是一个面向 AI Agent 的互联网能力层。它负责选择、安装、检查和路由上游工具,真正读取网页、调用 GitHub、提取视频字幕的动作交给 gh、yt-dlp、OpenCLI、bili-cli、feedparser、Jina Reader 等工具完成。这个分工让项目保持轻量,也让每个平台的登录态、代理和风控差异集中在独立渠道文件中。…

开源AgentAI

AirLLM:4GB 显存运行 70B 模型的分层推理

AirLLM 是一个面向 Hugging Face 大语言模型的推理库,项目的核心目标是降低推理阶段的显存占用。官方 README 给出的典型配置是:70B 模型使用单张 4GB GPU,Llama 3.1 405B 使用 8GB,DeepSeek-V3 671B 使用约 12GB。它依靠分层拆分、按需加载和权重释放完成这件事,模型参数总量与显存容量之间的关…

TencentDB Agent Memory:给 Hermes 加上分层记忆

Agent 的记忆问题,常见表现是两种:长任务里工具日志不断膨胀,跨会话后又丢掉项目背景、操作习惯和输出要求。TencentDB Agent Memory 试图用同一套分层模型处理这两类压力,并提供了 OpenClaw 插件和 Hermes Gateway 适配。 TencentDB Agent Memory 的 L0-L3 分层架构 L0 到 L3:记忆先…

开源AIHermes

Go 1.27 泛型方法与运行时新特性解读

Go 1.27 interactive tour Go 1.27 预计在 2026 年 8 月发布。Go 官方发布说明明确标注为 DRAFT,所有特性仍可能调整。VictoriaMetrics 工程师 Jesús Espino 写了一篇可运行的 Go 1.27 交互式导览,把官方发布说明里偏简略的描述展开成可以在浏览器里编辑和执行的示例。本文基于官方发布说明…

Diátaxis 文档框架:教程、指南、参考与解释

技术文档经常出现一种结构性故障:教程里塞满概念解释,API 参考页写成操作指南,部署手册又夹杂产品背景。每一段内容单独看都可能正确,读者却很难在需要的时候找到能直接使用的信息。 Diátaxis 是一套专门处理这类问题的技术文档框架。它把文档分为教程(Tutorials)、操作指南(How-to guides)、参考(Reference)和解释(Explan…