标签: 大模型

清除筛选

GLM-5.3 技术解读:后训练Scaling与涌现攻防能力

Z.ai 发布 GLM-5.3。这个模型沿用 GLM-5.2 的基座,所有提升来自后训练阶段,官方的表述是「Scaling post-training is all we did」。提升集中在两个方向:复杂编码与长程 Agent 任务的大幅进步,以及一份超出团队预期的安全能力答卷。Terminal Bench 3.0 上 GLM-5.3 从 GLM-5.2…

Qwen3.8-Max 技术解读:长程智能体如何持续交付

Qwen3.8-Max 的发布重点落在长程任务。Qwen 官方将它定义为 Qwen-Max 系列首次开放权重的模型,参数规模为 2.4 万亿,激活参数 950 亿,基于 Qwen3.5 的架构基础构建,现已通过 QwenCloud 提供 API。官方公告还列出了 Hugging Face 和 ModelScope 的权重发布安排。 这组信息的技术含义,可以从…

AirLLM:4GB 显存运行 70B 模型的分层推理

AirLLM 是一个面向 Hugging Face 大语言模型的推理库,项目的核心目标是降低推理阶段的显存占用。官方 README 给出的典型配置是:70B 模型使用单张 4GB GPU,Llama 3.1 405B 使用 8GB,DeepSeek-V3 671B 使用约 12GB。它依靠分层拆分、按需加载和权重释放完成这件事,模型参数总量与显存容量之间的关…

大模型量化详解:从 FP16 到 Q4_K_M 该怎么选

大模型量化详解:从 FP16 到 Q4KM 该怎么选 本地部署大模型时,你一定会遇到一个问题:该下哪个版本?HuggingFace 上同一个模型往往有十几个文件——Q4KM、Q5KS、Q80、FP16……它们之间到底差多少?选错了要么跑不动,要么浪费内存。 这篇文章把量化的原理、各级别的真实区别、以及不同硬件该怎么选一次讲清楚。 量化在做什么 一个训练好的模…

Qwen3.8 发布:2.4T 参数、原生多模态、开放权重承诺

Qwen 3.8 神经网络可视化 7 月 19 日,阿里巴巴通义千问(Qwen)团队在 X 平台发布 Qwen3.8,宣称参数规模达到 2.4 万亿(2.4T),并承诺将开放权重(open-weight)。这是 Qwen 家族首次有模型突破万亿参数门槛并具备原生多模态能力。Qwen 团队将其定位为"仅次于 Anthropic Fable 5 的最强模型"。…

小米MiMo万亿参数模型推理速度突破1000 tokens/s

推理速度:大模型竞争的下一个主战场 2026年,大模型竞赛正进入一个新维度。从高频量化交易到实时风控,从多Agent协同推理到自动驾驶决策,越来越多对延迟极度敏感的场景开始要求模型不仅"够聪明",更要"够快"。GPT-5.5的68 tokens/s、Claude的71 tokens/s,在传统文本生成场景中或许够用,但在毫秒级决策窗口的工业场景下,这些数字远…