GLM-5.3 技术解读:后训练Scaling与涌现攻防能力
Z.ai 发布 GLM-5.3。这个模型沿用 GLM-5.2 的基座,所有提升来自后训练阶段,官方的表述是「Scaling post-training is all we did」。提升集中在两个方向:复杂编码与长程 Agent 任务的大幅进步,以及一份超出团队预期的安全能力答卷。Terminal Bench 3.0 上 GLM-5.3 从 GLM-5.2…
Z.ai 发布 GLM-5.3。这个模型沿用 GLM-5.2 的基座,所有提升来自后训练阶段,官方的表述是「Scaling post-training is all we did」。提升集中在两个方向:复杂编码与长程 Agent 任务的大幅进步,以及一份超出团队预期的安全能力答卷。Terminal Bench 3.0 上 GLM-5.3 从 GLM-5.2…
AirLLM 是一个面向 Hugging Face 大语言模型的推理库,项目的核心目标是降低推理阶段的显存占用。官方 README 给出的典型配置是:70B 模型使用单张 4GB GPU,Llama 3.1 405B 使用 8GB,DeepSeek-V3 671B 使用约 12GB。它依靠分层拆分、按需加载和权重释放完成这件事,模型参数总量与显存容量之间的关…
大模型量化详解:从 FP16 到 Q4KM 该怎么选 本地部署大模型时,你一定会遇到一个问题:该下哪个版本?HuggingFace 上同一个模型往往有十几个文件——Q4KM、Q5KS、Q80、FP16……它们之间到底差多少?选错了要么跑不动,要么浪费内存。 这篇文章把量化的原理、各级别的真实区别、以及不同硬件该怎么选一次讲清楚。 量化在做什么 一个训练好的模…
全球首个 3T 级开源模型:Kimi K3 权重正式开放 2026 年 7 月 27 日,月之暗面(Moonshot AI)在 Hugging Face 开放 Kimi K3 的模型权重。这是目前参数规模最大的开源 AI 模型,总参数量 2.8 万亿(2.8T),官方称其为全球首个开放的 3T 级前沿模型。权重采用修改版 MIT 许可证发布,允许免费下载、部…
Qwen 3.8 神经网络可视化 7 月 19 日,阿里巴巴通义千问(Qwen)团队在 X 平台发布 Qwen3.8,宣称参数规模达到 2.4 万亿(2.4T),并承诺将开放权重(open-weight)。这是 Qwen 家族首次有模型突破万亿参数门槛并具备原生多模态能力。Qwen 团队将其定位为"仅次于 Anthropic Fable 5 的最强模型"。…
推理速度:大模型竞争的下一个主战场 2026年,大模型竞赛正进入一个新维度。从高频量化交易到实时风控,从多Agent协同推理到自动驾驶决策,越来越多对延迟极度敏感的场景开始要求模型不仅"够聪明",更要"够快"。GPT-5.5的68 tokens/s、Claude的71 tokens/s,在传统文本生成场景中或许够用,但在毫秒级决策窗口的工业场景下,这些数字远…