标签: 大模型

清除筛选

大模型量化详解:从 FP16 到 Q4_K_M 该怎么选

大模型量化详解:从 FP16 到 Q4KM 该怎么选 本地部署大模型时,你一定会遇到一个问题:该下哪个版本?HuggingFace 上同一个模型往往有十几个文件——Q4KM、Q5KS、Q80、FP16……它们之间到底差多少?选错了要么跑不动,要么浪费内存。 这篇文章把量化的原理、各级别的真实区别、以及不同硬件该怎么选一次讲清楚。 量化在做什么 一个训练好的模…

Qwen3.8 发布:2.4T 参数、原生多模态、开放权重承诺

Qwen 3.8 神经网络可视化 7 月 19 日,阿里巴巴通义千问(Qwen)团队在 X 平台发布 Qwen3.8,宣称参数规模达到 2.4 万亿(2.4T),并承诺将开放权重(open-weight)。这是 Qwen 家族首次有模型突破万亿参数门槛并具备原生多模态能力。Qwen 团队将其定位为"仅次于 Anthropic Fable 5 的最强模型"。…

小米MiMo万亿参数模型推理速度突破1000 tokens/s

推理速度:大模型竞争的下一个主战场 2026年,大模型竞赛正进入一个新维度。从高频量化交易到实时风控,从多Agent协同推理到自动驾驶决策,越来越多对延迟极度敏感的场景开始要求模型不仅"够聪明",更要"够快"。GPT-5.5的68 tokens/s、Claude的71 tokens/s,在传统文本生成场景中或许够用,但在毫秒级决策窗口的工业场景下,这些数字远…

MiniMax M3 发布:1M 上下文 + 原生多模态 + 前沿 Coding

MiniMax M3 Benchmark MiniMax 今日正式发布 M3 模型。这是一个同时具备前沿 Coding 能力、百万级上下文和原生多模态的模型——国内第一个,也是目前全球唯一达成这一配置的开源模型。 M3 采用 MiniMax 自研的 MSA(MiniMax Sparse Attention)稀疏注意力架构,最高支持 1M 上下文窗口。在 10…

DeepSeek 拟融资超 500 亿,6 月将发布 V4.1 更新

DeepSeek 首轮外部融资:目标超 500 亿 The Information 援引两名直接知情人士消息称,DeepSeek 正推进成立以来的首轮外部融资,目标募集规模超过 500 亿元人民币。若本轮融资顺利落地,将刷新中国 AI 公司单笔融资纪录。 核心信息 融资规模与结构 目标总融资额超 500 亿元(约合 70 亿美元) 创始人梁文锋计划在此轮中顶…

DeepSeek-V4 正式上线:1M 上下文标配,Flash 输入 0.2 元/百万 token

DeepSeek 今日正式发布 V4 系列模型预览版,同步开源。两个版本——V4-Pro 和 V4-Flash——均支持 1M 上下文长度,并在 Agent 能力上进行了专项优化。 V4-Pro 与顶级闭源模型评测对比 两个版本,两个定位 V4-Pro 是性能旗舰。在数学、STEM、竞赛型代码的评测中,V4-Pro 超越了当前所有已公开评测的开源模型,成绩追…