标签: Transformer

清除筛选

960个参数跑通Transformer:从零理解大模型

如果有人问你"大模型有几千亿参数,参数到底是什么",大多数回答要么是"就是权重矩阵"(等于没说),要么丢一堆公式把你吓跑。 这篇从零开始,用一个 960 个参数的迷你 Transformer 把这件事讲透。能跑,有真实输出,不灌水。 参数是什么:不是旋钮,是"话语权" 想象模型在回答一个问题:猫喜欢吃? 模型内部有几百亿个"小评委",每个评委只管一件具体的事…

月之暗面改了 Transformer 的残差连接,48B Kimi Linear 跑出约 1.25 倍等效算力优势

月之暗面改了 Transformer 的残差连接,48B Kimi Linear 跑出约 1.25 倍等效算力优势 月之暗面最近放出的 Attention Residuals 技术报告,把注意力放回到了 Transformer 里一块更基础的结构:残差连接。它关心的重点,不是参数量和上下文长度,而是层与层之间的信息怎么传。 论文的核心做法,是把标准残差里“前…