标签: 大模型

清除筛选

Cognition SWE-2:开源基座上的RL后训练

Cognition 发布了新一代编码模型 SWE-2:FrontierCode 1.1 Main 得分 50.0%,距 Fable 5.1 的 50.9% 只差 0.9 个百分点,官方公布的单位任务成本便宜 64%。这次发布的技术细节比「又一个模型发布」多得多:Cognition 第一次把强化学习扩展到万亿参数规模的基座上,并公开了整套训练方法。本文拆解它的…

998 美元训练 3.8B 模型:little-lm 反超 GPT-2 的完整账本

1000 美元能买到什么级别的语言模型?Hugo Vergnes 用一份可复现的答案更新了这个问题的基准线:3.8B 参数的自研模型 little-lm,在 8 张租来的 B200 上训练 43 小时,花费 998 美元,CORE 评测得分 0.384。这个分数比 OpenAI 2019 年动用整个实验室资源训练的 GPT-2 1.5B(0.2565)高出超…

3 元成本 2.31 小时:minimind 把从零训练 LLM 压缩到一张 3090

训练一个大语言模型要花多少钱?行业里公开的数字通常以百万美元计。GitHub 上的开源项目 minimind 给出了另一个量级的答案:单卡 RTX 3090,预训练加微调合计约 2.31 小时,成本约 3.0 元人民币,就能从零训练出一个可以对话的 64M 参数语言模型。这个仓库目前拿下 55,894 star、7,301 fork,采用 Apache-2.…

Heretic 技术解读:28.9k star 的开源工具把大模型去审查做成一键命令行

28.9k star 的 Heretic 把"去掉模型审查"做成了一键命令行工具,产出质量超过了多数人工调参的同类模型 大模型拒绝回答敏感问题的行为,在技术社区里有个专门的名词:safety alignment,安全对齐。2024 年以来,一类名为 abliteration(方向消融)的方法证明,这种拒绝行为在模型内部对应着一个可以定位、也可以直接移除的方向…

智谱确认 Ox Alpha 为 GLM 新迭代:OpenRouter 用量登顶,今晚开源权重

智谱确认 Ox Alpha 为 GLM 新迭代:OpenRouter 用量登顶,今晚开源权重 一周登顶:23.2T tokens 的匿名模型 OpenRouter 本周使用量榜单(数据截至 8 月 25 日)出现了一个此前没有过的情况:排名第一的模型没有厂商署名、没有定价、没有参数规模披露。匿名模型 Ox Alpha 本周处理了 23.2T tokens,排…

本地 LLM 实测:注意力后端、KV Cache 量化与 4-bit 权重的精度漂移

同一份模型权重,在官方演示里对答如流,部署到本地却频繁表现失常:长上下文读到后半段输出开始漂移,量化版本连工具调用都闭合不了。Level1Techs 论坛上一篇带完整数据的受控实验《Why your local LLM feels dumber than it is》把原因指向了推理软件栈:从注意力算子到量化 kernel,每一层都在改变下一个 token…