Heretic 技术解读:28.9k star 的开源工具把大模型去审查做成一键命令行
28.9k star 的 Heretic 把"去掉模型审查"做成了一键命令行工具,产出质量超过了多数人工调参的同类模型 大模型拒绝回答敏感问题的行为,在技术社区里有个专门的名词:safety alignment,安全对齐。2024 年以来,一类名为 abliteration(方向消融)的方法证明,这种拒绝行为在模型内部对应着一个可以定位、也可以直接移除的方向…
28.9k star 的 Heretic 把"去掉模型审查"做成了一键命令行工具,产出质量超过了多数人工调参的同类模型 大模型拒绝回答敏感问题的行为,在技术社区里有个专门的名词:safety alignment,安全对齐。2024 年以来,一类名为 abliteration(方向消融)的方法证明,这种拒绝行为在模型内部对应着一个可以定位、也可以直接移除的方向…
Stealing Reasoning Traces from Proprietary LLM APIs 当 Anthropic、OpenAI 和 Google 将推理模型的内部思维链隐藏起来时,开发者大多认为那些加密数据块是安全的。来自 ELLIS Institute Tübingen、Max Planck Institute 和 Snyk 的研究团队证明,…
大模型量化详解:从 FP16 到 Q4KM 该怎么选 本地部署大模型时,你一定会遇到一个问题:该下哪个版本?HuggingFace 上同一个模型往往有十几个文件——Q4KM、Q5KS、Q80、FP16……它们之间到底差多少?选错了要么跑不动,要么浪费内存。 这篇文章把量化的原理、各级别的真实区别、以及不同硬件该怎么选一次讲清楚。 量化在做什么 一个训练好的模…
小米正式开源 MiMo-V2.5 系列模型,采用 MIT 协议,支持免授权商业部署、持续训练和微调。该系列包含两款模型:MiMo-V2.5-Pro 专注于复杂 Agent 和代码任务,MiMo-V2.5 为原生全模态模型。两款模型均支持 1M token 上下文窗口。 Benchmark 对比分析 Benchmark Results 官方公布的 benchm…