英伟达 CMP 170HX 破解:矿卡的三道硬件限制为何能被软件绕过

一张 2021 年面向加密货币挖矿的 NVIDIA CMP 170HX,最近重新进入 AI 硬件讨论。亚利桑那州立大学研究者 Jon Pry 在 Zenodo 发布论文,分析了这张卡的 GPU 安全协处理器,并展示了一条从主机侧触发 Falcon HS 模式漏洞的解锁路径。论文给出的结果包括:计算吞吐提升约 31 至 62 倍、可见显存容量提升 8 倍、PCIe 链路提升 2 倍。[1]

NVIDIA CMP 170HX 显卡资料图

CMP 170HX 原本被限制了什么

CMP 170HX 使用 GA100 核心和 HBM2e 显存封装。它与 A100 处在同一代数据中心 GPU 产品体系中,出厂定位却是计算专用矿卡。论文把限制归纳为三个商业轴:SM 数学吞吐被压到约 1/32,显存容量从物理封装对应的 80 GB 限制到 10 GB,PCIe 链路从 Gen4 限制到 Gen1。[1]

这三个数字描述的是论文研究对象的设计关系,不等于每一张市售卡都具有相同的显存颗粒配置。公开资料中的 CMP 170HX 还存在 8 GB 和 10 GB 版本,社区工具也按这两类配置分别选择解锁 profile。[3][5]

CMP 170HX 显存堆叠资料截图

漏洞怎样穿过安全边界

这条路径没有破解 NVIDIA 的签名密钥,也没有直接改写 OTP 熔丝。论文的切入点是 HS Falcon 安全协处理器执行签名验证时的内存安全问题。[1]

第一处问题是栈保护参考值放在可写内存中。溢出数据能够触及这份参考值,攻击者就能在覆盖返回信息的同时伪造校验所需的数据。第二处问题出现在 DMA 传输:主机提交的结构体控制了传输长度,目标缓冲区却没有完成边界检查。两处问题叠加后,攻击者可以把受控数据送入 HS 模式的执行环境。[1][2]

研究者随后建立了离线微码模拟器。由于该执行环境没有并发、无中断,也不使用动态内存分配,溢出时的内存布局可以被精确复现。这样构造出的 payload 能通过受害函数自身的 canary 检查,并把执行流带到后续代码链。[1]

解锁动作改的是寄存器权限

获得 HS 权限后,研究团队修改特权级掩码,让原本受保护的寄存器可以写入。随后再调整 SM 速率、显存几何配置和 PCIe 相关寄存器。[1][2]

这解释了“物理熔丝锁定”为什么仍然可能被软件绕过:熔丝状态本身没有被改变,变化发生在读取熔丝并执行限制的固件路径上。对这三个研究轴来说,产品差异由固件执行结果决定,寄存器权限一旦被打开,限制就有了被重写的空间。[1]

论文同时记录了没有成功解锁的方向,包括 PCIe Gen3、片上 ECC 和运行时 HBM 重定时。研究者没有据此断言这些方向绝对不可破解,只说明现有研究还没有理解相关熔丝和初始化流程。[1]

公开工具能做到什么

论文发布后,社区出现了公开的 cmpunlocker 工具。当前 README 列出的运行条件包括 Linux x86-64、root 权限、CMP 170HX、nvidia-open 610.43.0x 驱动、匹配的内核头文件,以及关闭 Secure Boot。工具文档列出的工作状态是:完整 SM 计算吞吐、8 GB 卡对应 64 GB 显存、10 GB 卡对应 40 GB 显存,以及 PCIe Gen2。[3]

社区解锁环境截图

这组公开工具数据与新闻标题里的“最高 80 GB”并不矛盾,但它们代表的证据层次不同。80 GB 是论文和社区实验讨论中的上限;公开工具 README 给出的是更具体的 profile 和工作状态。不同批次的 HBM 颗粒、卡片缺陷分布、驱动版本和散热条件,都会影响最终结果。[1][3][5]

算力数字应该怎样看

新闻报道把解锁后的 FP32 结果写成 94 TFLOPS,同时又写成约 31 倍提升,这两个数字无法在同一测试口径下同时成立。论文摘要采用的是“计算吞吐约提升 31 至 62 倍”的概括,因此本文不把 94 TFLOPS 当作论文的确定结论。[1][2]

社区公开测试中,解锁后的 FP32 结果大致落在 12 TFLOPS 级别,和 0.39 TFLOPS 的原始 FMA 限制相比,数量级变化清楚可见。[4][5] 这里仍要区分测试类型:FMA、非 FMA、Tensor Core、FP32 和 FP64 的结果不能直接互换,单张截图也无法代表所有工作负载。

170HX 性能测试截图

这张矿卡适合谁

解锁后的 CMP 170HX 具备高显存带宽和更大的可见显存空间,对本地推理、图像生成和带宽受限的计算任务有吸引力。它的使用门槛也很明确:需要 Linux 驱动和内核环境,安装过程会改动 NVIDIA 内核模块,Secure Boot 需要关闭,冷启动和回滚都属于实际运维成本。[3][4]

“显存变大”也不等于“整张卡变成 A100”。A100 的产品级能力还涉及 ECC、NVLink、PCIe 代际与通道宽度、驱动支持、可靠性验证和长期负载表现。论文只确认三个限制轴被软件路径绕过,其他方向仍存在边界。[1][4][5]

二手市场风险

公开报道显示,相关消息传出后,国内二手报价从数百元区间上升到数千元区间,海外也出现更高报价。[2] 报价变化属于市场信息,不能作为解锁成功率或长期稳定性的证明。

目前更稳妥的购买判断至少包含四项:确认卡的 8 GB 或 10 GB 版本,确认 HBM 颗粒和对应 profile,确认卖家提供的是原卡还是已经改过驱动的卡,确认自己能承担服务器级散热、Linux 驱动和回滚成本。对没有实机验证条件的人来说,溢价后的“破解矿卡”并不等于低风险的 A100 替代品。[3][4][5]

论文 DOI:10.5281/zenodo.20916112

Sources

[1] https://zenodo.org/records/20916112 [2] https://finance.sina.com.cn/tech/roll/2026-08-03/doc-inikzqsf4659769.shtml [3] https://github.com/amoghmunikote/cmpunlocker [4] https://niconiconi.neocities.org/tech-notes/nvidia-cmp-170hx-review [5] https://github.com/abobasixseven/unlock-cmp-170hx