英伟达神卡破解后最高飙升到80G显存

知识点总结

摘要

2021年英伟达发布过一张“阉割版A100”——专供挖矿的 CMP 170HX,核心芯片跟数据中心神卡 A100 是同一颗 GA100,却被固件锁得只剩十分之一实力。2026年,硬件安全研究者用一个固件级漏洞把它的算力和显存几乎全部解封:FP32 提升 31 倍、FP64 提升近 60 倍、显存从 10G 冲到理论 80G。消息一出,二手市场价格应声上涨。这篇文章把“这张卡为什么特殊”“破解到底靠不靠谱”“合理价格该是多少”讲清楚,最后说一句心里话:我也想收一张,价格合适的话。

这张卡什么来头

CMP(Cryptocurrency Mining Processor)系列是英伟达专门为挖矿场景推出的产品线,CMP 170HX 是其中的旗舰型号,2021年9月上市。它的核心不是随便找了颗芯片糊弄事——用的正是当时英伟达最顶级的数据中心加速卡 A100 同款 GA100(Ampere 架构)核心。

但英伟达不希望一张矿卡抢了 A100 的生意,于是在出厂固件里做了大量阉割:TF32 算力从 A100 官方的 156 TFLOPS 砍到只剩 15 TFLOPS 左右;PCIe 链路直接锁死在 Gen1 x4(正常显卡起步都是 x16);显存也只开放了 10GB(也有 8GB 版本),可它物理上明明有 80GB。

说得更直白一点:CMP 170HX 本质上是英伟达把那些没能通过 A100 品控测试的“边角料”芯片重新封装利用的产物——芯片是良品率淘汰下来的次品,但物理规格跟顶级卡完全一致,只是被软件锁死了大半实力。挖矿寒冬之后,这批卡沉寂了几年,直到 2026 年才因为一篇论文重新翻红。

为什么说它“神”:一次教科书级的固件破解

真正让 CMP 170HX 翻身的,是一篇题为《A Canary in the Crypto Mine: Defeating Stack Protection in a GPU Secure Coprocessor》的安全研究论文。研究者没有去改固件本身——显卡内部有独立处理器专门校验固件数字签名,改了也跑不起来——而是找到了固件里一个真实存在的漏洞。

简单说,英伟达固件里有一段接收 DMA 数据的函数,没有限制用户输入长度,存在经典的缓冲区溢出。更致命的是,英伟达的编译工具链犯了一个低级错误:本该用来防溢出的 Stack Cookie(俗称 canary)被链接器放在了可写全局数据段的最顶端——正好卡在任何向上溢出的路径中间。这意味着攻击者只要用同一个值填满整段内存,就能让 canary 校验和返回地址同时被覆盖成同一个值,“防护”形同虚设。借着这个漏洞,研究者拿到了固件的高权限,进而改写了控制显存容量、算力上限、PCIe 带宽的“影子寄存器”。

论文给出的实测数据相当惊人:

项目 原厂值 解锁后 提升倍数
FP32 算力 393 Gflop/s 约 12,233 Gflop/s ~31×
FP64 算力 197 Gflop/s 约 11,668 Gflop/s ~59×
TF32 算力 6,242 Gflop/s 约 94,103 Gflop/s(~94 TFLOPS) ~15×
显存容量 10GB 80GB
PCIe 链路 Gen1 x4 Gen2 x4 2倍带宽

需要澄清两个容易被传成“更夸张”的细节:第一,PCIe 固件解锁实测只是从 Gen1 升到了 Gen2,位宽仍然是 x4,并没有变成 x16——想要 x16 的物理带宽,得额外手工焊接约 24 颗 AC 耦合电容,这是一项独立于固件解锁的硬件改造,难度和风险都高得多,普通人不建议尝试。第二,80GB 显存“物理存在”这件事已经通过哈希写入回读验证确认为真,但在原厂默认的显存刷新间隔下,跑满 80GB 会报错,只有用其中 40GB 才能干净跑完;把刷新频率调高可以把错误清零,代价是吞吐量下降约 32%。也就是说“80G”不是虚标,但“稳定拿满 80G 跑”需要额外调参,不是解锁完就能无脑满血使用。

另外,由于不同批次卡片实际焊接的显存颗粒密度不同,解锁后有人能到 80GB,也有人只能到 40GB 或 64GB——这不是破解方法有差异,而是硬件本身天生不一样。破解生效的方式也很有意思:控制寄存器是“影子寄存器”,只要断电重启就会恢复出厂设置,所以每次开机都需要重新走一遍解锁流程,好处是完全可逆,不存在“改坏了回不去”的风险。

面向人群

这张卡不是给普通用户“配一台游戏主机”用的——它没有任何显示输出接口,纯粹是计算卡。真正会关心它的,是这几类人:

  • 想低成本搭建本地 AI 推理/训练环境的个人开发者和小工作室,预算有限但又想摸到接近 A100 规格的算力;
  • 对固件安全、漏洞利用链感兴趣的硬件安全研究者;
  • 手头有旧平台、愿意折腾 Linux 驱动和内核模块编译的硬核玩家。

如果你追求开箱即用的稳定生产环境,或者完全不熟悉 Linux 命令行和硬件维修,这张卡目前还不太适合你——它终究是一张实验性质很强的“民间改造卡”。

价格:千万别追高,这是理性判断而不是劝退

好消息是,这张卡目前依然便宜——二手市场上 A100 正品要好几万元,CMP 170HX 只要几千元。但坏消息也很直接:消息扩散之后,价格已经在明显上涨。

破解消息传开之前,二手渠道(以海外 eBay 个人卖家为参考)成色正常的 8GB 版大约 250-450 美元(约¥1,800-3,200),10GB 版大约 350-600 美元(约¥2,500-4,300)。而截至 2026 年 7 月,闲某鱼上打着“可解锁 80GB”旗号的卡,报价已经涨到 ¥4,000-8,000,相当于炒作前价格的 2-4 倍;甚至有人在社交媒体上晒出 64GB 解锁版卡以约 1,170 美元卖出的截图。

给一个理性的出价参考:合理上限大致是炒作前历史基准价的 1.2-1.5 倍,超过这个区间基本就是在为“话题热度”买单,而不是为硬件本身买单。更重要的是,一定要让卖家提供解锁后长时间满载压力测试的记录,而不是仅凭一张 nvidia-smi 截图里的容量数字——毕竟能不能显示 80GB 和能不能稳定用满 80GB,是两回事。

顺带说一句选型建议:如果预算允许,优先选 10GB 版而不是 8GB 版。10GB 版 CUDA 核心数量多约 25%,显存位宽也更宽(推测多焊了一颗 HBM2e 堆栈),论文里验证过的“10GB→80GB”解锁数据用的也正是 10GB 版卡,8GB 版目前还没有同等质量的独立验证——换句话说,10GB 版解锁后摸到 80GB 的把握更大。

另外一个更省钱的思路:与其花高价买别人“已解锁”好的卡,不如买原厂未改版的卡自己动手解锁。原因很实在——已解锁卡的报价里,包含了别人的破解人力成本、风险溢价和当下的炒作热度,价差可能远超自己动手所花的时间;而且软件层面的解锁工具改的是开源内核模块,源码是可以自己审查的,买原厂卡回来一步步操作,每一步做了什么都清楚,出问题也好判断到底是硬件本身有问题还是解锁哪一步出了岔子。真正不可逆的只有 PCIe x4 转 x16 的手工焊接,这一步完全可以先不做,等软件解锁验证稳定之后再考虑。

如果你手头的老平台跟我一样是入门级配置(比如 i3 级 CPU、8G 内存、450W 电源),装这张卡之前也得提个醒:它没有显示输出接口,需要另配一张独立显卡管显示;TDP 250W,一张卡就可能让老电源逼近上限,电源基本是必换项;8G 内存跑 Linux + CUDA 驱动也会比较紧张,建议顺手加到 16-32GB。这些都不是这张卡的缺点,只是提醒大家算总账的时候把这部分成本也算进去,不要只盯着显卡本身的价格。

我的看法

说实话,这类“良品率淘汰芯片+固件阉割”的产品,本来就是半导体行业心照不宣的惯例,CMP 170HX 只是恰好被一群硬件安全研究者盯上、又恰好赶上了这一波 AI 算力热度,才被顶到聚光灯下。技术本身很精彩——一个编译工具链的低级失误,被人一路顺藤摸瓜摸到了寄存器级别的控制权,这是硬核意义上的“漂亮仗”。但技术精彩不代表这张卡现在就值得追高价买——它没有 ECC 保护,长期稳定性还没有大样本验证,说到底还是一块实验性质浓厚的硬件,别被“80G显存”这几个字冲昏头。

也正因为它现在还没被完全炒到离谱的价位,我自己也想收一张——最好是 10GB 版、成色正常、卖家愿意提供解锁后压测记录的那种,价格合适就出手,不追高。如果你手上正好有一张准备出的 CMP 170HX,或者认识靠谱的卖家,欢迎联系我聊聊,价格公道就好。