养慢虾哲学:涡喷发动机——P100(16G)提速LLM突破50+Tokens/s
P100 入场
我把 P104 那张矿卡折腾了三个多月。单卡跑 28B MoE 预填充 55 t/s。后来用 GTX 960 当“PCIe 涡轮增压”推升到了 pp 211,tg 30t/s。这个增压组合也能跑27B Q2量化的模型 tg 8.5tps。“生成速度的物理铁幕依然存在。”写这句话的时候,我其实已经在想下一件事了——有没有办法捅破它?

一、冲破铁幕
要捅破生成速度,只有一个办法:换卡。P104 的 200GB/s 是硬件上限,软件救不了。GTX960 早就该淘汰了,我需要一张显存带宽更大的卡。既然涡轮增压可以有效提升P104的效能,换个满血PCIex16的卡也就顺理成章了。
我机箱里 P104 已经占了第二个 PCIe 槽,GTX960使用的第一个槽位,量了一下,还能能塞下一张全长卡的。散热也不是问题,因为 LLM 推理的特点是显存密集、我很少见到哪张卡在跑推理时能跑到 TDP 上限。P104 跑 MoE 生成的时候,功耗也就 120W 上下,远低于它 180W 的标称值。所以换一张功耗更高的卡,650W的电源应该扛得住。
还有很多卡看图片就知道超厚了,P104已然超厚了,占用了好几个PCI槽位。这次只能找细长条的卡了。
最初想换个P106-100 会好一点,再好一点可能是hx40,最后基本定格到了P100. 我曾经以为和P104是兄弟呢。

这是2016 年的数据中心卡,16GB HBM2,732GB/s 带宽,PCIe 3.0 x16,全长卡,被动散热但功耗可控。三个数字刚好对应 P104 的三块短板:显存小、带宽低、PCIe 残血。P100有P104的3.6 倍的显存带宽,机箱刚好塞得下加长风扇的版本,散热应该扛得住。我下单了。

二、验证
P100 到了,换掉GTX960插上,还得找个原来的RTX520亮机卡插上启动开机,nvidia-smi 认出来了。果然和P104有点渊源,之前装好的驱动是好用的。不过运行llama-server会报错。折腾了半天,最终重新编译了llama.cpp 解决了问题。先测了一个小模型,想验证一件事:P100 到底能不能解 P104 的僵局。
我选了之前跑过的那个 Ternary-Bonsai-27B-Q2——量化后7.2GB 的三值量化稠密模型。老旧组合方案里它的预填充 146、生成 8.5。
P100 单卡跑这个模型:预填充 135,生成 15.15。生成从 8.5 到了 15.15,翻了一倍。看到这个数据我放心了:HBM2 确实能解 P104 的显存带宽死局,我买的P100用起来还不错。
然后我拿 27B Q4 又跑了一遍。这个模型 15.35GB,几乎塞满 P100 的 16GB 显存。Q4 比 Q2 精度高,对带宽的需求也更高。P100 单卡跑下来:预填充 135,生成 15.15——跟 Q2 的数据几乎一样,说明 P100 在显存几乎满载的情况下依然能稳定输出,没有因为接近容量上限而降速。这个稳定性比我想象的要好。
顺手把老方案和中间验证的结果列在一起,看得更清楚:
|
模型 |
配置 |
预填充 (t/s) |
生成 (t/s) |
|
27B Q2(7.2GB) |
P104 + GTX 960 |
146 |
8.5 |
|
27B Q2(7.2GB) |
P100 单卡 |
135 |
15.15 |
|
27B Q4(15.35GB) |
P100 单卡 |
135 |
15.15 |
27B Q2 从 8.5 到 15.15,验证了 P100 能弥补 P104 的不足;27B Q4 几乎塞满 P100 的 16GB 显存,验证了它在高负载下依然稳定;
三、回到 MoE
验证完稠密模型,我把 MoE 搬出来了。之前跑的是 Qwen3.6-28B-A3B——一个裁剪版。这次跑的是同一个基座的完整版:Agents-A1-35B-MoE。更大、更完整、按理说更难跑。
P100 + P104 默认配置跑了一遍:预填充 456,生成 51.89。我又细调了一下 -ts 14/22,手动把层分给两张卡。正常比例应该是11/22,我这里P104 算得快但显存小,多分一点点;P100 算得慢但显存大,少承担一点。跑出来预填充 466,生成 53.55,比默认又高了一点点。
老配置GTX+P104的预填充是 211,生成是 30。我专门把这两组数据放在一起对比了一下:
|
方案 |
模型 |
预填充 (t/s) |
生成 (t/s) |
|
|
P104 + GTX 960 |
28B MoE(裁剪版) |
211 |
30 |
|
|
P100 + P104 |
35B MoE(完整版) |
466 |
53.55 |
两套方案的模型同源:28B 是裁剪版,35B 是完整版。同一个基座,一个剪过,一个没剪。所以这组对比可以理解为:同一模型的“低配版”和“完整版”在两套硬件上的表现差异。
预填充翻了一倍,生成涨了 73%。这个提升不是线性的。P100 的 PCIe x16 和 HBM2 在预填充阶段产生了叠加效应:搬运更快、KV Cache 读写更快,P104 的计算能力被彻底释放了。这回合P100成了一个涡喷发动机,带着P104冲啊。
四、一点感受
换 P100 之后,我最大的感受不是速度变快了,而是不用再想“够不够用”这件事了。
之前用 GTX 960 方案的时候,心里总有一根弦绷着:32K 上下文能不能开?多轮对话会不会炸?量化用 Q4 还是 Q2?每次跑一个新模型,第一反应不是“这模型好不好”,而是“这模型能不能装得下”。
现在不用了。35B MoE 跑 53.5 t/s, 上下文随便开,Q4 量化随便用,多轮对话随便聊。27B Q4 单卡就能跑,显存刚好塞满,15 t/s 的速度足够流畅。我是不是可以多揽点活干了,哈哈哈哈。
GTX 960 补的是搬运短板,P100 补的是带宽和显存短板。各补各的,凑出一条完整的推理链路。从 211/30 到 466/53.5,换了一张卡,多花了一点点钱。这些东西跟广大条友的配置比起来不算什么,我也是努力向大家看齐,逐步进入本地部署小康水准,免得拖大家的后腿啊。
16+8 >24G显存部署大模型,#养慢虾#可以很舒服了,可以支持多个agent干活了。
我的本地部署#养慢虾#演化路径可以参看:
养慢虾哲学:8GB显存跑27B大模型——P104 8G不够,再加2G试试
养慢虾哲学:无心插柳— GTX 960 竟成 P104 矿卡的“PCIe 涡轮增压”
更多推荐



所有评论(0)