RTX 3080 功耗墙 11 档实测:140W 之前免费,130W 开始还债
本文最后更新于 2026年9月19日 晚上
家里那台双 3080 推理机,闲时风扇 50% 转速嗡嗡响。想让它安静点,结果一路碰壁:nvidia-smi 不支持调风扇,NVML 驱动库里压根没有 nvmlDeviceSetFanSpeed 这个符号——消费级卡的软件风扇控制被 NVIDIA 从驱动层面移除了,CoolerControl、nvidia-settings 这些方案全部依赖它,无一幸免。
软件降噪音这条路死了,退而求其次:功耗墙。功率压下来,温度至少能低几度,电费也能省点。但代价是什么?大模型推理对 GPU 频率敏感,功耗墙压太狠速度会崩。掉多少、从哪一档开始掉,没有现成答案——那就自己测。
测试设计:三个坑先排掉
设备:2 × RTX 3080 20G,llama.cpp server 跑 Qwen3.6-35B-A3B 的 Q4_K_XL 量化(MTP 投机解码开启),模型热加载常驻显存。功耗墙 200W 到 100W,步进 10W,共 11 档;每档同一个问题测 3 次取平均,max_tokens=400。
方法听起来简单,实际先踩了三个坑,不排掉数据全是假的:
坑一:KV cache 让首测虚高 3 倍。 同一个问题重复发,llama.cpp 的 prompt 缓存全命中,第一次测出 163 tok/s,后面同条件只剩 140 出头。结论:同题多次测,第一次的数字直接扔。
坑二:并发任务悄悄偷走 2/3 的速度。 有一轮测出 46 tok/s,查了半天不是功耗墙的锅——是另一个端口的推理任务在同时跑,GPU 被分走了。测试前必须确认两卡利用率归零。
坑三:llama-server 的计时字段不可信。 热缓存下 usage 里的 completion_time 恒为 0,算速度会除零。老老实实用端到端 wall-clock 计时。
另外每档换完功耗墙先发一个 10-token 的小请求把时钟拉起来,不计入成绩——不然冷时钟会让第一轮数据系统性偏低。
数据:一张表和一条曲线
11 档全部测完,每档 3 次的均值如下:
| 功耗墙 | 速度 (tok/s) | 相对 200W | GPU1 SM 时钟 |
|---|---|---|---|
| 200W | 142.8 | 基线 | 1965 MHz |
| 190W | 142.8 | ±0 | 1965 MHz |
| 180W | 146.2 | +2% | 1980 MHz |
| 170W | 143.2 | ±0 | 1980 MHz |
| 160W | 143.4 | ±0 | 1965 MHz |
| 150W | 139.3 | -2% | 1965 MHz |
| 140W | 137.1 | -4% | 1950 MHz |
| 130W | 125.7 | -12% | 1710 MHz ↓ |
| 120W | 96.8 | -32% | 1710 MHz |
| 110W | 73.0 | -49% | 1710 MHz |
| 100W | 53.2 | -63% | 1710 MHz |

三个区段一眼分明:
- 200W~160W:五档全部落在 ±2% 的噪声带里。这个区间功耗墙形同虚设——推理负载本身吃不满 200W。
- 140W~150W:速度开始轻微下滑,-2% 到 -4%。两卡实际功耗从 340W 降到 280W 左右,换来几乎无感的损失。
- 130W 以下:断崖。130W 这一档,GPU1 的 SM 时钟从 1965 直接锁到 1710 MHz——这不是巧合,是功耗预算低于满载需求后驱动强制降频。再往下每降 10W 速度线性掉一截,100W 时只剩 53 tok/s,腰斩再打八折。
结论
140~150W 是这台机器的无损甜点。 日常固定 150W:速度损失 2%,双卡省电约 60W,温度降 2~3℃。跑重活的时候也不用心疼——推理负载峰值也就 190W,150W 墙只在上长任务时才真正约束得到。
而最初的目标——降噪——实测宣告失败:11 档功耗墙下风扇转速全程钉死 50%。RTX 3080 的风扇曲线要到 45℃ 以下才肯降速,而功耗墙压到 100W 时核心温度还有 52℃。想让这张卡安静,软件已经无解,剩下清灰、换硅脂、加机箱风扇这些物理手段。
这次实测的数据和踩坑记录已经回填到运维技能的参考文档里,下次调功耗墙不用再交学费。
附:复现要点
1 | |
计时口径:端到端 wall-clock;每档预热后测 3 次取均值;测前确认 GPU 利用率归零。