Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.033 — 2026-08-06
NEWS 约 1 分钟

5090推理降功耗几乎不掉速

实测RTX 5090限功耗至480W,解码仅慢2.1%,更适合客厅本地推理

把高性能显卡放在客厅跑大模型,速度固然重要,但热风和风扇声也很难忽略。一位 Reddit 用户测试发现,把 RTX 5090 的功耗上限从 600W 调到 480W,Qwen3.6-27B-Q6_K 的解码速度仅从每秒 61.5 个词元降至 60.2 个,损失约 2.1%。解码就是模型逐个生成新词元的阶段,直接决定聊天时文字“吐”得多快。

代价主要出现在预填充——模型并行读取整段提示的阶段。按其表格,速度从每秒 3242.9 降至 2863.4,约慢 11.7%,但作者认为这一阶段本来就很快。继续降到 450W 后,解码损失扩大到 4.2%,说明 480W 更接近性能与功耗的折中点。作者称限功耗明显减少了噪声和热量;不过这只是单台机器、单个模型的一次快速测试,相关效果尚未独立核查。


供稿材料 SOURCES — 1

← 返回 2026-08-06 · 开源板块