Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.021 — 2026-07-25
NEWS 约 1 分钟

旧款4090也能跑V4 Flash专用内核

开发者用 Triton 移植专用内核,让两张 Ada 架构 4090D 跑出约 105 tok/s。

IMAGE — r/LocalLLaMA 日榜

新模型能塞进显存,不等于能顺畅运行,就像零件装进旧车,控制程序却只为新车型写好。开发者 iSevenDays 针对 DeepSeek V4 Flash,用 Triton——一种较高层的 GPU 内核编写工具——重写了原本仅支持 Blackwell 架构的 DeepGEMM、sparse-MLA 和 block-scaled FP8 内核,为上一代 Ada 架构补上关键计算路径。

据作者在 Reddit 自述,这套改造通过 vLLM——负责模型执行、显存管理与请求调度的推理引擎——运行在两张 48GB 4090D 上,速度约为 105 tok/s;并将模型压缩至约 IQ2 精度以装入合计 96GB 显存,首次压缩最长可能需要 60 分钟。作者还称,相比其 llama.cpp 配置,vLLM 可提供 262k 上下文和更好的并发能力,平行 Agent 工作流性能提高约 2至3 倍。结果目前来自开发者自测,材料未提供统一测试条件下的独立复现,但它给已有 4090 系显卡部署新模型提供了一条具体路径:缺的未必是算力,而可能只是适配 Ada 的高效内核。


供稿材料 SOURCES — 1

← 返回 2026-07-25 · 开源板块