Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.030 — 2026-08-03
NEWS 7 信源 约 1 分钟

DeepSeek V4 Flash本地运行继续补课

llama.cpp修好工具调用,MI50、RTX 3090与CPU卸载实测补齐本地部署路线。

IMAGE — r/LocalLLaMA 日榜

本地跑大模型,不只是把权重下载下来就完事,更像把一件超大行李塞进不同车型:能否装下、跑得多快,还要看推理引擎和内存怎么分工。常用本地推理引擎 llama.cpp 已合入 DeepSeek V4 Flash 0731 的工具调用修复——工具调用就是让模型按格式请求搜索、读文件等外部程序。Reddit 用户 kwizzle 称,修复前遇到循环输出和异常行为,更新后暂未再现。

社区实测也补齐了硬件地图。Kamal965 报告,90.9GB 的 UD-IQ2_M 量化版可完整放入三张 32GB MI50,生成稳定在约 15—16 token/s;另一位用户用 RTX 3090 24GB 加 128GB DDR5,通过 CPU 卸载——把部分模型移到系统内存——跑 UD-IQ3_S,称速度约 12.5 token/s。双 RTX 3060 加 96GB 内存的报告则约为 4.5 token/s。换句话说,从老款计算卡到消费级显卡都有路径,但这些均为用户自报、配置与测试方法不一,不能直接横向比较。


供稿材料 SOURCES — 7

← 返回 2026-08-03 · 开源板块