深度专题 FEATURES — 2
12GB显存也能跑125B MoE
125B MoE 在12GB显卡上跑到约20 tok/s,但真正的账单是64GB内存、SSD卸载与激进量化。
K2 Horizon 7B凭什么越级
7B跑出27B级榜单观感,但内存账单、实测证据和开放程度都要另算。
速览 BRIEFS — 8
REPO
VoxCPM2绕过Tokenizer做语音
VoxCPM2跳过音频编号环节,直接生成连续语音,还能设计和克隆声线。
NEWS
llama.cpp为安培卡开了性能支线
llama.cpp 社区分支专攻 RTX 30 系,试图让存量显卡跑本地模型更快。
NEWS
Maple把20B MoE压到1B激活
llama.cpp拟接入Maple:200亿参数中每次只激活约10亿,瞄准低成本本地推理。
NEWS
Voodoo动态量化转向MIT开源
Voodoo 将动态量化工具改为 MIT 开源,让社区能自行制作、比较和改进激进压缩方案。
REPO
LibreChat连续两日升温
单日新增286星,LibreChat显示统一管理多模型与Agent的需求仍在升温。
REPO
群体智能引擎单日新增560星
MiroFish 单日新增 560 星:让大量虚拟角色互动,在数字沙盒里推演“如果”。
NEWS
84GB工作站卡补上本地部署新档位
RTX PRO 5500 配备 84GB GDDR7,为较大模型增加单卡桌面部署选择。
NEWS
Claude Code远程会话加入Fast模式
Claude Code 远程会话支持 Fast 模式,云端与自托管执行的响应体验更一致。