Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.087 — 2026-09-29
NEWS 约 1 分钟

Naive N0.5 Flash押注百万上下文

309B MoE模型用稀疏注意力挑战百万上下文,面向编码与AI研发。

IMAGE — r/LocalLLaMA 日榜

让 AI 一次读完整个大型代码库,难点不只是“装得下”,还要避免每生成一个词都回头通读全部内容。Naive-N0.5-Flash 是面向编码与 AI 研发的开放权重模型,原生支持 100 万词元上下文——也就是一次可接收约百万个文本单位。它采用 MoE(混合专家)架构:总参数达 309B,但每次生成仅激活 15.5B,借此控制实际计算量。

它最具体的取舍,是全网不设完整注意力层。48 层中,39 层使用 Sliding-Window Attention,让每个词元主要查看附近 128 个词元;另有 9 层使用 DeepSeek Sparse Attention,从完整历史中筛选最相关的 2,048 个词元参与主要计算。开发者称模型完成了 3.25T 词元的多阶段训练,并公开了 MIT 许可的权重与推理代码。不过,百万上下文只是容量上限,不等于模型能准确利用每处信息;现有材料也未给出可核对的具体评测成绩,实际编码与长文本能力仍待独立测试。


供稿材料 SOURCES — 1
01
Naive-N0.5-Flash - 309B-A15.5B r/LocalLLaMA 日榜 · NEWS
原文 ↗

← 返回 2026-09-29 · 开源板块