把一座大型代码库连同说明文档一次交给 AI,它能否既装得下,又完成编程、多步分析和工具调用?InclusionAI 的 Ling 3.1 Flash 正面瞄准这个场景。它是一款混合推理模型——可在直接回答和较长推理之间切换;总参数约 560B,但每个 token 只激活约 25B 参数。这里采用的是混合专家架构:模型像一个大型专家团队,每次只叫少数成员处理任务,以减少单次计算量。
最醒目的卖点是最高 100 万 token 上下文,也就是一次可接收约一百万个文本基本单位,足以容纳很长的文档或代码材料。不过,容量大不等于能可靠找到并运用每一处信息。现有材料也有一处明显出入:Reddit 帖标题称最高 100 万 token,而 Vercel AI Gateway 页面标注提示词与回答共享 262K 上下文窗口。另据 Reddit 帖标题,该模型将先免费试用两周、随后开源;目前材料没有提供编码成绩或开源时间表,因此这些看点仍需等待正式发布信息确认。