让手机里的小模型独自闯进一个规则、目标都不明说的游戏,它很容易卡住;每一步都求助云端大模型,又慢又贵。ARC-AGI-3正是这类评测:Agent要靠探索推断目标、理解环境并规划行动。量子位报道,Mostik让手机端4B Qwen-3.5与云端753B GLM-5.2分工,尝试在能力与成本之间找一条中间路线。
它没有让两个模型用文字“接头”,而是训练了一座小型“桥”,把GLM读取题目时形成的隐藏状态——模型尚未说出口的内部计算结果——直接交给Qwen。两个模型本身都被冻结;GLM只读取输入,不逐字生成,最终答案全部由Qwen写出。团队称,这套组合让4B模型弥补了与753B模型约50%的性能差距,准确率提高25%,在更难的题目子集上提升至2倍,同时把大模型侧推理成本压到约二十分之一。
这项结果值得看的地方,不只是小模型“借力”大模型,而是异构模型或许能跳过低效的文字传话,直接交换更丰富的信息。不过比赛尚未结束,Mostik暂未公开具体技术细节;上述效果均为团队披露,能否迁移到更多模型、任务和真实业务,仍待验证。