多张GPU一起干活,常会卡在“互相传话”上:数据包越小、交换越频繁,等待越明显。奇异摩尔与壁仞科技在WAIC 2026展示了一套IBGDA方案,让国产GPU直接向国产RDMA网卡发起通信,绕过CPU中转。RDMA是一种尽量避开操作系统多层处理、直接读写远端内存的通信方式;这次演示更进一步,减少了数据在GPU、CPU和网卡之间来回搬运。
据量子位报道,这套Demo采用奇异摩尔单通道400G RDMA ASIC引擎和壁仞GPU。在All-to-All——多张卡彼此交换数据——测试中,它对比传统IBRC方案,明显提高了原始小包及合并发送的吞吐量,并大幅缩短通信延迟,改善幅度接近一倍;传统方案中小消息反而更慢的“小包惩罚”也被消除。这类高频小数据交换常见于MoE模型,即把任务分给不同“专家”子模型协作处理。
值得注意的是,报道只给出趋势性描述,没有披露完整测试参数、具体数值和第三方复现实验,因此更适合视为一次工程验证,而非规模化集群性能的最终结论。