机器人平台一边不断接收图片和视频,一边还要回答“帮我找出某类画面”。如果两件事都排队等GPU,临时搜索也可能被批量任务拖住。Hebbian Robotics 分享的做法是:让GPU批量处理图像和视频,用一个小型 Rust + ONNX Runtime 服务在CPU上响应文字查询。ONNX是模型交换格式,ONNX Runtime负责让模型在不同硬件上运行。
这里用的是 SigLIP 2——一种把文字与图像变成可比较数字向量的视觉语言模型。两端生成的“文本嵌入”和图像嵌入处在同一空间,因此CPU算出的文字查询,可以直接搜索GPU提前建好的图像索引。作者称,这种拆分能让稀缺GPU专注高吞吐量的数据导入,而较轻的查询服务可用普通CPU实例扩展。原帖未披露延迟、吞吐量或成本数据,因此目前更值得关注的是这套部署思路,而非已经得到量化验证的性能优势。