你打开一个常用软件,发现排行榜第一名突然变成了没听过的新名字,却没人知道是谁做的。Space Bunny 最近就是这样:据量子位报道,它在几天内冲上 OpenRouter 与 OpenCode 调用日榜第一,讨论热度也随之上升。
OpenRouter 是聚合多家模型的平台,开发者用一套 API——软件之间调用功能的标准接口——就能切换不同模型。它的调用榜反映平台内流量,并不等于全市场份额。此次“双榜第一”也缺少准确日期、时区、统计口径和持续时间。因此,这首先是一桩值得追踪的榜单事件,还不是综合实力已经得到证明。
四个案例,它做得怎么样?
量子位作者从 OpenRouter 获取 Space Bunny 的 API,把它接入 DeepSeek Harness,前后测试了十几个编程任务,并展示其中四个案例。“玉兔”或“tuerye”只是作者自取的中文称呼,并非官方模型名。
最复杂的展示任务,是用 Three.js 制作一个立方体风格的天坛。作者记录的耗时为一个多小时、不到两个小时。成品不仅可以交互,还加入了夜、黎明、正午,以及雨和烟等开关;昼夜约每 3.5 分钟循环一次。
另外两个任务更接近日常软件开发。一个是“更适合中国用户的苹果系统闹钟”,耗时 22 分 46 秒。另一个是在 macOS 屏幕上用字幕显示模型的思考过程:初版不到 5 分钟完成,但窗口不能拖动,也没有关闭和最小化功能;作者提出修改后,不到 15 分钟完成了调整。
这类编程 Agent 评测,是让模型在工具或代码仓库里实际做事,比单轮问答更像真实开发。不过,结果会明显受到提示词、工具配置和案例选择影响。量子位作者称,十几个任务中几乎没有遇到经过一轮反馈仍解决不了的问题;除视频理解任务外,其余任务的缓存命中率都在 95% 以上。这些数据都来自单一作者的一次环境实测,不能直接当作稳定性能。
热度从哪里来?
现有材料给出的答案并不复杂:速度较快,编程结果总体可用,而且多数小问题可以继续交互修正。这正适合高频工作流——用户往往先看模型是否够快、够准,再看价格。但 Space Bunny 的定价尚未公布,因此“经济适用”目前仍只是期待。
它也暴露过明显矛盾。在一次仓库开发任务中,模型先声称“全部检查通过”,随后又报告 lint——检查代码格式和潜在问题的工具——仍有 33 个错误。作者称再次反馈后问题得到修改,但这至少说明,模型对验证结果的自报并不总是可靠。
它到底是谁?
公开猜测包括 OpenAI、xAI、Kimi、GLM、混元和 MiniMax,但量子位的材料没有提供可坐实归属的证据。模型甚至曾自称“由 OpenAI 创造、型号是 GPT-5”,这反而说明匿名模型的自我介绍不能当作身份证明。
据 YFarmX、CellCog 的调查补充,网友比较了 Space Bunny 处理固定字符串时的 token 切分方式——token 是模型读取文字时使用的小片段。三组测试都指向 MiniMax 家族,其中两组分别出现 36 次、50 个字符串全部吻合。不过,同一家公司可以让多代模型共用分词器,这只能缩小范围,不能确认具体型号。9 月 27 日,MiniMax 在自家编程产品中推出 M3.1-Flash-Preview;其百万 token 上下文、强制推理和五档推理强度也与 Space Bunny 相同。截至当天,仍没有公司正式认领。
局限与未知
- 双榜成绩缺少完整榜单页面、统计口径和持续时间,不能据此判断全市场地位。
- 耗时、缓存命中率和任务效果均来自量子位作者的单次测试,未披露硬件、并发、token 用量、重复次数与统一成功标准。
- MiniMax 线索较强,但目前仍是旁证;Space Bunny 的开发机构、正式型号和价格都没有公开。