国产匿名模型玉兔在中秋期间冲上 OpenRouter 调用日榜榜首,Coding 能力实测进入领先梯队。
又快又能打!匿名模型玉兔模型杀上双榜第一,Coding 实测全记录
中秋假期杀出一匹黑马,在 OpenRouter 和 OpenCode 双榜同时登顶。
衡宇 发自 凹非寺 量子位 | 公众号 QbitAI
服都服了,又是哪家模型搞匿名啊,大过节的搁这儿杀出来冲榜?!
一个没留神,它在短短几天里经历了突然出现→突然热度飙升→突然干到 OpenRouter、OpenCode 双榜调用日榜第一→突然讨论热度也飙升。

扫了一眼,推特和 Reddit 上目前的整体风向是这样的:
有说 unbelievable 的(be like @CoderGeeta)。

不少用户反馈输出效果不错(be like @Fei2411)。

还有夸速度快,"打败了 Astra" 的(be like @marcthecreatorr)。

所以在迷人又珍贵的中秋假期最后一天,我做了一个违背祖宗的决定——管他是谁家的匿名模型,先测了再说吧。
先跟大家说一声,我是从 OpenRouter 上拿的 API,接到了 DeepSeek Harness(为公平起见我用了之前我没用过的 DSH,惭愧)里面,给 Space Bunny 随便取了个名字叫"tuerye"。
昨晚上和今天上午都在使劲蹬,然后随机抽取,最后放了 4 个 case 在这篇稿子里。
可能附带一些我自己的个人主观弹幕,但主要还是为了呈现。
我这个人吧有点执念,这个世界上的匿名模型,管他大王小王,通通都要给我拉来测 coding 能力。
最近最火的除了 Astra 操控 Blender,还有的就是 3D 玩法了。
那就上强度吧,我让它"用 Three.js 构建一个详细的立方体风格天坛,包含交互式细节"。
任务一开始跑我就搁旁边看《花少2》8 小时版本去了……大概一个多小时不到两个小时吧,想起来看了一眼居然就跑完了,比我预想中快很多。
我给编辑部几位同事看了下,满足"交互"这个条件就不说了,它自己加了些我压根儿没提的细节,比如底部控制条里还有夜、黎明、正午三个时刻和雨、烟的天气开关;昼夜还会自行循环,一天约 3.5 分钟,时辰文字也随时间从子时走到亥时。
反正总体而言大家都觉得 Space Bunny 的初战效果比较令人满意。
而且说出来都丢脸,做完了我才想起来 DSH 它,没!长!眼!睛!

所以评分方面再给这兔子加一颗星,表达我的歉意。。。
OK,展示第二个任务,给咱 做一个苹果系统的、更适合中国宝宝体质的闹钟。
这个功能其实 iOS 27 说是有了,但身在中秋假期在这儿为爱测评的我,脑子里啪一下就冒出了这个需求。
Space Bunny 耗时共 22 分钟 46 秒。
做出来的闹钟,响铃时的界面是这样的,霸占整个 Mac 的屏幕。


按理说一轮就够用,但我还是又让它加个每个月到底闹铃响不响的功能,起床时间也调到 7:23。
我们早八人是这样的,能多睡一分钟就尽量多睡一分钟。。。
这任务吧实用性比较强,咱们主要来看看 readme 里面它记录的思考。



怕自己贴截图的时候再次晕倒,所以赶紧来看第三个 Coding 任务吧,让 Space Bunny 做个 App。
"做一个 mac app,把 dsh 当前的思考像字幕一样打在屏幕上。"
好消息是这玩意儿做起来就很快,可能不到 5 分钟?
我在飞书页面写这篇稿子呢,非常短的时间里屏幕上就冒出来了个这个,给我吓一跳。

坏消息是这次它自己脑补的细节就没有天坛那个丰富,初次交差的版本确实一直在显示 DSH 的脑回路,但窗口不能拖动挪动,也没有关掉和最小化。
这个位置一度挡住了我和 DSH 的对话框,我沉默许久,终于想起来可以给窗口缩小咯(可能是还沉浸在中秋尾声,今天测试的诸多环节我好像都失了智,好在 Space Bunny 智商还挺在线的)。

不到 15 分钟,且是在我开了多个任务同时跑的前提下**,它给改好了。**
一个是它自己说的,"合成鼠标事件在这个环境里会被系统丢掉一部分,所以「拖动是否与指针 1:1 同步」我没法在无头环境里断言——我改成了直接跟指针的屏幕位移(两端都是 AppKit 坐标,不存在符号翻转),你手动拖一下最准。"
另外就是拖动的时候会像小星星一样一闪一闪的?
这个不是啥大问题,应该就是因为实时显示脑回路所以窗口忽大忽小的,我又在拿鼠标拖拽,两套操作有点打架。
讲真最近测的好几个模型都这样,首轮出来总会有些小细节有 bug,肯定是没有 Astra 这种惊艳你一跳又一跳的 feel,但拿来干活跑跑代码肯定是没问题的。
也就是首轮结果出来过后自己要再手动提点小建议,一般一轮就能解决。
我测试过程中几乎没有出现一轮解决不了的问题。
只有一次,跑了个"给 GitHub 某仓库的文章列表增加 cursor 分页和标签组合筛选,补全测试且保持旧接口可用"的任务,看到它声称"全部检查通过",随后又说明 lint 仍有 33 个错误,有点 bug。
但这个问题一说也马上就改了,我还让 codex 帮我审了一遍,人家也说没问题。
前前后后测了十几个 coding 任务都给我测累了,于是我的魔爪又伸向了多模态。
丢给它一个特斯拉擎天柱吧台优雅营业的视频,就是这个:
问 Space Bunny(写到这里我脑子里有一瞬间无理由飘过"这兔子不会是 Grok 吧"):
讲道理这个任务不知道为什么缓存命中有点低?
我看了下,除了这个任务其余的缓存命中中率都在 95% 以上⬇️
太空玉兔,你是 O/A/G/Z/M/K… 家的吗?
讲真,我是测完过后才开始认真去看开发者们分享的一手体感的。
什么说 Space Bunny 是个工具狂人啊:
(好,原来大家都用 GPT-6 审代码,本菜狗放心了)
也有说它思考得太多——这和第一个测试中它给的天坛的结果比 prompt 丰富得多对应上了。
但也要和大家理涛一下,速度快、最终结果 ok,还能给出更多的信息量……
如果你有自己的体会也欢迎分享在评论区,我们会在第一时间把留言放出来。
好,最后还是俗气地来到传统习俗——猜厂商——环节。
虽然说,现在每个月都有新匿名模型,已经快成模型发布固定伴侣了……
但因为使用体感没有拉胯,猜一猜也行吧!我看网友们的猜测都五花八门的。
有网友说,因为声音听起来和 GPT 的很像,所以 OpenAI 你别藏着掖着了,直接亮相吧小宝贝:
居然还看到有人跟我前面一样,从名字里的"space"来粗暴猜测,说 Bunny 同学就是 Grok 的船新版本。
xswl,谢谢兄弟姐妹告诉我这么神经的人不只有我一个。
然后国内头部模型们几乎都被猜了,猜 Kimi 的、GLM 的、HY 的、MiniMax 的都有。
还有人觉得是 Meta 接下来会发布的 Muse Spark。
先不说猜得对不对的,但猜想小扎看到这个猜测一定很欣慰,我们 Meta 也是真的靠 Muse 重新上桌了呜呜呜。
放几个月前,这种表现不错的匿名模型,谁会把 Meta 的模型拿出来说啊喂!
最后的最后,我俗气地和大家感慨一下,比起认领兔子更值得关注的应该是 Space Bunny 这么快在调用榜登顶的实质原因。
现在日常干活,除了搞算法的朋友们,大家的大模型挑选标准都趋向经济适用。
正因如此,几乎所有的 Flash 高速模型就成了处理高频任务的主力工具。
就目前的信息而言,Space Bunny 大概率也是想这样走花路的,不过,具体定价还是要等厂商认领公布咱们才知道了╮(╯▽╰)╭