又快又能打!匿名模型玉兔模型杀上双榜第一,Coding实测全记录

  衡宇发自凹非寺

  量子位 | 公众号 QbitAI

  服都服了,又是哪家模型搞匿名啊,大过节的搁这儿杀出来冲榜?!

  说的就是你,Space Bunny。

  一个没留神,它在短短几天里经历了突然出现->突然热度飙升->突然干到 OpenRouter、OpenCode 双榜调用日榜第一->突然讨论热度也飙升。

  扫了一眼,推特和 Reddit 上目前的整体风向是这样的:

  有说unbelievable的(be like@CoderGeeta)。

  不少用户反馈输出效果不错(be like@Fei2411)。

  还有夸速度快,“打败了 Astra”的(be like@marcthecreatorr)。

  真的吗?

  我不信。

  所以在迷人又珍贵的中秋假期最后一天,我做了一个违背祖宗的决定——管他是谁家的匿名模型,先测了再说吧。

  猜它是谁干嘛,快开蹬啊

  先跟大家说一声,我是从 OpenRouter 上拿的 API,接到了 DeepSeek Harness(为公平起见我用了之前我没用过的 DSH,惭愧)里面,给 Space Bunny 随便取了个名字叫“tuerye”。

  昨晚上和今天上午都在使劲蹬,然后随机抽取,最后放了**4 个 case**在这篇稿子里。

  可能附带一些我自己的个人主观弹幕,但主要还是为了呈现。

  欢迎大家给自己的判断。

  我这个人吧有点执念,这个世界上的匿名模型,管他大王小王,通通都要给我拉来测 coding 能力。

  最近最火的除了 Astra 操控 Blender,还有的就是3D 玩法了。

  那就上强度吧,我让它“用 Three.js 构建一个详细的立方体风格天坛,包含交互式细节”。

  任务一开始跑我就搁旁边看《花少2》8 小时版本去了……大概一个多小时不到两个小时吧,想起来看了一眼居然就跑完了,比我预想中快很多。

  效果见视频:

  我给编辑部几位同事看了下,满足“交互”这个条件就不说了,它自己加了些我压根儿没提的细节,比如底部控制条里还有夜、黎明、正午三个时刻和雨、烟的天气开关;昼夜还会自行循环,一天约 3.5 分钟,时辰文字也随时间从子时走到亥时。

  反正总体而言大家都觉得 Space Bunny 的初战效果比较令人满意。

  而且说出来都丢脸,做完了我才想起来 DSH 它,没!长!眼!睛!

  所以评分方面再给这兔子加一颗星,表达我的歉意。。。

  OK,展示第二个任务,给咱**做一个苹果系统的、更适合中国宝宝体质的闹钟**。

  这个功能其实 iOS 27 说是有了,但身在中秋假期在这儿为爱测评的我,脑子里啪一下就冒出了这个需求。

  Space Bunny耗时共 22 分钟 46 秒。

  做出来的闹钟,响铃时的界面是这样的,霸占整个 Mac 的屏幕。

  很霸道但也很简洁:

  一轮跑出来界面是这样的:

  按理说一轮就够用,但我还是又让它加个每个月到底闹铃响不响的功能,起床时间也调到7:23。

  我们早八人是这样的,能多睡一分钟就尽量多睡一分钟。。。

  这任务吧实用性比较强,咱们主要来看看 readme 里面它记录的思考。

  iOS 的硬性限制它也考虑到了:

  但你们要不要看下我在这里看到了什么。。。

  这是什么。。。

  晕倒了我已经。

  怕自己贴截图的时候再次晕倒,所以赶紧来看第三个 Coding 任务吧,让 Space Bunny 做个 App。

  “做一个 mac app,把 dsh 当前的思考像字幕一样打在屏幕上。”

  好消息是这玩意儿做起来就很快,可能不到 5 分钟?

  我在飞书页面写这篇稿子呢,非常短的时间里屏幕上就冒出来了个这个,给我吓一跳。

  坏消息是这次它自己脑补的细节就没有天坛那个丰富,初次交差的版本确实一直在显示 DSH 的脑回路,但窗口不能拖动挪动,也没有关掉和最小化。

  这个位置一度挡住了我和 DSH 的对话框,我沉默许久,终于想起来可以给窗口缩小咯(可能是还沉浸在中秋尾声,今天测试的诸多环节我好像都失了智,好在 Space Bunny 智商还挺在线的)。

  但我还是无能地勃然小怒了一下:

  不到 15 分钟,且是在我开了多个任务同时跑的前提下**,它给改好了。**

  现在就是随便挪,任意挪,想咋挪就咋挪。

  而且没有思考的时候它会变得小小只。

  我觉得海星?还不错!

  不过也有两个问题。

  一个是它自己说的,“合成鼠标事件在这个环境里会被系统丢掉一部分,所以「拖动是否与指针1:1 同步」我没法在无头环境里断言——我改成了直接跟指针的屏幕位移(两端都是 AppKit 坐标,不存在符号翻转),你手动拖一下最准。”

  另外就是拖动的时候会像小星星一样一闪一闪的?

  这个不是啥大问题,应该就是因为实时显示脑回路所以窗口忽大忽小的,我又在拿鼠标拖拽,两套操作有点打架。

  回头再交互一轮简单打磨下就好了。

  讲真最近测的好几个模型都这样,首轮出来总会有些小细节有 bug,肯定是没有 Astra 这种惊艳你一跳又一跳的 feel,但拿来干活跑跑代码肯定是没问题的。

  也就是首轮结果出来过后自己要再手动提点小建议,一般一轮就能解决。

  如果要增加新功能就再交互再跑。

  Reddit 上有老哥跟我体感是一样的:

  我测试过程中几乎没有出现一轮解决不了的问题。

  只有一次,跑了个“给 GitHub 某仓库的文章列表增加 cursor 分页和标签组合筛选,补全测试且保持旧接口可用”的任务,看到它声称“全部检查通过”,随后又说明 lint 仍有 33 个错误,有点 bug。

  但这个问题一说也马上就改了,我还让 codex 帮我审了一遍,人家也说没问题。

  前前后后测了十几个 coding 任务都给我测累了,于是我的魔爪又伸向了多模态。

  丢给它一个特斯拉擎天柱吧台优雅营业的视频,就是这个:

  △视频来源@cb_doge

  问 Space Bunny(写到这里我脑子里有一瞬间无理由飘过“这兔子不会是 Grok 吧”):

  这个机器人干嘛呢?

  中间流程太复杂了,直接上最终结果:

  讲道理这个任务不知道为什么缓存命中有点低?

  我看了下,除了这个任务其余的缓存命率中都在 95% 以上⬇️

  太空玉兔,你是O/A/G/Z/M/K…家的吗?

  讲真,我是测完过后才开始认真去看开发者们分享的一手体感的。

  好的坏的评价都有,初步目测是好评偏多。

  什么说 Space Bunny 是个工具狂人啊:

  速度快啊:

  (好,原来大家都用 GPT-6 审代码,本菜狗放心了)

  别慌,当然不可能全网好评!

  也有说它思考得太多——这和第一个测试中它给的天坛的结果比 prompt 丰富得多对应上了。

  但也要和大家李涛一下,速度快、最终结果 ok,还能给出更多的信息量……

  那么思考太多到底算好算坏呢?

  Anyway。

  如果你有自己的体会也欢迎分享在评论区,我们会在第一时间把留言放出来。

  好,最后还是俗气地来到传统习俗——猜厂商——环节。

  虽然说,现在每个月都有新匿名模型,已经快成模型发布固定伴侣了……

  但因为使用体感没有拉胯,猜一猜也行吧!我看网友们的猜测都五花八门的。

  有网友说,因为声音听起来和 GPT 的很像,所以OpenAI你别藏着掖着了,直接亮相吧小宝贝:

  居然还看到有人跟我前面一样,从名字里的“space”来粗暴猜测,说 Bunny 同学就是Grok的船新版本。

  xswl,谢谢兄弟姐妹告诉我这么神经的人不只有我一个。

  然后国内头部模型们几乎都被猜了,猜 Kimi 的、GLM 的、HY 的、MiniMax 的都有。

  还有人觉得是Meta接下来会发布的 Muse Spark。

  先不说猜得对不对的,但猜想小扎看到这个猜测一定很欣慰,我们 Meta 也是真的靠 Muse 重新上桌了呜呜呜。

  放几个月前,这种表现不错的匿名模型,谁会把 Meta 的模型拿出来说啊喂!

  最后的最后,我俗气地和大家感慨一下,比起认领兔子更值得关注的应该是 Space Bunny 这么快在调用榜登顶的实质原因。

  现在日常干活,除了搞算法的朋友们,大家的大模型挑选标准都趋向经济适用。

  吾日三省吾身:这模型快不?准不?贵不?

  正因如此,几乎所有的 Flash 高速模型就成了处理高频任务的主力工具。

  就目前的信息而言,Space Bunny 大概率也是想这样走花路的,不过,具体定价还是要等厂商认领公布咱们才知道了╮(╯▽╰)╭

  参考链接:

  [1]https://x.com/Fei2411/status/2104030913814515932

  [2]https://x.com/CoderGeeta

  [3]https://www.reddit.com/r/opencode/comments/1wocn5s/space_bunny_thoughts/

  [4]https://OpenRouter.ai/rankings#natural-languages

  [5]https://x.com/cb_doge/status/2032939247443882115?s=20