“牛来”模型刷屏!匿名、免费、跑分碾压背后,藏着算力生意的下一步棋

作者:会磊      时间: 2026-08-24      浏览数:758


image.png

分析师/会磊

校对/智涵

策划/Eason


“牛来了”——这句最近火遍中文互联网的梗,如今被AI圈借去,形容一个来历不明的模型。

8月20日,全球最大AI模型聚合平台OpenRouter的目录里,悄无声息地多了一个条目:stealth/ox-alpha。没有公司名,没有参数规模,没有技术报告,价格栏写着两个零。Ox在英文里就是“牛”,再加上最近一部魔性国产动画带火的“牛来了”梗,国内网友顺理成章地给它起了个接地气的名字——“牛来”大模型。

这头牛一上来就表现抢眼。有开发者拿真实软件工程任务去考它,10道题做对8道,80%的通过率,压过了Claude Fable 5的65%和GPT-5.6 Sol的52%。Stripe的CEO亲自上手实测,只留下四个字:相当惊艳。Ox Alpha甚至冲上OpenRouter榜首,刷新了单日模型用量纪录。

可没人知道它是谁家的。

于是,一场横跨中美、持续数日的“AI圈大型猜谜游戏”,正式拉开帷幕。


01
硬核规格加身,
代码实测碾压一线闭源模型


先看硬参数:Ox Alpha拥有104.86万Token的上下文窗口,单次最多输出13.1万Token。什么概念?理论上你可以把一整个中型代码仓库、几百页文档、或者一长串Agent执行记录一次性塞进去,让它一口气读完。

输入方面支持文本、图片和视频三种模态,输出目前只有文本。它还原生支持工具调用、函数调用和JSON结构化输出,可作为面向高效编程、长时间Agent任务和真实生产环境的前沿模型。

不过,真正让人挪不开眼的,是它实际跑出来的成绩。

一名独立研究员做了个测试:从DeepSWE基准中抽取10项真实软件工程任务——模型需要自己读代码仓库、定位bug、动手改代码、跑测试,没通过还得回头再修。结果Ox Alpha完成了8项,通过率80%。同一组任务里,Claude Fable 5是65%,GLM-5.3是62%,GPT-5.6 Sol是52%。


image.png


随后,更完整的113项DeepSWE全量测试结果出炉:Ox Alpha得分63分,整体表现接近Claude Opus 4.8

当然,80%只是10任务的个人小样本测试,不是官方榜单成绩。DeepSWE的公开榜单上目前并没有Ox Alpha的名字。但即便如此,一个免费匿名模型能在编码Agent任务中压过一线闭源模型,本身就足够让行业侧目。

规格硬、实测强、还不要钱——三样凑齐,哪个开发者不想上手试试?


02
全网“查户口”:五重指纹
锁定智谱,谷歌却跳出来抢牛



模型越强,大家就越想知道——这到底是谁家的?

社区迅速分成几大阵营,展开了一场堪比刑侦的“技术指纹追踪”。

智谱派——目前证据最充分的主流猜测。

开发者们从三个层面做了交叉验证:


image.png


分词器指纹。tokenizer负责把文本切成模型能处理的token,不同模型家族的切分逻辑就像指纹一样独特。有人测试了25组不同提示词,发现Ox Alpha与GLM-5.3的token数量始终保持恒定的75个token差值。多出来的75个,恰好能用模型外部附加的一段隐藏System Prompt来解释。

视频编码器指纹。有人专门制作了4段受控测试视频,分别喂给不同模型,记录各自消耗的视觉token数量。结果Ox Alpha和智谱GLM-5V-Turbo的表现逐Token完全一致——帧率变化后采样策略不受影响、时长增加时token以每秒约147个的速度增长、分辨率变化时的缩放方式也完全吻合。而拿来对比的MiMo、Qwen和GLM-4.6V,都呈现出截然不同的特征。

API服务层指纹。社区也有人故意给Ox Alpha传入异常参数,捕捉到了类似[1210] The temperature parameter is illegal的错误信息。这种错误码、参数限制和中英文混排的返回方式,与智谱相关服务高度一致。

今年2月OpenRouter就上演过类似的情节:一款匿名模型Pony Alpha(马)突然上线,后来揭晓正是智谱GLM-5的早期测试版。马完了来牛,命名风格如出一辙。据此可以给出了99%的置信度,Ox Alpha就是智谱GLM-5.x系列。

小米派——证据不足。

小米曾用Hunter Alpha匿名测试过MiMo-V2-Pro。而且8月18日小米财报会上,CFO刚说新一代MiMo“正在训练中,有望很快发布”。但MiMo原生支持音频输入,Ox Alpha却直接拒绝处理音频,这一特征基本可以把小米派排除主流讨论。

谷歌派——最戏剧性的一派。

就在大家按技术指纹推理时,谷歌DeepMind的研究员接连下场发声。Evan Otero先发了一个词“Gemini”,过了一会儿又补了一句:“万一Ox Alpha就是我们一路遇到的朋友呢。”可以说全程暗示、没有一句实锤。


image.png


其他小众猜想。

最抽象的一个说法是:Cursor拿智谱的开源模型自己训了一遍,然后套了个牛头,但缺少任何实证。还有人提到ColaOS的积分计费模型列表里出现了“限时免费:OX牛来”,但公开信息不足以支撑更多结论。

截至目前,智谱没有认领,谷歌没有实锤,小米没有回应,没有任何厂商正式承认。这场“认牛大会”,还在继续。


03
匿名测试为何成为
中国模型厂商的“固定节目”


Ox Alpha不是第一个玩“隐身上线”的。

在它之前,OpenRouter上已经有过四款Stealth(隐身)模型,揭晓后全部来自中国团队。Pony Alpha是智谱的GLM-5,Hunter Alpha是小米的MiMo-V2-Pro,Elephant Alpha是蚂蚁的Inclusion AI,Owl Alpha是美团的长 Cat-2.0。马、牛、象、猫头鹰——动物代号排成一列,像一句接头暗号。

再往前追溯,还有OpenAI——2024年“gpt2-chatbot”以零署名空降LMArena,后来被证实是GPT-4o预览版。

为什么大家都爱匿名测试?

首先,摘掉品牌滤镜。开发者不知道模型来自哪家公司,只能根据实际输出做判断。品牌带来的先入为主被暂时屏蔽,积累的对战结果更接近真实用户体验。

其次,免费换真实压力测试用全球开发者的真实代码仓库和长周期Agent任务来暴露问题,比任何内部测试集都高效。Ox Alpha上线两天,仅Hermes Agent一家就跑了4600亿Token。这种规模的真实负载,任何实验室都模拟不出来。

再者,表现不佳不用背锅,表现炸裂还能再造一波话题。Pony Alpha揭晓后智谱股价两日暴涨60%的先例就摆在那里。匿名发布,已经成为一种新产品上市前的营销策略。

最后,抢占生态位。让Claude Code、OpenCode、Hermes Agent把模型写进默认路由——一旦开发者把它写进了自己的工具链和自动化流程里,免费期结束之后再想换模型,就要重新改代码、调参数、适配接口,时间和人力成本都不可忽视。


image.png


这种“匿名上线、先测再认”的玩法,已经见怪不怪了。模型厂商们也越来越明白一件事:与其把力气花在发布会上,不如让开发者自己去用——谁被用得最多,谁就最有话语权。


04
免费窗口8月27日结束,
谜底揭晓就在这几天


Ox Alpha的免费预览期预计8月27日前后结束。OpenCode最初说“未来一周免费”,随后改口“未来6日”——按此推算,倒计时已经开启。

参考前几次Stealth模型的剧本:匿名期结束后,总得有人出来“牵牛回家”。Pony Alpha5天后揭晓,Hunter Alpha也是类似节奏。

但这次的情况更复杂一些。

如果真是智谱,那意味着GLM-5.3V或GLM-5.5即将正式登场。智谱刚以每百万Token 1.4/4.4美元的价格上架GLM-5.3 API,如果Ox Alpha是补上视觉短板的新一代多模态模型,这盘棋就远不止一次匿名测试那么简单。

如果真是谷歌,那Gemini 3.5 Pro的姗姗来迟终于有了解释。但技术指纹的高度吻合又让这个说法站不住脚——除非谷歌刻意模仿了智谱的tokenizer和视频编码器,这可能性微乎其微。

如果都不是,那可能真的有一匹黑马——比如前MiniMax成员创办的ColaOS团队——正在悄然崛起。


image.png


相比于“Ox Alpha到底是谁家的模型”这个悬疑话题,一款匿名模型能在特定的编码测试中短暂超越GPT-5.6和Claude明显更值得关注。这意味着:头部模型之间的能力鸿沟正在收窄。中国实验室在Agent、长上下文和多模态这几个关键方向上的真实能力边界,也正在被这样的匿名测试一点点暴露出来。

免费的牛,还能薅几天。身份的谜底,也藏不了太久。

至于这头牛到底是谁家的——8月27日,答案大概率会自己走出来。

189-1071-7116

ir@idyxs.com

北京市朝阳区酒仙桥路6号院电子城-国际电子总部7号楼

关注我们

  • 合作联系
  • 微信公众号

北京第一新声信息咨询有限公司 版权所有(C)2024 京ICP备2024089855号-1

第一新声商务经理 Sherry
Tel:18910717116

第一新声商务经理 Sherry
Tel:18910717116

第一新声研究客服 Kim小严

第一新声编辑客服 Tina

第一新声运营经理 孟小新