近日,全球最大AI模型聚合平台OpenRouter的模型目录里悄悄多了一个条目:stealth/ox-alpha。没有公司名,没有参数规模,定价栏写着两个零。中文社区给它起了个外号叫“牛来”——Ox在英文里就是牛。
这个匿名模型很快把开发者圈点燃了。独立研究员Ben Davis用DeepSWE基准测试了10个任务,Ox Alpha通过率约80%,而同场Claude Fable 5是65%,GPT-5.6 Sol是52%,GLM-5.3和Grok 4.6都是62%。更夸张的是规格:上下文窗口104.8万token,最大输出13.1万token,支持文本、图像、视频多模态输入,预览期免费一周。
但先别急着喊“国产模型秒杀OpenAI”。这个80%来自个人10任务自测,不是官方审计榜单。DeepSWE公开排行榜上至今没有Ox Alpha,10任务样本的方差可能很大。更准确的定位是:Ox Alpha处于前沿模型第一梯队,尤其在编码任务上有竞争力,但“碾压”之说为时过早。
真正精彩的是身份侦破。独立研究者先是通过tokenizer指纹发现,Ox Alpha的token计数与智谱GLM-5.3几乎完全对齐;随后有人发送异常请求,服务器返回的Java堆栈跟踪中出现了com.wd.paas.api.domain.v4.chat.ChatCompletionRequest这个类路径,直接对应智谱Z.ai的API结构;更关键的是错误码1214“Incorrect role information”与OpenRouter上智谱GLM模型完全一致,而在DeepInfra托管的GLM-5.2上返回的是另一种格式。同一套权重,不同宿主,错误格式不同——这证明指纹属于API运营商,也就是智谱。
智谱至今没有确认也没有否认。这种匿名测试在业内不算新鲜事:OpenRouter此前四款Stealth模型后来都被中国厂商认领,包括智谱、小米、蚂蚁、美团。匿名发布的好处很明显:用免费换真实流量压测,用匿名换无偏评测,用揭晓换事件营销。如果Ox Alpha真是智谱的下一代旗舰,那它的正式发布应该不远了。
这件事对国产大模型出海也有样本意义。中国模型在性能上追近甚至局部超越海外前沿模型后,缺的往往不是技术,而是全球开发者社区的认知度和信任度。OpenRouter这种匿名测试平台,成了一个低成本的全球化试金石。
A5创业网 版权所有