7月20日,“中国大模型首次登顶Arena”的话题冲上科技热搜。
在Arena全球AI大模型榜单的Frontend Code Arena(前端代码榜) 中,月之暗面的Kimi K3以1679分超越Anthropic的Claude Fable 5(1631分)和OpenAI的GPT-5.6 Sol(1618分),位居全球第一。在Arena综合榜中,Kimi K3也首次杀入Top 10,以1486分位列第9,成为首个进入全球前十的开源模型。分项来看,K3在创意写作、代码生成和指令遵循三个核心类别均进入前十,在物理与社会科学、法律与政府、医疗健康等专业领域排名第一,商业管理与金融运营排名第三。
Arena的测评机制是“盲测”——用户同时和两个匿名模型对话,然后选出哪个回答更好,没有品牌滤镜,纯粹靠体验说话。Kimi K3能登顶,意味着在“对话体验”这个维度上,国产模型已经站到了最前面。
但争议也随之而来。
Kimi K3发布后选择了开源。对此,OpenAI新上任的战略未来主管Dean W. Ball公开批评,称开放权重模型“本质上是减速主义的”,会阻碍进一步的AI资本支出。硅谷关于开源与闭源路线的激烈辩论随之爆发。
更有意思的是,K3发布后48小时内,因用户请求量大幅超出预估并逼近集群承载极限,月之暗面不得不在7月19日宣布暂停C端新用户订阅。一款开源模型的发布,竟然以“算力不足”收场。这与高盛此前的预判形成了直接冲突——高盛曾警告“扩展不再是唯一制胜路径”,但K3的算力熔断恰恰证明了算力需求远未到顶。
技术层面,K3总参数2.8万亿,采用Kimi Delta Attention与Attention Residuals架构,配合Stable LatentMoE实现896个专家中每token仅激活16个的高稀疏度。据官方测算,整套架构的扩展效率较Kimi K2提升约2.5倍。加州大学伯克利分校计算机科学教授斯托伊卡表示:“过去我们一直认为中国的开源模型大约落后最先进模型6-9个月。而现在,这种差距可能已经缩小到2-3个月。 ”
中国大模型,正在从追赶者变成挑战者。
A5创业网 版权所有