一家叫Magic的AI公司9月8日发布了一份预训练研究更新,抛出的数字相当有冲击力:它的预训练配方,自称比目前领先的开源权重基座模型的算力效率高出10倍以上。
具体一点。Magic称,它用大约50倍的更少浮点运算量,就匹配了DeepSeek V4 Pro的基座模型水平——这大约相当于GPT-3预训练算力的一半,按英伟达GB200的算力折算,成本约50万美元。在此基础上,它又把配方放大10倍(约400万美元),声称在困惑度评测上“明显优于所有公开可得的开源基座模型”。按它自己拟合的缩放定律,如果用DeepSeek V4 Pro的配方训练同等能力的模型,成本将超过1亿美元。
方法论上,Magic没有用常见的采样基准,而是测了“每字节比特损失”(bits-per-byte loss)这个指标,理由很技术:基座模型还没经过强化学习或微调,对提示词措辞极其敏感,用采样式基准并不可靠。它的留出数据集包括自家代码库、从其他初创公司获得的私有代码仓库、近期低引用的研究论文,以及私有的竞赛数学题。为防止污染,团队剔除了开源代码,以及任何与训练语料有96字符窗口重合或相似度超阈值的内容。对比对象是DeepSeek、月之暗面Kimi、英伟达Nemotron 3 Ultra等公开权重基座模型。团队还做了交叉验证:在vLLM和SGLang两种推理后端上计算对数概率,过程中发现部分后端存在问题,并请推理服务商Fireworks在其自有引擎上复核基线。
有一个意外的副产物:Magic称英伟达的Nemotron 3在基座模型的损失指标上全面超过DeepSeek V4 Pro,且在不同领域和推理引擎上表现一致。它由此推断,Nemotron 3在基准测试上的较弱表现,问题出在后训练阶段,而非预训练本身。
关于方法,Magic强调没有什么“一招制胜”的突破。它描述的过程是:先在基础设施上下功夫,保证收敛平滑、低精度训练质量与FP32相当、超参缩放规律正确,然后“最重要的是抓bug”。之后是架构、优化器、训练目标和数据治理上几十项改动的乘积效应。每个候选改动都要在跨两个数量级算力的三个模型上验证,只有幂律拟合显示“放大后仍有效”才保留。团队还跑了一轮短程数学强化学习,直接从基座模型起步、不做监督微调,在AIME26上超过90%的pass@1。
但这些数字必须加上一层重要说明:全部由Magic自报,没有任何第三方独立验证,而且这家公司至今没有发布过任何模型可供外界复现。更微妙的是,Magic自己承认,月之暗面的Kimi K3和Meta的Muse Spark据称已比它用来对比的Kimi K2强出2.5倍和3.3倍——如果属实,部分差距可能在它发稿时就已经在收窄,拿上一季度的开源模型做参照,本身说服力会打折。
那么它为什么还值得关注?因为它正面挑战了一个流行叙事:前沿预训练是“大厂专属游戏”。如果一个小团队真能用个位数百万美元,训练出前沿级别的基座模型,那么真正的护城河就不是芯片集群,而是配方、数据和工程能力本身。这对资源有限的研究者、创业团队和做垂直模型的人来说,是一个值得持续跟踪的信号——当然,前提是它能拿出可被验证的成果。
A5创业网 版权所有