8月24日,英伟达宣布面向AI推理的Groq 3 LPX芯片全面投产,同时公布了新一代Vera Rubin平台的性能数据。这组数字相当炸裂:在SemiAnalysis AgentX智能体工作负载下运行DeepSeek V4 Pro模型,Vera Rubin NVL72每兆瓦吞吐量最高达到上一代GB300 NVL72的30倍,每Token成本最高降低35倍。
Groq 3 LPX主打低延迟Token生成。在Gemma 4 31B模型、10万Token上下文的测试中,它达到了每秒3400个输出Token。什么概念?相当于一秒钟吐出约2500个汉字,比大多数人阅读速度还快。这个指标直接瞄准的是实时对话和智能体场景——在这些场景下,首Token延迟和生成速度比峰值算力更影响用户体验。
更值得关注的动向来自SpaceXAI。这家公司计划将优化版Vera Rubin NVL72用于首代Starmind AI卫星,把英伟达的AI计算平台从地面数据中心延伸到轨道计算。SpaceXAI正在建设数GW级的算力基础设施,随着自身算力扩张,Vera CPU将支撑下一代智能体AI应用。
英伟达这次发布的核心不是单纯刷芯片性能,而是重新定义智能体时代AI基础设施的经济性。每兆瓦吞吐量30倍、每Token成本降35倍,这两组数据让云厂商在规划下一代数据中心时,算力性价比的天花板被大幅抬高。Groq 3 LPX的低延迟特性和Vera Rubin的高吞吐能力,分别瞄准推理和训练两端,构成了英伟达在AI推理时代的双产品线策略。
太空算力的故事更长远。如果Vera Rubin真的上天,意味着卫星不再只是数据采集终端,而变成了轨道上的AI推理节点。低轨卫星延迟几十毫秒,对实时性要求不高的智能体任务完全可以在太空中处理,减少地面数据中心的传输压力。这条路从概念到落地还有距离,但英伟达已经在布子。
A5创业网 版权所有