一、这次发布到底是什么

2026 年 9 月 16 日,NVIDIA 在官方博客发布消息:NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 中首次提交预览结果。这是 NVIDIA 开发的新一代 AI 推理计算平台,属于机架级 GPU 系统。官方未说明它是否开源或开放权重,也没有公布售价和上市日期。

简单说,它是一台专门用来“让 AI 回答问题”的超级计算机机架。就像学校食堂把一个大窗口改成多个窗口,同样时间能服务更多学生,Vera Rubin NVL72 让 AI 推理一次处理更多请求。

二、MLPerf 是什么,为什么重要

MLPerf 是由 MLCommons 组织管理的 AI 性能基准测试,相当于 AI 硬件的“统一考试”。它用 DeepSeek-R1、Qwen3-VL 等真实模型,在离线、服务器和交互场景下测量吞吐量和延迟。不同厂商用同一套题目考试,成绩可以横向比较。

这次 NVIDIA 提交的是 Closed Division(封闭组)结果,意味着硬件和软件配置受到严格限制,不能随意更改模型或精度来“作弊”。结果于 2026 年 9 月 16 日从 mlcommons.org 获取,条目编号为 6.1-0106 和 6.1-0074。

三、Vera Rubin NVL72 的性能表现

在 Qwen3-VL 基准上,Vera Rubin NVL72 使用 vLLM 和 NVIDIA Dynamo 开源推理框架,在离线、服务器和交互三种场景下,吞吐量最高达到 GB300 NVL72 的 3.7 倍。在 DeepSeek-R1 基准上,使用 NVIDIA TensorRT-LLM 库,吞吐量最高达到 GB300 NVL72 的 2.5 倍。

这意味着每个 Vera Rubin NVL72 机架能生成更多 token、服务更多用户、产生更多收入,同时降低每 token 成本。就像同样一块地,种出更多粮食,每斤粮食的成本反而更低。

四、为什么能这么快:硬件与软件协同设计

Vera Rubin 增强了 Tensor Core 和 Transformer Engine,加速推理的 prefill 和 decode 两个阶段。NVFP4 精度减少了模型权重、注意力和 KV 缓存的内存占用,在几乎不损失输出质量的前提下提高吞吐量。第六代 NVLink 和 NVLink Switch 提供比普通以太网高 10 倍的包速率和低 3 倍的延迟。

软件方面,NVIDIA 大量使用分离式服务,把 prefill 和 decode 分开,并用大规模专家并行处理 DeepSeek-R1 和 Qwen3-VL 这类混合专家模型。这就像餐厅把点菜和做菜分开,点菜员专门点菜,厨师专门做菜,效率更高。

五、GB300 NVL72 的扩展效率与软件优化

NVIDIA 的 DeepSeek-R1 提交从单个 GB300 NVL72 机架(72 GPU)扩展到四个机架(288 GPU),在离线场景下实现 99% 的扩展效率,吞吐量几乎与硬件增加成正比。这就像四台收银机同时工作,总速度接近单台的四倍,而不是只快一点点。

软件优化也带来持续提升:v6.1 中 GB300 NVL72 在 Qwen3-VL 上的性能比 v6.0 最高提升 1.6 倍。提交截止后,NVIDIA 继续优化,在 GPT-OSS-120B 和 DLRMv3 上取得进一步性能提升,但这些结果尚未经 MLCommons 验证。

六、智能体推理与边缘设备

AI 智能体需要多步推理、规划和行动,传统吞吐量基准不能完全衡量这种能力。在 SemiAnalysis AgentX 基准的预览测试中,Vera Rubin NVL72 性能达到 GB300 NVL72 的 30 倍。即将推出的 MLPerf Endpoints 基准将为智能体推理工作负载带来标准化测量。

NVIDIA 还提交了 Jetson AGX Thor 在 Edge-Agentic 基准上的结果,使用 TensorRT Edge-LLM 和 Qwen3.6-27B。这说明从紧凑边缘设备到大型 AI 工厂,NVIDIA 都在推进性能。就像从手机到超级计算机,都能运行 AI。

七、合作伙伴与适用人群

NVIDIA 合作伙伴生态广泛参与,共有 19 家合作伙伴提交结果,其中 8 家使用多节点 Blackwell NVL72 系统,包括 ASUS、Azure、Cisco、CoreWeave、Dell Technologies、HPE、Nebius、Oracle Cloud Infrastructure、Supermicro 等。Nebius 也提交了 Vera Rubin NVL72 预览结果。

这套平台适合需要大规模 AI 推理的企业和组织,比如云服务商、AI 工厂和大型研究机构。对于个人开发者或小学生,它更像是一个遥远的“AI 发电厂”,但了解它有助于明白 AI 服务背后的计算原理。

八、限制与需要核验的事项

官方未说明 Vera Rubin NVL72 的具体售价、上市日期、功耗和完整硬件规格。这次提交是“预览结果”,不是最终正式提交,性能可能随软件优化继续变化。MLPerf 结果只代表特定基准和配置,实际应用中的表现可能不同。

此外,官方未说明是否开源或开放权重。对于想购买或部署的用户,建议等待 NVIDIA 公布正式规格、价格和可用性,并参考 MLCommons 官网的完整结果进行核验。不要仅凭预览数据做采购决策。

官方来源

本文由 AIGCWHY 自动监测系统发现,经结构化处理后发布。重要决策请打开原文核验。

查看原始发布信息 ↗