郭震 AI公众号:郭震AI

实时 AI 消息

NVIDIA Vera Rubin NVL72 宣称每瓦工作量最高提升 30 倍,为 AI 智能体设立效率新标准

NVIDIA 发布官方博客称,其 Vera Rubin NVL72 平台可将每瓦特完成的工作量最高提升 30 倍,为 AI 智能体负载树立新的效率标准。文章援引 OpenRouter 数据指出,智能体工作负载消耗的 token 量是普通对话请求的 15 倍。

发布时间
NVIDIA Vera Rubin NVL72 宣称每瓦工作量最高提升 30 倍,为 AI 智能体设立效率新标准
图源: blogs.nvidia.com

NVIDIA 发布官方博客称,其 Vera Rubin NVL72 平台为 AI 智能体工作负载树立了新的效率标准,宣称每瓦特可完成的工作量最高提升 30 倍。

博客援引 OpenRouter 的数据指出,智能体(agentic)AI 工作负载消耗的 token 量是简单对话请求的 15 倍,智能体场景正在成为推理算力消耗的主要来源。

文章以投资研究为例说明智能体的工作方式:智能体查询金融数据库、搜索新闻与监管申报文件、调用子智能体进行同行对比与估值建模,最后把所有信息综合成一份报告。

这种多步骤推理、工具调用与子智能体协作的模式,让单次任务的 token 消耗成倍放大,也使“每 token 成本”成为智能体应用能否规模化落地的关键变量。

在 NVIDIA 的叙事中,AI 工厂的经济性由实际产出定义——每瓦特完成的工作量、token 成本与利用率,决定大规模推理能否持续盈利。

Vera Rubin NVL72 是 NVIDIA 面向 AI 工厂的下一代机架级平台,此次效率宣传直接瞄准智能体负载这一增长最快的推理场景,意在巩固其在推理市场的竞争力。

接下来值得关注的是,这一效率数字能否在第三方基准测试与真实客户部署中得到验证,以及它对云厂商采购决策和 token 定价带来的实际影响。

为什么重要

智能体负载正成为推理算力消耗的主要来源,NVIDIA 以每瓦效率为卖点切入这一场景,可能加速推理市场围绕成本与效率的竞争。

微博邮件

NVIDIAVera RubinNVL72AI AgentInference
返回实时消息

附近消息

全部