返回文章列表

英伟达的"AI 工厂"棋局:从卖铲人到全栈玩家

8月24日 Hot Chips 2026 上,英伟达一口气官宣三件事:面向智能体推理的 Groq 3 LPX 全面量产、Vera Rubin NVL72 在真实智能体负载下每兆瓦吞吐量最高提升 30 倍、SpaceXAI 将 Vera Rubin 平台延伸至轨道计算。叠加此前一周披露的 70 亿美元 Poolside 交易与正在谈判的 Perplexity 投资,英伟达正在从"卖 GPU 的铲子商人"变成同时经营硬件、网络、开源权重模型与生态投资的全栈玩家。本文拆解这些动作及其背后的行业信号。

13 分钟阅读

一个下午,三件大事

美东时间 8 月 24 日,Hot Chips 2026 开幕。英伟达在这个下午连续放出三枚信号弹,全部围绕同一个词:AI 工厂(AI Factory)

第一件是面向交互式 AI 推理的加速器 Groq 3 LPX 全面量产。这是英伟达去年 12 月与 Groq Inc. 达成约 200 亿美元非独家授权协议(公司史上最大交易)后,把授权技术变成量产产品的关键一步。官方新闻稿称,它在 Artificial Analysis 基准测试中跑出每秒 3400 个输出 token(Gemma 4 31B、10 万 token 上下文),为该模型创下历史最快纪录,并针对延迟敏感负载提供比"最接近的替代平台"快 4 倍的响应速度。

第二件是 Vera Rubin NVL72 的真实负载数据。基于 SemiAnalysis 的 AgentX 智能体工作负载、运行 DeepSeek V4 Pro 的测试中,Vera Rubin NVL72 每兆瓦吞吐量最高达到上一代 GB300 NVL72 的 30 倍,每 token 成本最高降低 35 倍。华尔街见闻整理指出,智能体任务不同于传统聊天——任务上下文会随数百个推理步骤不断累积,甚至达到数十万 token,这彻底改变了"什么算快"的衡量方式。

第三件是 SpaceXAI 把 Vera Rubin 送上轨道。英伟达宣布 SpaceXAI 将采用 Vera CPU 加速下一代智能体 AI 应用,并计划把优化版 Vera Rubin NVL72 用于首代 Starmind AI 卫星,把地面 AI 工厂的架构延伸到轨道计算。NVIDIA Newsroom

Groq 3 LPX:为什么"生成速度"突然变成了硬件卖点

要理解 Groq 3 LPX 的意义,先得理解智能体推理的结构性变化。一个编码代理执行任务时,不是"一问一答":它要读文件、调工具、写代码、跑测试、根据结果继续推理,循环可能达数百甚至数千步,每一步都依赖 token 生成。上下文处理与 token 生成是两种不同的计算负担——前者要求大规模并行吞吐,后者要求极低延迟、逐个产出。

Groq 3 LPX 的设计正是把这两件事拆开:Vera Rubin GPU 负责大规模上下文处理,LPX 加速器接管延迟敏感的解码环节。整机架最多可通过超高带宽互连接入 256 个 LP30 加速器,与 GPU 组成统一推理引擎。Nebius 是第一家采用的 AI 云,将把 Groq 3 LPX 接入其生产推理平台 Nebius Token Factory;Groq 云服务紧随其后。WCCFTech 报道

黄仁勋在新闻稿里的原话值得记录:"推理是 AI 的成长引擎。"这句话的背景是:英伟达在训练市场几乎垄断,但推理市场更讲究每 token 成本与能耗,专用推理芯片(Cerebras、Groq 原厂等)早已虎视眈眈。把 Groq 3 LPX 推向量产,是英伟达在推理赛道主动补位,而不是等着别人来抢。

30 倍效率与"AI 工厂"的新计量单位

Vera Rubin NVL72 的 30 倍每兆瓦吞吐量、35 倍成本下降,建立在同一个测试范式之上:用智能体工作负载而非聊天负载来测硬件。SemiAnalysis 的 AgentX 工作负载模拟的是真实代理任务——金融研究、同行比较、多步工具调用——这类任务消耗的 token 远高于普通对话。OpenRouter 的数据显示,代理式 AI 工作负载消耗的 token 是简单聊天请求的 15 倍。aistart.ai 摘要

英伟达顺势把叙事从"芯片性能"升级为"AI 工厂经济性":一座 AI 工厂的价值不再由峰值算力决定,而是由产出指标决定——每秒 token 数、每瓦 token 数、每 token 成本。这意味着基础设施必须作为完整系统设计:芯片、网络、存储、机架协同优化,而不是简单堆加速器。Groq 3 LPX 量产、Vera CPU 机架、BlueField-4 DPU、Spectrum-6 SPX 以太网,都是这套"工厂系统"的零件。

Poolside 交易:花 70 亿美元买一条"模型生产线"

如果把时间线往前拉几天,8 月 20 日曝出的英伟达-Poolside 交易(24 日起被多家中外媒体详细报道)是另一个重要拼图。据《华尔街日报》核实过的投资者信函,交易结构如下:

组成部分金额/内容
Model Factory 非独家许可约 60 亿美元
股权投资10 亿美元,投前估值约 120 亿美元
人才引进约 109 名 Poolside 工程师获邀加入 Nemotron 开源模型团队
公司独立性三位联合创始人留任,公司继续独立运营,"既非收购,也非变相收购"

这桩交易最值得玩味的是英伟达买的不是模型,而是生产模型的"工厂"——Poolside 内部用于训练其 Laguna 系列编程模型的 Model Factory 系统。这笔交易的直接导火索是 Poolside 的算力困境:它曾在六周窗口内试图融资 20 亿美元以锁定 4 万颗 GB300 集群,融资失败后失去了集群,无法继续在前沿竞争。而英伟达手里恰好握有整个行业最稀缺的资源——前沿 GPU 产能。

这个"许可 + 股权投资 + 定向挖人"的形态,英伟达已经不是第一次用:此前与 Groq 的约 200 亿美元协议、与芯片互连初创 Enfabrica 的约 9 亿美元协议都是同一套路,三笔合计约 270 亿美元。通过不触发反垄断审查的方式,拿到关键技术、核心团队,同时保留目标公司继续存在。对 Poolside 而言,联合创始人留下、公司独立,但"造出 Laguna 的人"几乎都去了英伟达。

为什么英伟达要亲自下场做开源权重模型

把 Poolside 交易放到行业格局里看,目标很清楚:打造一个能与 DeepSeek、Kimi K3 抗衡的顶级开源权重模型,同时给 OpenAI、Anthropic 这些闭源前沿实验室施压。 英伟达 8 月刚发布首个开源权重模型 Nemotron 3.5 Lightning(300 亿参数 MoE),据报下一代 Nemotron 训练参数可能超过一万亿。

逻辑链条是这样闭合的:

  • 开源权重模型可下载、可私有化部署,企业、政府和开发者不必被单一 API 供应商锁死;
  • 越多人下载权重、微调、部署,就需要越多的 GPU、网络和全栈系统——最终回到英伟达的生意;
  • 美国需要本土开源生态来对冲中国开源模型的先发优势,黄仁勋 7 月在 X 上的首条帖子标题就是《Open Weights and American AI Leadership》。

这就是英伟达"卖铲人"身份的微妙之处:OpenAI 和 Anthropic 是它最大的客户,但它同时在做模型层,与客户竞争。只要模型层无论开源闭源都跑在英伟达算力上,这场"左右互搏"在商业上就是成立的。

投资而非并购:英伟达的生态杠杆

同一周还有一条仍在谈判中的消息:据 The Information 报道,英伟达正在谈判投资 AI 搜索初创 Perplexity,估值超过 300 亿美元,较一年前上一轮高 50% 以上;Perplexity 年化收入据报已超过 7.5 亿美元。my2cents.ai 汇总 此前英伟达还牵头组建了 Nemotron Coalition(3 月成立,成员包括 Mistral、Thinking Machines Lab、Perplexity)。

这些动作的共同点是:英伟达正在用自己的资产负债表,给"能拉动 GPU 需求"的公司和生态投票。 从 Perplexity 到 Poolside,从 Groq 到 Enfabrica,它不追求控股,只求把关键环节留在自己的生态半径内。

观察:竞争焦点正在从"模型"转向"生产模型的工厂"

把 8 月 20-24 日的动作放在一起看,英伟达的战略轮廓清晰起来:

英伟达的动作信号
硬件Groq 3 LPX 量产、Vera Rubin 全系推理与训练并重,从卖芯片到卖"工厂系统"
模型Poolside Model Factory 许可、Nemotron 扩张亲自下场做开源权重,与 DeepSeek/Kimi 正面竞争
生态Perplexity 投资、Nemotron Coalition用资本锁定拉动算力需求的应用与社区
场景SpaceXAI 轨道计算AI 工厂从数据中心延伸到新边疆

单看任何一条都是"英伟达又发了个东西",合起来才看得清:AI 竞争的下半场,比的不是谁的单个模型最强,而是谁能以最低成本、最快速度"工厂化"地产出智能。 英伟达把"生产模型的基础设施"本身做成了产品——你可以在它上面训练自己的模型(Nemotron 生态),也可以直接租用它的推理产能(Token Factory 这类云),还可以把它的架构搬到卫星上。

对普通开发者和企业的启示有三点:一是推理成本正在以数量级下降,智能体应用的边际成本门槛在快速降低;二是开源权重阵营的竞争会继续压低闭源 API 价格,采购时不必过早绑定单一厂商;三是"模型生产线"(训练/评估/部署工具链)正在成为比模型本身更稀缺的资产——选型时不妨多问一句:这家公司卖的是模型,还是造模型的能力?


笔记

  • Groq 3 LPX(2026-08-24,Hot Chips 2026):交互式 AI 推理加速器全面量产,基于与 Groq Inc. 约 200 亿美元授权协议;Artificial Analysis 测试 Gemma 4 31B、10 万 token 上下文达每秒 3400 输出 token,创模型纪录;延迟敏感负载响应速度比最接近的替代平台快 4 倍;整机架最多 256 个 LP30;Nebius 首家采用,Groq 云紧随其后。
  • Vera Rubin NVL72(2026-08-24):SemiAnalysis AgentX 负载 + DeepSeek V4 Pro 测试,每兆瓦吞吐量最高为 GB300 NVL72 的 30 倍,每 token 成本最高降 35 倍。
  • SpaceXAI(2026-08-24):采用 Vera CPU 加速智能体 AI,优化版 Vera Rubin NVL72 将用于首代 Starmind AI 卫星。
  • Poolside 交易(2026-08-20 起报道):约 60 亿美元非独家许可 Model Factory + 10 亿美元投资(投前 120 亿美元估值)+ 约 109 名工程师加入 Nemotron;联合创始人留任,"既非收购,也非变相收购";此前融资 20 亿美元锁定 4 万颗 GB300 集群失败。
  • 英伟达同类先例:Groq 约 200 亿美元、Enfabrica 约 9 亿美元,三笔合计约 270 亿美元。
  • Perplexity 投资谈判(The Information):估值超 300 亿美元,年化收入据报超 7.5 亿美元。
  • 核心观察:英伟达从卖芯片转向经营"AI 工厂"全栈(硬件 + 开源权重模型 + 生态投资),竞争焦点从单一模型转向"生产模型的工厂"。

(内容由AI生成,仅供参考)