光合及目
1lux.xyz
← 报道
公司新闻网易· 2026-10-07

谷歌AI基建主管谈:Agent重塑基建、光网络突破、终极物理瓶颈和未来10年的算力形态

人类历史上规模最大的资本开支建设正在展开。从衡量系统真实性能的"goodput"指标,到光路交换网络、轨道数据中心,再到十年后的算力形态,谷歌AI基础设施负责人Amin Vahdat在近期一次深度对谈中,系统梳理了这场建设背后的技术逻辑与战略取舍。 谷歌今年资本开支预计超过 2000亿美元 ,大部分用于数据中心建设。Vahdat在接受Sequoia Capi

人类历史上规模最大的资本开支建设正在展开。从衡量系统真实性能的"goodput"指标,到光路交换网络、轨道数据中心,再到十年后的算力形态,谷歌AI基础设施负责人Amin Vahdat在近期一次深度对谈中,系统梳理了这场建设背后的技术逻辑与战略取舍。

谷歌今年资本开支预计超过2000亿美元,大部分用于数据中心建设。Vahdat在接受Sequoia Capital合伙人Sonia Huang访谈时表示,长程智能体(long-horizon agent)的崛起正在从根本上改变数据中心的设计逻辑,不仅推高了对加速器的需求,也让CPU、网络与存储的需求同步"暴涨"。他同时透露,谷歌必须大约每六个月将服务侧token生成能力翻一倍,而这一增长的主要来源并非硬件本身,而是软件与模型优化的持续叠加。

对投资者而言,Vahdat的判断具有直接参考价值:电力是AI基础设施扩张的最根本瓶颈,而非芯片或制造产能;软件优化对容量提升的贡献"很可能不少于硬件";TPU路线图上,推理与训练芯片已于今年首次分拆为独立产品线,折射出推理市场的快速膨胀。

不是FLOPS,是Goodput:真实故障条件下的问责逻辑

Vahdat将FLOPS定性为"虚荣指标",认为它只反映单颗芯片的理论上限,而实际工作负载性能取决于数千乃至数万颗加速器、CPU、网络和存储如何协同运作。

"在10万加速器规模上,总会有东西在坏,一直如此,"他说。一旦同步工作负载中任何一个组件失败,整个系统可能需要回滚至上一个检查点重新计算,这部分"无效工功"正是goodput与throughput之间的差值所在。他将其类比为在纸上解题:每次因错误回到第一步,过程本身虽然消耗了计算资源,但并不算作有效交付。

故障原因则呈现出典型的长尾分布。Vahdat坦言,"如果存在某个最常见故障原因,我们早就把它找出来修掉了",问题来源涵盖网络互连、硬件本身、编译器缺陷、运行时错误乃至操作系统问题,每引入一代新产品都会带来新的故障模式。

Agent时代重塑数据中心架构:CPU与存储需求同步爆发

Vahdat将长程智能体的兴起视为过去一年内影响数据中心设计的最大结构性变量。

在传统人机交互模式下,用户读取模型响应、思考、再次输入,中间存在数秒乃至数十秒的"人类节拍",这天然限制了请求频率。而在智能体场景中,模型无需等待人类,响应延迟可从秒级压缩至毫秒级,请求密度呈数量级提升。

同时,智能体在推理和编排环节大量依赖CPU:解析上一步响应、判断下一步行动、从本地DRAM、远端内存、SSD或HDD中抓取上下文——这些操作均运行于CPU而非加速器之上。"加速计算需求在上升,但CPU、网络、存储等传统数据中心组件的需求也在暴涨,"Vahdat说。

这直接引发了数据中心布局的两难:若在GPU/TPU机架旁配置大量CPU机架,将破坏针对加速器的专用化设计;若将两类机架分置于不同建筑,则楼间网络将引入数百微秒的排队延迟,并显著拉升可靠性与成本压力。

TPU首度拆分推理与训练:芯片专用化的边界在哪里

谷歌今年发布的TPU第8代首次分拆为两颗独立芯片:8i用于推理,8t用于训练。Vahdat将这一决策定性为对推理市场规模预判的直接结果。

在此前的单芯片策略下,一颗芯片需同时兼顾推理与训练,两类工作负载均无法得到极致优化。随着推理在总算力需求中的占比预计升至50%乃至更高,专门化的边际收益开始超过专用化带来的灵活性损失。

不过,Vahdat强调,这次拆分设置了一个关键安全阀:8i和8t均保留了执行对方工作负载的能力,只是非专长方向性能有所折损。"如果8i完全不能做训练,我们就必须提前精准预测六年生命周期内两类负载各自的需求量,"他解释道,这将带来难以承受的预测风险。

在更宏观的专用化哲学上,Vahdat描述了一条从通用GPU到Transformer原语固化,乃至"将特定模型架构烧入硅片"的连续谱系,并表示已有公司开始探索最后一步。谷歌目前的判断是:Transformer所依赖的矩阵乘法、softmax等线性代数原语已基本固化于硬件,进一步专用化到具体模型层是"非常非常有趣的方向",但尚未落地。

光路交换:从MEMS反射镜到毫秒级故障切换

谷歌约15年前率先将波分复用(WDM)引入数据中心,随后叠加了光路交换(optical circuit switching)技术——后者在纯光域内完成数据路由,绕过了传统电分组交换逐包查表的电域处理环节。

Vahdat介绍,谷歌最初采用MEMS微机电开关,通过在三维空间内精确控制微型反射镜的角度,将任意输入光纤端口的光信号导向指定输出端口,实现可编程的光域路由。这一技术最初服务于两个目标:在高频通信的计算集群与存储集群之间建立光域捷径;以及在无需人工移动光纤的前提下,通过软件控制器动态重构网络拓扑以实现扩缩容。

在TPU集群中,光路交换还具备关键的容错价值:当某个TPU机架发生故障时,系统可在毫秒级内将光路重新指向备用机架,无需任何物理操作,直接压缩goodput损失。

Vahdat透露,轨道数据中心场景下,组件间将真正转向自由空间激光通信——这也是他在地面场景中回避该方案的原因(衰减损耗与大规模三维对准难度过高),但在太空环境中上述限制大幅弱化。

电力是根本瓶颈:与公用事业共同规划多年,吉瓦级需求重塑供电模式

被问及AI基础设施扩张的最大约束,Vahdat的回答直接而明确:"电力是我们面临的最fundamental约束。其他所有问题我们似乎都知道如何在一段时间内解决;电力则是长期binding问题。"

谷歌的首选模式是与公用事业并网,而非自建独立电源。原因在于统计复用效应:若完全自给,达到99.99%以上可靠性意味着需建设两倍装机容量;而通过与公用事业的长期协同,在更大基数上平滑需求波动,双方均可降低冗余成本。谷歌承诺自行承担因其接入所需新增的输电线路和变电站建设费用,以避免将成本转嫁至其他用户。

但供需错配现实存在。Vahdat举例:若某年需要1吉瓦,而公用事业当年只能提供700兆瓦,谷歌可能临时自建太阳能+储能以填补缺口,并在最热月份将本地发电回馈电网。

关于单体数据中心的最优规模,他坦承这是"大量争论的来源",且高度依赖选址:训练集群偏向吉瓦级集中部署以最小化网络延迟;而服务集群需分布全球贴近用户,单体规模更小,且因需混合配置存储与计算,专用化程度相应降低。

成为付费用户可以阅读 谷歌 所有资料

了解更多 →