首页文章详情

Waymo自研芯片曝光:1000 TOPS只是表面,160 TOPS才有看头

汽车之心2026-08-26 11:41
Waymo芯片只有160 TOPS,为什么敢说超过1000 TOPS?

一颗芯片,官方宣传算力超过 1000 TOPS,但真正公布的稠密计算吞吐只有 160 TOPS。

是 Waymo 在「注水」,还是 1000 TOPS 这个数字本身没那么重要?

答案可能是后者。

Waymo 这次自研芯片最值得关注的,并不是它有多少 TOPS 算力,而是Waymo 开始把自动驾驶芯片的竞争,从「堆算力」拉向了「拼数据搬运效率」。

01

1000 TOPS,

为什么实际只有 160 TOPS?

8 月 20 日,Waymo 正式宣布推出自研 5 纳米芯片,并在 8 月 24 日的 Hot Chips 大会上详细说明了这款自研芯片。

在 Waymo 的官网上,Waymo 宣称其算力超过了 1000 TOPS

对普通人来说,算力值就是 TOPS 数值,越高越好,Waymo 也不能免俗。

但在 Hot Chips 大会上,面对专业观众,Waymo 就没必要只强调峰值算力值了。

这颗芯稠密张量计算吞吐能力仅为 160 TOPS,和英伟达一样,Waymo 也做了 2倍的结构化稀疏,也就是稀疏模式下吞吐能力为 320 TOPS。

这说明 Waymo 算力不高吗?

也不对,其实际算力应该比众多号称超 1000 TOPS 的算力要强很多,

行业通常公布的是理论峰值算力,而理论 TOPS 与真实模型吞吐、时延之间往往存在明显差距。

Waymo 这次把稠密/稀疏、不同精度下的吞吐能力写得十分清楚,反而让 160 TOPS 这个数字更有参考价值。

举例来说,TOPS 更像汽车的「理论最高时速」。

但真正跑起来,决定一辆车快不快,不只是最高时速,还要看路况、变速箱、轮胎,以及动力系统等因素,能不能将动力真正释放出来。

芯片也是一样,1000 TOPS 是理论峰值,不代表实际模型就能持续跑到 1000 TOPS。

芯片的 TOPS,就像汽车的马力:账面数字很重要,但真正决定体验的,是「能把多少动力用出来」。

Waymo 这颗芯片面积达 208 平方毫米,差不多是理想马赫 M100 的一半,采用台积电 5 纳米工艺,MOP 存储封装一体设计,主机接口采用最先进的 8Lane PCIe 5.0,32GB/s 带宽,是万兆以太网的 25 倍,另配 25G 以太网,整芯片功耗低于 75W。

这个功耗水平对车载散热环境相当友好。

02

Waymo 为什么不再满足于买现成芯片

很多人可能会好奇一个问题:Waymo 已经有成熟的英特尔计算体系,为什么还要自己造芯片?

事实上,Waymo 从 2016 年就开始考虑自研芯片,但是模型变换化太快,芯片设计不得不一次次迭代。

对于 Waymo 这样的 Robotaxi 公司来说,模型、算法、数据和硬件之间的耦合越来越深,通用芯片上存在大量用不到的资源浪费。

自研芯片不只是为了省成本,其意义可以分为三层:

针对自己的模型做芯片。不是「什么 AI 模型都能跑」,而是「我的模型需要什么,我就设计什么」。

减少数据搬运。计算的真实过程是「计算→搬数据→再计算→再搬数据」,如果大量时间耗在搬运上,再多计算单元也没有意义。

软硬件协同。模型、编译器、芯片一起设计,这才是 Waymo 这颗芯片真正值得汽车行业关注的地方。

Waymo 的芯片架构,核心是 carTPU,Waymo 外购的 IP 包括了 GPU、片上互联、LPDDR5X 控制器和物理层、PCle PCIe 控制器和物理层、以太网控制器和物理层、安全根等,自研了视频 ISP、codec 和 MIPI 以及 scratchpad 暂存器。

需要说明的是,这并不影响「自研」的成色。

今天的「自研芯片」,早已不是从晶体管开始全部自己造,而是围绕自己的模型和工作负载,把关键计算路径:芯片架构、数据流、视频处理、编译器和计算核心等重新设计一遍。

Waymo 正是这样做的。

Waymo 自研芯片的核心人物 Pieter Kapsenberg,2005 年进入英特尔,2014 年进入谷歌的视频 codec 硬件部门,2016 年进入 Waymo。

另一位核心人物 Sabareesh Ravikumar,早年在苹果设计,2017 年 9 月加入 Waymo,尤其擅长存储系统设计。

03

Waymo 真正想解决的,

不是算力,而是「数据搬不动」

实际上 Transformer 时代,基本上超过 100 TOPS 后,TOPS 数值的边际价值急剧下降,瓶颈完全在存储部分。

差不多 70-90% 的时间,计算单元都在等待存储系统搬运数据而空转,也就是大名鼎鼎的 Roofline 模型,汽车行业无法使用多 batch,batch 一般都是 1,这种现象更明显。

现在进入世界模型时代,也就是 DiT(Dif fusion Transf ormer)时代,存储瓶颈更加明显。

Roofline Performance 模型,Roofline 模型曲线图X 轴表示 Flops/byte ( GFlops per byte)即操作强度,Y 轴表示 GFlops/s(GFlops per second)

这就是芯片设计领域大名鼎鼎的 Roofline 模型揭示的现实:芯片有两种极限,一种是算力不够,一种是数据喂不饱。其核心只有一个公式:实际性能=min(峰值计算性能, 内存带宽×算术强度) 。

水平线表示计算机或芯片的峰值浮点性能,任何浮点运算的实际性能都不会超越这条线,因为它代表硬件限制。

斜线表示该计算机内存系统在不同操作强度下支持的最大浮点操作性能。

而 Waymo 认为,今天很多 AI 任务真 正遇到的已经不是前一种,而是后一种。 目前绝大部分场景下,算子的算术强度低于芯片的平衡点,性能受内存带宽限制。

换句话说,计算得很快,但数据搬运跟不上。

AI 模型既有「大批量计算」的场景 (矩阵乘法,即 GEMM) ,也有「一个数据一个数据往外算」的场景 (矩阵向量乘法,即 GEMV) 。

后一种 GEMV 计算,对内存带宽和数据搬运效率尤其敏感。

这恰恰是自动驾驶实时推理最常见的计算模式。

Waymo 这颗芯片,明显就是针对这类计算优化的。

理解了这一点,再看 Waymo 的架构设计,每个参数背后都有因果关系,而不是简单的参数罗列。

其中,三个最关键的设计是:

5nm 先进工艺,证明 Waymo 不只是做一颗辅助芯片,而是真正进入高性能 AI 芯片设计第一梯队;

大容量、高带宽片上 SRAM,每颗 carTPU 包含两个核心,每个核心包含 16 个计算单元即 PE,每个核心包括 2MB 的 SRAM,带宽高达 640GB/s。整颗芯片片上 SRAM 总量达 6 4MB ,外加 8MB 寄存器文件。 这直接服务于「数据搬运比单纯算力更重要」的核心目标,数据尽量留在片上,少去外部内存兜圈子;

GEMV+双 DMA 架构。Waymo 的 PE 架构,每个 PE 含 4 个计算 slice,每周期可完成 512 次 INT8 GEMV 运算,Waymo 显然是针对 GEMV 算子专门设计的芯片。DMA 即直接存储访问,PE 之间是 Mesh DMA,权重和计算值输出是 Ring DMA,两套 DMA 分工协作,尽量减少数据搬运。这直接证明了这颗芯片是围绕 Waymo 自己的自动驾驶工作负载定制的。

此外,灵活的 GEMV 路径能够根据不同的计算原语 (指的是最基础、不可再分解的基本操作、数据类型或元素) 进行适配。

Waymo 会对运算方式进行动态调整,以实现最大的 PE 利用率。

这一点至关重要,因为它能确保张量核心 (Tensor Cores) 在处理各种形态迥异的网络层时始终保持高负载运行。

04

自动驾驶芯片,

开始进入软硬一体时代

硬件只是一半,软件才是这颗芯片真正的难点。

Waymo 的数据流原则,数据流原则确保了硬件的精简。

Waymo 采用具有静态形状的确定性「巨型指令」 (mega-instructions) ,在约一千个时钟周期内进行单线程执行,期间不涉及缓存或分支操作。

同时,利用 FIFO 队列以及带信号量的存储机制,来协调计算线程与 DMA 线程之间的数据顺序及背压 (backpressure) 控制。

这意味着其编译器设计难度极高。

Waymo PE 处理不同算子时的路径

Waymo 的软件架构,遵循「编译器优先」的设计理念:

采用预先编译 (AOT) 方式,针对整个模型构建一个超大内核 (mega-kernel) ,并将其切分以适配 SRAM。编译器则负责管理分区、全局内存数据传输、竞态条件以及数值精度。

上层对接谷歌的 JAX、TensorFlow 等主流框架,开发者可以用熟悉的方式写模型,剩下的交给编译器。

这本质上就是:模型、编译器、芯片一起设计。

Waymo 在 Hot Chips 上强调,实际达成的性能表现比理想 TOPS 数值更为重要。

从 Waymo 公布的数据看,在 VLM、视觉 ConvNet 等自家真实工作负载上,这颗芯片相对通用加速器取得了数倍的性能效率提升。

未来,Waymo 计划逐步用自研芯片替代原先基于英特尔的计算体系。

但这件事对汽车行业的意义远不止于此。

它可能意味着,自动驾驶的竞争正在从「谁的模型更强」,进入「模型+数据+芯片+编译器一起优化」的阶段。

这和当下智能汽车行业正在发生的「软硬件一体化」趋势完全一致。

下一阶段的自动驾驶竞争,可能不再只是比模型、比算力,而是比谁能把整套计算系统做得更高效。

而 Waymo 真正想造的,可能不是一颗更强的芯片,而是一套更适合自动驾驶的计算系统。

本文来自微信公众号“汽车之心”,作者:周彦武,36氪经授权发布。