一家初创公司,想颠覆CPU
最近,有一家较新的 CPU 初创公司浮出水面,那就是由Gerard Williams III、John Bruno 和 Ram Srinivasan 几位曾在苹果、Nuvia 和高通公司任职的资深工程师创立的Nuvacore。
从履历上看,他们都拥有丰富的定制 CPU 设计经验。例如,Williams 此前曾联合创立 Nuvia,后被高通收购。除此之外,Nuvacore 还聘请了前苹果 CPU 工程负责人 David Williamson 担任硬件工程高级副总裁。
需要强调的是,该公司的创始团队的背景并非简单的履历堆砌。这些人打造了过去二十年来最具颠覆性的CPU架构。他们并非管理芯片项目的管理人员,而是架构师,在乱序执行深度、分支预测策略、内存子系统设计以及电源管理等关键的微架构决策上做出了决定,这些决策直接影响着芯片的性能,而他们的努力也取得了巨大的成功。
值得一提的是,这家公司获得了红杉资本的加持。考虑到红杉过往的成功经验,这家公司的未来尤为值得关注。
为何是CPU?
之所选择CPU赛道,固然与团队的背景有关。另一方面,这与行业的需求转变也有关。
正如大家在过去几个月的讨论那样,大型市场参与者一直在朝着某个方向发展,以应对智能体人工智能(Agentic AI)。NVIDIA 的 Vera CPU、Arm 此前发布的 AGI CPU以及 Intel 将 Xeon 定位为推理处理器,都表明 CPU 在智能体人工智能中的主要角色是编排:管理工具调用、在模型之间进行路由,以及处理 GPU 和加速器原本不擅长的控制流这种概括很准确——但实际情况远不止如此。
想想智能体系统一天到底在干什么。它不会出现,处理一批任务,然后就回家。相反,它会持续运行。它会在跨越数小时甚至数天的对话中保持上下文信息,不断地从内存中提取推理轨迹,刷新向量存储,并在决定下一步行动之前检查已有的知识。这些内存访问无处不在。它们不规则、不可预测,与CPU缓存架构师过去30年来一直在优化的清晰、可重复的模式截然不同。
CPU并非独立运行。它需要调用多个工具,启动子代理,等待响应,并将结果反馈到下一个决策中。同时,它还要与旁边的GPU、底层存储架构以及连接其他所有系统的网络共享相同的系统资源。听起来很复杂?确实如此。而且,这个循环中任何微小的效率损失都不会一直很小,它会不断累积。在生产规模下,数百万个代理交互同时运行,对延迟和一致性的要求远远超出了当今服务器CPU的设计能力范围。
当前一代高性能CPU的设计基于早于智能体运行模型的工作负载假设。服务器CPU针对可预测的企业级工作负载进行了吞吐量优化,而客户端CPU则针对突发性能和激进的电源管理进行了优化。这两种设计都无法完美地匹配需要持续、高效且低延迟地协调数百万次智能体交互的处理器。
基于上述思考,我们对 Nuvacore 的乐观解读大致如下:该团队审视了当前的市场格局,得出结论:目前还没有人真正从根本上构建适合智能体人工智能的处理器。Arm 的 AGI CPU 只是对现有产品的改进。NVIDIA Vera 的设计理念是与 GPU 并行。Intel Xeon 则是在传统架构上进行了一些扩展。
总而言之,整个市场都在基于一些在人们真正理解智能体工作负载特征之前就已经存在的假设进行迭代,这更加强了他们进入这个领域的信心。
指令集架构之谜
在确定了CPU赛道之后,他们毅然决然进入了这个赛道。
该公司将目标定位为“通用CPU核心”,旨在满足“高级人工智能系统和智能体计算的高强度、持续性需求”,这种说法很有意思。他们并非在设计TPU,也不是矩阵加速器,更不是像Cerebras和Groq那样设计专用推理引擎。他们打造的是CPU。Nuvacore的核心论点是,这款CPU必须为智能体计算领域带来根本性的变革。这是一个很有意思的观点。
在9月29日发布的一篇文章中,该公司介绍了他们开发的WarpCore的独特之处。据介绍,该产品其所谓的“核心优先”开发模式:
“Core First 是一种突破传统行业构建方式的方法,它赋予我们 NUVACORE 团队自由,让我们能够首先构建绝对最佳、性能最高的内核,然后选择最适合我们——或我们的合作伙伴——想要构建的系统的指令集。”
Nuvacore表示,他们不会在项目开始时就选择指令集架构,而是可以先构建大部分基础CPU核心IP,然后再根据自身或其合作伙伴最终想要构建的系统来选择指令集架构。
这与传统的CPU设计方法截然不同,在传统方法中,目标指令集架构(ISA)通常从一开始就决定了设计方向。Nuvacore表示,将微架构的部分内容与指令集解耦,使其工程师能够更自由地专注于性能、能效和芯片面积。
该公司尚未透露WarpCore最终将采用哪种ISA。然而,其招聘材料中提到RISC-V、Arm64和x86架构都与其工程工作相关,这表明底层设计在开发时充分考虑了ISA的灵活性。
当然,这并不意味着指令集可以简单地在最后阶段添加到核心上。解码、特权级别、内存顺序、异常处理和软件兼容性仍然对CPU设计构成重大限制。而借助Nuvacore,显然可以在最终确定指令集架构(ISA)之前,开发出足够多的性能关键机制。
该公司发布的招聘信息透露了一些关于其基础性工作内容的线索。该公司正在招聘从事分支预测、指令调度、寄存器重命名、乱序执行、加载/存储设计、缓存和内存子系统、一致性以及性能建模等工作的工程师。此外,该公司还在招聘RTL、验证和物理设计方面的职位,工作内容涵盖流片和芯片后验证等环节。
最终选择指令集架构(ISA)的法律问题也尚未解决。RISC-V 相对简单,因为它不需要 Arm 式的架构许可。基于 Nuvacore 自有微架构的 Arm 实现则需要在某个环节获得相应的 Arm 架构授权,而鉴于 Arm 的业务是销售 CPU 设计 IP,获得授权可能会比较棘手,尤其是考虑到Arm 过去与高通/Nuvia 的法律纠纷。最后,x86 的门槛更高,因为其实现权受到严格控制。
这引出了另一种可能性:WarpCore 可能旨在成为可重用的 CPU IP,供拥有相关架构许可的合作伙伴进行适配。该公司尚未明确其长期商业模式将以完整的 CPU、可授权的核心 IP、半定制芯片,还是三者的某种组合为核心。
目前,WarpCore 的工艺节点、缓存层次结构、流水线配置、向量功能或流片计划等关键细节尚未公布,但它刻意保持指令集架构 (ISA) 决策开放,这使得它成为目前正在开发的较为不寻常的全新 CPU 项目之一。
Nuvacore需要回答的难题
了解了以上背景之后,我们便能看出这里存在着一些真正的挑战。首先,Nuvacore 团队的过往业绩主要集中在客户端,而非数据中心领域。他们的声誉是在苹果公司建立起来的,而苹果公司为一个封闭的生态系统设计芯片,该系统拥有已知的散热性能、已知的工作负载、已知的软件栈,以及一个单一的客户:苹果自身。虽然 Nuvia 公司在 2019 年成立之初就立志进军数据中心领域,但在推出服务器产品之前就被收购了。高通公司实际推出的产品是 Oryon——一款优秀的笔记本电脑芯片,但终究只是一款笔记本电脑芯片。
数据中心工作中不为人知的一面是:它并非光鲜亮丽的工程。在各种会议上,可靠性、可用性和可维护性(RAS)——至少在那些最热门的会议上——不会有人因此获得掌声。但当你需要确保生产机架上的CPU连续运行五年时,这才是真正重要的工作。在错误导致节点宕机之前检测并隔离它们;与虚拟机管理程序堆栈完美协作;对NUMA拓扑结构有足够的了解,以免成为意想不到的瓶颈。这才是数据中心工作的本质。
英特尔和AMD几十年来一直在x86架构上做着同样的事情。这种能力已经深深融入到他们的组织架构中,而这些在产品路线图上是看不到的。这是一种根深蒂固的组织记忆,源于多年来与企业客户在凌晨两点遇到故障时进行的艰苦沟通。Arm的Neoverse项目也值得一提。这些芯片之所以能在数据中心取得成功,并非因为它们的基准测试成绩出色,而是因为Arm花费数年时间与AWS、微软和谷歌等公司深入合作,共同解决一系列详尽的数据中心特定需求,而这些需求你永远不会在新闻稿中看到。这种合作时间并非可有可无,而是成功的必要条件。
没有理由认为 Nuvacore 团队无法完成这项工作;所需的技能是可以学习和招聘的。但这与他们之前开发的项目截然不同,差距也不容小觑。值得注意的是,该公司发布的招聘信息包括操作系统负责人、固件负责人、遥测和可观测性负责人以及软件验证负责人。职位列表没错。问题在于,考虑到红杉资本和潜在客户的耐心,这样的执行时间表是否现实。
这里还有另一个尚未得到充分重视的挑战:数据中心真的准备好迎接下一代芯片了吗?我认为没有——但原因可能并非你所想。这不是技术成熟度的问题,而是疲劳的问题。数据中心架构师们不会闲着没事干,盼着能有更多供应商来评估。首席信息官们已经疲于应对现有系统的管理,还要努力将新一代人工智能基础设施与现有环境相融合。
所有带着新芯片进店的公司都始终低估了客户最终决定采用该芯片所需的成本。评估芯片、进行认证、集成、培训团队、以及在出现故障时提供支持……这些都会消耗企业有限的资源。
真正让一款新设计的 CPU 进入数据中心,通常有以下三种情况之一:超大规模数据中心将其作为定制芯片采用;成熟的 OEM 厂商承诺围绕它构建平台;或者性能和效率差异足够大,迫使成本压力促使厂商重新评估。
我认为Nuvacore正在追求第三条道路。但要走上这条路,它还需要在交付量产芯片之前,赢得超大规模数据中心的设计订单(可能性更大)或与OEM厂商建立合作关系(也许)。而要做到这一点,需要投入大量的信任资本,因为这款产品至少要两到三年才能完成流片。我怀疑Nuvacore团队已经拥有了一部分这样的信任资本。至于资金是否充足,以及时间安排是否与超大规模数据中心多年的产品路线图规划周期相符,目前还不得而知。
最后,我们能稍微谈谈“CPU”这个词吗?因为我觉得它现在承担了很多它原本设计之外的工作。
目前,“CPU”更多的是一个定位术语,而非精确的架构描述。我们真正讨论的,无论是Nuvacore、Arm的AGI CPU、NVIDIA Vera还是采用AMX技术的Intel Xeon,更接近于“人工智能时代异构计算系统中的主机处理器”。这才是更准确的说法,尽管它永远不会出现在产品规格书中。所以,大家现在都用“CPU”这个词,希望客户能自行理解其真正含义。
Nuvacore 将会直接面临这个问题。他们究竟在打造什么,将直接影响你如何看待他们的竞争地位。如果他们打造的是一款高性能通用核心,需要在各种工作负载下都具备出色的 IPC 和能效,那将是一场真正的硬仗。而另一边还有英特尔、AMD 和 Arm,它们都拥有数十年的客户关系和认证历史。这场战斗并非没有胜算,但你最好拿出远胜于他们的产品。
另一方面,如果 Nuvacore 正在重新思考执行层面的智能推理微架构——例如不规则的内存访问模式、持续的状态管理以及低延迟的编排需求——那么它所构建的东西,我认为很难被简单地归入任何现有的类别。这可能会使与非超大规模客户的商业洽谈变得更加困难,因为你卖的不仅仅是芯片,而是向那些已经不堪重负的买家兜售一种全新的思维模式。但这同时也是一个更有趣的问题。
持怀疑态度的人认为,这是一支世界级的团队,却在追逐一个他们从未涉足的数据中心市场,其产品可能还需要数年才能完成流片,而与此同时,超大规模数据中心运营商正在自主研发芯片,企业IT部门也面临着新一轮认证周期的资源紧张。“改写芯片规则”的说法,要么是对一种真正不同的架构方法的真实描述,要么就是所有芯片初创公司用来证明自身存在的惯用伎俩。
在公司展示芯片之前,我们无法判断哪种解读是正确的。红杉资本的支持表明,这家实力雄厚、在芯片市场评估和投资方面拥有卓越业绩的金融公司认为,乐观的解读比悲观的解读更有可能。这固然重要,但毕竟它还不是产品。在数据中心领域,从引人注目的架构概念到合格且可部署的CPU之间的差距,正是大多数雄心勃勃的芯片公司选择保持沉默的原因。
本文来自微信公众号“半导体行业观察”(ID:icbank),作者:编辑部,36氪经授权发布。