首页文章详情

硬氪首发 | 异构智算平台天使轮融资千万,瞄准英伟达和国产GPU算力调度

华南-彭丽2026-09-01 12:31
已经支持超过5种异构GPU。

硬氪获悉,近日异构智算平台与梯度Token工厂技术服务商博伦智汇完成千万级天使轮融资,投后估值约1.5亿元。本轮融资由专注AI及AI Infra赛道、同时布局过大模型训练框架的一线产业基金投资,将主要用于异构智算核心技术迭代、算力基础设施产品打磨、核心技术团队扩充。

博伦智汇创立于2026年,总部位于北京。CEO刘进治曾任职英特尔亚太研发中心,硅谷分布式系统软件中国负责人,在计算架构与系统软件领域经验丰富。刘进治2016年曾是全球首批专注自然语言处理的AI初创企业核心成员,后参与搭建中国第一批Nvidia Superpod训练集群,支撑大语言模型研发与服务落地。

CTO杨光在西门子通信、Oracle、IBM、华为云等跨国企业先后负责软件研发和系统架构,是云原生研发早期成员。公司核心成员均出自IBM、天数智芯、华为、趋动科技等创新企业,核心团队曾操盘国内第一批英伟达SuperPod训练集群,较早实现国产异构GPU万卡推理。

随着各地智算中心建设风潮,纸面算力规模持续攀升,但许多机柜上架后处于"空转"状态。有芯片不等于有算力,有算力不等于能用。从芯片到输出Token,中间横着几道工程鸿沟。不同架构芯片如何统一纳管?碎片化算力如何调度优化?算力如何按需分级,产出不同价值?

同时,全球AI Token日调用量已突破300万亿次。Agent兴起后,智能体复杂任务增加,单任务消耗Token量动辄十万甚至百万级,算力需求爆涨。全球AI推理芯片市场规模已近500亿美元,推理成本跃升为AI企业最大的运营支出。

刘进治向硬氪介绍,基于这一背景,公司自研了TOLD (Token Oriented Large-scale Distributed architecture)技术栈,将算力优化为梯级Token输出。

刘进治在2023年就进入了智算赛道。“我们在英伟达高端算力禁售前,做了国内第一批英伟达SuperPod,也就是基于英伟达DGX的SuperPod架构,并与头部大模型公司进行了深度合作。”另一方面,他带着团队也较早地介入了国产GPU的生态和技术体系。

受到地缘政治和国产GPU崛起等各种因素,各企业持有的GPU资产非常分散,既有英伟达的GPU,又有不同的国产GPU,“问题在于,这些不同的GPU本身因技术路线等不同没有办法直接协同使用。既能够把它们协同起来,又要做到最优是个技术难题。”

因此,国内企业如何把这些异构的算力资产整合起来并进行调优成为刚需,“而且随着各个企业、国央企积累的GPU资产越来越多、越来越多样化,这会成为一个非常大的需求。”

博伦智汇的自研架构TOLD则可以兼容英伟达及多种国产GPU架构,自研云原生分布式调度技术,实现万卡级异构GPU的统一纳管与推理调度。让不同芯片在同一套框架下按模型效能最优协同工作。面向token及应用,还能提供大模型一键适配、B2B2C多租户创新模式。

刘进治介绍,公司目前已经有签单客户,接下来还会推出硬件产品。以下是硬氪与他的访谈节选:

硬氪:现在大模型阶段,算力主要被用在哪些环节?

刘进治:如果按大模型阶段来看,算力主要分成两大块:大模型训练,以及训练完成之后的推理应用。

现在大模型公司已经比较集中,也有一些国央企自己在训练大模型,但不会对外商业化,只是内部使用,它们的投入也很大。这些公司还在持续大量铺设训练算力。中国优质的训练算力目前大概还不到美国的十分之一,所以训练算力还需要继续追赶。

未来更大的市场是推理,DeepSeek R1带动了真正的推理和AI落地,再加上今年出现的一些新的应用,对Token落地带动了大量推理需求。长期来看,推理需求可能会达到训练需求的十倍甚至百倍以上。随着大量AI应用落地,推理理论上会成为一个更加广泛的市场,也是国产算力能够发挥很大作用的地方。

硬氪:你们自己的TOLD技术栈具体是什么?技术壁垒体现在哪里?

刘进治:它有几个特点,第一是面向Token,让Token做到最快、最优。第二是Large Scale,市场上有很多公司都在讲异构,但我们的特点是真正做过大规模的国产GPU集群。从工程角度来讲,大规模异构和做几台异构完全不一样。比如现在一些最新的国产卡,单卡性能已经逼近英伟达H200,但大模型训练需要上千张甚至上万张卡组成超大规模集群,这种集群的稳定性才是最大的挑战。

另外,我们的集群可以分布在全国甚至全球。实际上,我们拉管过超过10个千卡级别、分布在全国各地的计算中心,达到万卡级别。在这个过程中,我们做了非常多研发。第一层是调度层,我们基于云原生,但会深度修改云原生底层的一些东西。这不是单一的架构,我们需要把云、分布式架构、大规模分布式架构,以及对模型本身的理解融合到产品里面。

目前已经支持超过5种异构GPU,包括英伟达和国产的大规模GPU。

硬氪:目前这种大规模异构平台已经得到验证了吗?主要在哪些场景?

刘进治:我们实际做过超过10个千卡级别组成的万卡级国产GPU集群,类似一个“大网吧”,这个集群真实对外提供服务。后来有一些卡被商业化出租,但我们已经在这个上面完成了验证。

这个场景其实比较通用,可以To B,也可以To C。To B可以给企业内部提供服务,比如一家做AIGC短剧的公司,它需要调用不同的语言模型、多模态模型和生图模型,也可以是具身智能,或者其他泛生态场景。C端则是个人使用,比如个人养“龙虾”,Agent工具调用,codex、claude code等都可以接入我们提供的模型。

硬氪:你看重C端的原因是?后续会有什么样的商业模式?

刘进治:现在大家都在说用不起“龙虾”,因为它白天晚上都要待机跑任务。核心问题是现在还没有做好分层,大家都想一起上最顶的模型,而最顶的模型也意味着后面使用最贵的卡。

但实际上,大量工作比如整理文件、数据,基础模型完全够用了,也就意味着便宜的卡就够了,尤其是国产GPU。

在商业模式上,C端我们首先会自营一部分Token工厂,架设在自己的平台上,我们会做好调试工作,保证用户可以自己选择想要的模型,同时给出最优选。B端我们可以和企业合作,为自己的私有化智算集群提供服务,甚至从头给它设计,看匹配什么样的卡型来满足它的具体场景。