首页文章详情

端侧AI“小时代”

象先志2026-09-08 15:26
大时代,还得等等

“小时代”的开场,是一阵Mac mini抢购潮。 

2026年1月下旬,一个当时还叫Clawdbot、后来以“龙虾”之名为人所知的agent走红。然后,就引发了Mac Mini的抢购潮。

人们开始为一个随时能干活的 AI,单独准备一台电脑。

图 1|2024 年发布的 M4 Mac mini。图片来源:Apple Newsroom。

随后, 苹果已经开始在传播层面刻意转向agent。新款Mac mini不再只讲办公和创作,也开始强调全天候运行智能体;Mac Studio则继续向需要在本地运行大模型的人出售大内存。

小米也在近期展示了AI Cube。三颗玄戒芯片装进一个铝合金方盒,配上80GB统一内存,在本地部署大模型。

更早入场的英伟达,已于2025年10月开始交付DGX Spark。联想、华硕、惠普、戴尔也围绕GB10推出整机。原本卖笔记本、工作站和小型电脑的公司,开始争夺一种新订单:用户希望把一部分AI算力留在自己手里。

端侧 AI 即将迎来大时代?别急,现在还只是“小时代”。

模型正在改写电脑规格

不过是在两年之前,AI PC最典型的配置还只是一块NPU。

微软给 Copilot+ PC划出的门槛是40 TOPS NPU、16GB内存和256GB存储。厂商拿实时字幕、图像处理等功能介绍本地 AI。这套标准可以放进原有的轻薄本,用户仍然按熟悉的方式使用电脑,只是多出几项由专用计算单元承担的功能。

但同时,由苹果的统一内存开始,用户们渐渐开始部署本地模型。2025年3月,苹果已把最高 512GB统一内存放进M3 Ultra Mac Studio,并以本地运行数千亿参数模型为卖点。在这个时间,本地部署还只是专业工作者们的选择,因为动辄大几万的Mac Studio,还远没能下落到普通消费者的购买区间。

到了今年,端侧 AI 的产品继续生长。小米 AI Cube原型机配备80GB 统一内存,DGX Spark和一批GB10整机是128GB,AMD Ryzen AI Max 300系列最高支持 128GB;新款 Mac Studio继续提供最高 512GB,内存带宽提高到1.2TB/s。

内存是重中之重,这已经不是什么秘密。模型权重、上下文缓存和运行时会迅速吞掉内存。以4 比特量化粗算,70B模型仅权重就约需35GB,尚未计入量化元数据、缓存和系统开销。

部署完成之后,速度又成了下一道门槛。

DGX Spark的128GB统一内存,搭配的是273GB/s 带宽。前者关系到能装下多大的模型,后者影响计算时搬运数据的速度。真正生成回答时,模型精度、上下文长度和推理软件还会继续影响结果。增加内存,并不能包办后面的工作。

即使模型已经跑起来,用户也未必用得起来。模型怎样下载和更新,应用怎样调用,读取文件之前需要哪些权限,持续运行出了问题由谁维护,都要有人处理。用户买回去的是一台电脑,这些环节却未必由同一家公司完成。

联想、华硕、惠普可以采用英伟达的 GB10 平台,完成整机设计、销售和服务;苹果可以同时调整芯片、系统和开发工具。小米则把自己的芯片装进原型机,尝试参与决定一台个人 AI 设备应当怎样计算。

这几条路线,反映的是各家公司愿意承担多少研发投入,又希望掌握多少产品决定权。采用现成平台的厂商,可以把更多精力放在产品化和交付上;自己设计芯片,则要先承担研发和验证投入,换取对内存架构、计算单元和功耗分配更大的调整空间。后续还要靠足够的产品销量,摊薄持续迭代的成本。

自研芯片因而是一种选择,而非所有参与者的入场条件。同样使用 GB10 的两台机器,底层能力可能很接近,安装体验、维护服务和客户关系却可以由不同公司掌握。

图 2|个人端侧 AI 的产业分工。一家公司可以参与多个环节,各款产品的集成程度仍有差别。制图:象先志。

新的电脑订单由此带出了一个更大的问题:用户为本地 AI 多花的钱,最后会留给提供芯片的公司、提供系统的公司,还是把机器卖给他的公司?

苹果和小米,都在尝试让更多环节留在自己手里。只是它们手里已有的东西,以及还要花钱补上的东西,很不一样。

苹果握住整套系统,小米向底层伸手

苹果可以同时改芯片、系统和开发工具,它 不需要用户决策新买一台AIPC,就可以让模型部署在本地。

统一内存是苹果的杀手锏:苹果的 MLX 框架让 CPU 和 GPU 使用共享内存里的数组,减少在不同计算单元之间搬运数据的需要;MLX-LM 则提供模型运行、量化和微调工具。开发者下载第三方开放模型,也可以使用苹果为自己硬件优化的工具来运行。

这条路径主要使用 CPU、GPU,并不只靠专用 NPU。今年预览的 Core AI 框架又对统一内存和神经网络引擎进行优化。苹果能够围绕同一套硬件持续补软件,而不是每增加一项 AI 功能,就重新寻找一套计算平台。

8 月的更新进一步拉开了产品梯度。M6 Mac mini 6999 元起,内存最高 32GB;M5 Pro 版本最高 64GB。需要更大模型、更重开发任务的人,可以继续向 Mac Studio 的 128GB、512GB 配置走。新机已于 8 月 27 日接受预购,官方计划 9 月 22 日开始发售。

图 3|新款 Mac Studio 提供 M5 Max 和 M5 Ultra 配置。图片来源:Apple Newsroom。

用户本身是有分层的:普通用户需要的是已有应用里多几项好用功能;开发者在意能不能把自己的模型和代码放进去;研究团队、专业创作者才更可能为大内存和持续负载买单。但苹果可以用同一套系统承接不同预算,不必为每一层用户重建销售渠道。

掌握整套平台,也没有让苹果拒绝外部模型合作。6 月公布的第三代基础模型与 Google 合作开发,其中既有 3B 端侧模型,也有采用稀疏结构、按请求调动部分参数的 20B 端侧模型。

合作改变了模型的来源,系统和产品决策权仍然在苹果手里。哪些模型进入系统服务,开发者通过什么接口调用,应用读取文件之前如何获得许可,仍由它的平台安排。外部模型可以进入 Mac,用户不必因此离开 Mac。

因此,苹果的商业算盘并不只是在传统的 Mac 上卖内存。它也在给现有硬件增加使用理由,让开发者把新功能继续做在自己的系统里。模型和框架还在随系统版本、地区与测试进度逐步开放,但已有的产品线和用户关系,让苹果可以分批推进这件事。

小米想握住类似的主动权,但明显和苹果走的不是一条路。

AI Cube里三颗芯片的分工很能说明问题:O3面向个人智能终端,O100面向端侧 AI加速,D100面向智能驾驶。小米把几条芯片研发线放进同一台原型机,展示协同计算能力。按8月发布信息,O3已开启规模量产,O100和 D100计划明年商用。AI Cube本身仍是工程原型,没有公布价格和开卖时间。

图 4|AI Cube 工程原型机。图片来源:小米,IT之家转载。

自研的意义,首先在于小米可以自己组织一颗芯片的设计,并不意味着每个组成部分都从零做起。此前的玄戒O1就使用了Arm的Cortex CPU、Immortalis GPU和 CoreLink互连 IP。对小米而言,投入芯片设计,是在通用技术的基础上,为自己的产品安排计算能力、内存和功耗,而后还要接受制造、封装与存储供应的约束。

硬件这一侧还在推进,小米已经在米家上寻找它将来可以承接的任务。

6 月发布的 Miloco 2.0,把米家摄像头的音视频、MiMo模型与设备控制接在一起。它以OpenClaw插件的方式运行,尝试识别家人、记住习惯,再调动家里的设备。用户过去要预先设置“发生什么,就打开什么”,现在,小米尝试让 AI参与理解和安排这些事情。

不过有个事儿挺有意思:小米自己的安装说明,推荐准备一台全天运行的Mac mini。

图 5|Miloco 2.0 官方部署文档建议设备全天候运行,并推荐 Mac mini。来源:小米官方 GitHub 仓库。截图日期:2026 年 9 月 7 日。

小米可以先在别人的硬件上,把家庭 AI 软件做起来。Miloco 2.0当前主要调用云端大模型,AI Cube则展示本地计算能力,两者还不是一款完成整合的产品。从能控制家电的软件,到值得单独买一台主机来运行的服务,小米还要把这段路走通。

截至2026年6月底,小米 AIoT平台连接设备达到11.608 亿台,口径不含手机和平板;拥有五台及以上连接设备的用户达到2460万。这些人已经在使用米家,小米有机会把新的服务送到他们面前。

如果 AI 开始代替用户理解家庭状况、安排持续任务,负责作出判断的软件就会影响下一台设备如何被选择和使用。小米希望继续掌握这个入口,而不仅是向别人的智能体提供可控制的硬件。

芯片设计为它增加了根据自家场景安排计算的可能。但米家用户并不天然等于 AI 主机的买家。AI Cube还需要证明,与既有设备和云服务相比,它能完成哪些值得用户额外付钱的工作。目前,这台原型机与澎湃、米家、Miloco的完整协作方式,以及第三方模型和开发工具的支持情况,都还没有充分展开。

把芯片与系统一同放进个人电脑的,还有华为。MateBook Pro已搭载麒麟 X90 Plus;鸿蒙电脑的小艺本地 AI 可离线完成部分文档问答、摘要和改写。HarmonyOS 6的“本地 AI 模型管理”还允许用户在系统设置中下载模型,再让Chatbox、Cherry Studio等应用调用。

这让系统厂商进一步参与了模型分发。华为可以把本地 AI 放进办公用户熟悉的系统操作,但当前模型管理仍以单台设备为边界,不支持跨设备共享。产品已经落地,应用覆盖与跨设备体验仍有继续补齐的空间。

回到苹果与小米,两家公司的方向其实在此分野。苹果可以先让已经卖出的 Mac 多做一些事,再向重度用户出售更高配置;小米已经拥有家庭设备和用户,却还要证明,把专用计算硬件与家庭服务接起来,值得再发生一次购买。

图 6|苹果与小米的纵向整合路线。

PC 公司开始争夺 AI 入口

传统 PC 厂商已经有了另一种做法:共用上游平台,再把部署和服务做进整机。几家公司的GB10设备虽然挂着不同品牌,芯片和主要开发工具却来自同一套供应体系。

图 7|PC 厂商的共用平台与定制合作。制图:象先志。

共用平台省去了从头开发芯片和基础软件的投入,也把一部分产品决定权留给了上游。英伟达提供CUDA和模型工具,开发者先在桌面验证模型,再把更重的任务移到 NVIDIA 加速的数据中心时,可以沿用这套环境。桌面设备卖得越多,英伟达就越有机会影响后续计算任务的选择。

Windows AI PC延续的也是类似分工。整机厂可以从AMD、英特尔、高通采购芯片,微软则提供支持不同硬件的本地 AI 接口和模型管理工具。面壁、阿里、Google等模型供应方,又让整机厂不必各自训练基础模型。面壁已与英特尔合作适配 AI PC,也提供可在苹果芯片上运行的版本;开放模型可以跨品牌部署,具体商业使用许可仍需分别确认。

这让卖电脑的公司面对一个熟悉的问题:当竞争对手也能拿到相近的芯片和模型,客户为什么向自己下单?

一部分答案在模型运行之前。以惠普的部署工具为例,开发者在 VS Code 里就能找到局域网设备、配置远程连接,再装好 Ollama 等环境。整机厂替客户省下的是配置和维护的时间。过去的散热设计、售后支持仍然重要,如今还要有人处理模型安装、运行环境和持续更新。小团队买电脑时,也得考虑机器多久能用、出了问题谁来管。

部署之后,联想还想争取用户日常使用 AI 的入口。在国际市场,Qira正在部分 PC、手机和平板上扩展,优先本地处理,也调用云服务。工作站可以卖给开发者,这个个人助手则试图让更多用户在下一次调用 AI 时,继续通过联想的服务完成任务。

在中国市场,联想通过与芯片企业的定制合作开发 P7,参与需求定义和联合优化。这台主机可以本地运行天禧Claw,也能向其他应用提供模型服务。联想创投同时是相关芯片企业的投资方。对联想而言,这种合作可以围绕自己的软件提出产品要求;对芯片企业而言,整机厂带来了进入个人设备的机会。它不等于联想独立造芯,P7 也只是已发布并预告众筹,规模交付仍待落地。

共用平台可以让产品更快出现,整机厂也开始为用户提供更多软件和服务,但这些投入能换来多少新增购买,还要看具体用途。

对反复调试模型的开发者、需要在本地处理文件的团队,这笔支出已有具体用途。偶尔聊天、总结文档的普通用户,则未必愿意多买、多维护一台机器。

这就是端侧 AI 眼下的“小时代”:厂商已经开始为更大的市场准备芯片、模型和软件,大众用户为什么需要它,还需要根据真实的使用环境来做决策。真正的大时代来临,可能就在眼前。

本文来自微信公众号“象先志”,作者:阿卡,36氪经授权发布。