9月8日,Arm在上海举办Arm Everywhere China年度大会,发布移动端计算子系统CSS for Mobile 2、云端计算子系统Neoverse CSS N4,并更新了自有芯片AGI CPU的合作进展。
两条产品线,都把CPU放在了AI叙事的中心。手机CPU加强小模型推理,服务器CPU瞄准智能体运行。Arm押注的是同一个变化:当用户开始让AI办事,模型给出的答案后面,还会跟着一连串需要执行的程序。
这些程序运行得如何,会决定AI究竟能替人省多少时间,也决定了算力预算该花在哪里。
模型给出方案以后还有活要干
让AI解释怎样分析一份销售表,它给出步骤,任务大致就结束了。让AI直接交付分析报告,后面的工作才刚开始。
它可能要读取文件,检查字段,写一段程序清洗数据,再运行程序生成图表。如果执行报错,还要把错误交回模型,修改代码,重新运行。模型与执行环境如此往返,直到产出结果。
在这条流程里,模型推理通常可以借助GPU或其他加速器,而读取数据、运行程序、管理进程等大量工作,仍由CPU及其所在的系统处理。
其中不少工作原本就由CPU承担。过去是人打开软件、发起操作、等待结果;智能体可以把这些步骤串起来,自动连续执行,也可以同时开展几个任务。变化发生在调用频率、并发量和资源调度上。随着这类应用增多,云平台除了供应模型推理,还要为它们准备足够的执行环境。
因此,模型提速并不保证整项任务按同样比例提速。程序排队、数据读取缓慢,或者工具调用迟迟没有返回,都可能让更快的模型停在那里等。CPU性能只是其中一个因素,内存、存储和网络也会影响结果。用户等的是一份完成的报告,后台各个环节不能只顾自己跑分。
Arm在本次云端发布中,特别强调了这种模型之外的计算需求。它同时区分了两类诉求:一些基础设施更看重吞吐效率,另一些智能体应用则对响应速度更敏感。前者关心一台机器能承载多少工作,后者关心眼前这项工作能否尽快往下走。
Arm瞄准的增量,来自智能体使用规模扩大后增加的执行次数与并发任务。是否需要采购更多CPU,取决于这些新增任务能否被现有系统消化。
在数据中心,服务器容量、电力和成本会约束这些执行任务。大量任务同时运行,会争用内存和I/O资源;核心再多,数据送不过来,执行效率照样上不去。
新发布的Neoverse CSS N4便同时增加计算密度与数据传输能力。产品资料显示,它单颗裸片最高支持128核,支持LPDDR6内存和PCIe Gen 7互连。相较CSS N3,每插槽性能最高达到2倍,内存带宽最高达到1.75倍。这是平台层面的比较,不能全部归因于单个CPU核心变快。
对于前面那份销售报告,平台既需要让单个任务尽快读到数据、执行代码,也需要在许多用户同时提交任务时保持服务。扩充CPU核心、内存和互连,回应的是这两种压力。至于能多承载多少智能体,还要用具体任务和并发条件验证,发布会上的倍数不能直接换算成业务容量。
同一套任务到了手机上还要重算功耗
到了手机上,CPU的角色又多了一层。它既要支持助手调用应用和系统服务,也可能直接承担部分小模型推理。后者取决于模型规模、延迟与功耗条件。
手机只有一块电池。一个经常唤醒、持续维护状态的助手,即使每次调用都不重,累积起来的能耗也会影响续航。Arm在新一代移动平台里,同时加强了CPU的AI计算能力与能效。CSS for Mobile 2中的C2集群,由C2-Ultra和偏重能效的C2-Pro组成,并配备双SME2单元。SME2是第二代可伸缩矩阵扩展,可以提高CPU执行矩阵运算的效率,为部分小模型提供直接在CPU上运行的路径。
对系统来说,多一条运行路径就多一种安排任务的选择。模型多大、响应要多快、当前设备有多少功耗余量,都会影响计算该交给哪个单元。实际收益需要放到完整的应用中测,不能由一项峰值算力替代。
按照Arm公布的测试数据,相较C1-Ultra,C2-Ultra的AI性能最高达到1.7倍,单线程性能最高提升15%,同等性能下功耗最高降低38%。三项指标对应不同的性能和能耗比较,实际手机的表现还取决于芯片配置、软件与散热。
同一平台中的Mali G2-Ultra NX,则把专用神经网络加速器集成到GPU内部,用于神经图形等负载。Arm也在加强其他计算单元,让不同任务各有去处。
Arm准备把这部分需求做到芯片生意里
计算需求发生变化,芯片公司接下来要决定以什么产品承接它。Arm给客户准备了两条路。
CSS N4面向仍要开发定制芯片的客户。Arm先把CPU及相关系统部件集成并验证,客户再调整核心数量、缓存、内存和I/O等配置,用于云计算、数据处理单元DPU、网络及其他专用设计。相比只拿到处理器IP,客户少做一部分基础集成,又保留了决定产品配置的空间。
另一条路是采购Arm设计的AGI CPU。这款芯片已于今年3月24日发布,9月大会更新的是合作与落地进展。据Arm本次发布资料介绍,OpenAI、Meta、Oracle、联想、Supermicro等企业正在围绕它开发解决方案,火山引擎则在推进首批基于AGI CPU的智能体沙箱上市。
沙箱正是智能体执行代码的一种环境。平台需要隔离不同任务,分配计算资源,并处理网络和存储访问。Arm与火山引擎的合作,把前面讨论的CPU需求落到了一个具体产品方向上。
火山引擎推进基于Arm AGI CPU的云服务与智能体沙箱
从IP到CSS,再到成品芯片,Arm参与一款产品的深度增加了。以往,客户从Arm获得设计,再完成芯片开发和产品交付;现在,客户可以把其中更多环节交给Arm。由此增加的商业价值,也伴随着验证、供应和客户支持等责任,收入机会不能简单等同于利润增长。
更微妙的是客户关系。Arm的芯片客户依靠自己的产品赚钱,当Arm也直接供应芯片,双方就可能在部分市场争取相同的订单。CSS N4与AGI CPU并行,给客户留下了不同选择,却不会自动消除这种张力。Arm如何支持伙伴的定制需求,如何安排自己的产品范围,都会影响这门生意能走多远。
这部分市场能有多大,还取决于智能体能否在实际业务中持续工作。应用只停留在演示阶段,就支撑不起长期的基础设施投入。即使需求增长,Arm也要靠性能、能效和系统成本,争取客户选择自己的方案。
但评价AI算力的尺度已经可以向前多走一步。模型每秒生成多少内容,解释不了用户为什么仍在等待。等一份报告真的生成、一次操作确实完成,AI的能力才算交到了用户手上。Arm想争取的,就是这段从模型输出到任务完成之间的生意。




0 条评论
请「登录」后评论