摘要:2026年9月,苹果、联发科、高通的新一代旗舰SoC同时释放出一个信号:手机芯片竞争正在从单纯追求CPU、GPU、NPU峰值性能,转向围绕AI重构整颗SoC。2nm带来的红利更多投向能效与持续性能,CPU重新承担Agent编排,GPU开始AI化,NPU走向分层与专用化,缓存、LPDDR6和数据搬运的重要性快速上升。随着AI Agent进入操作系统,旗舰SoC正从“性能芯片”演变为面向持续智能的AI计算系统。

9月迎来手机发布潮,最值得看的是什么?

2026年9月重点手机/芯片发布汇总,来源:与非研究院整理
每年9月都是智能手机产业最拥挤的发布季,但2026年的这一轮有些不同。
9月9日,Apple发布新一代iPhone和A20 Pro;9月15日,MediaTek发布天玑9600 Pro和9600M;随后几天,荣耀MagicOS 11、vivo OriginOS 7、OPPO ColorOS 17相继亮相。接下来,vivo X500、OPPO Find X10、Qualcomm Snapdragon Summit以及荣耀Magic9还将在9月下旬陆续登场。仅从时间表看,这仍然是一轮典型的旗舰手机、操作系统和SoC密集换代。
但把已经公布的技术放在一起看,会发现今年真正值得关注的并不是又多了几款旗舰机,而是旗舰手机芯片的竞争逻辑正在发生变化。
最显眼的是制程。Apple A20 Pro和MediaTek天玑9600 Pro已经率先进入2nm,三星Exynos 2600同样采用2nm GAA,旗舰移动SoC开始真正跨入2nm周期。不过,先进制程释放出的晶体管和功耗预算,正在越来越多地被用于AI、缓存、内存带宽和持续性能,而不只是继续冲高CPU、GPU的峰值跑分。
Apple就是一个典型例子。A20 Pro除了升级CPU、GPU和Neural Engine,还把统一内存带宽提高50%,并通过新的封装和散热设计提升持续性能。MediaTek的路线更直接:天玑9600 Pro不仅采用2nm和2+3+3全大核CPU,还引入双NPU、LPDDR6、UFS 5.0以及AI原生架构,让CPU、GPU、NPU、ISP以及内存和调度系统围绕Agentic AI协同工作。
尚未正式发布新一代旗舰平台的Qualcomm,也已经提前暴露了类似方向。其下一代Oryon CPU加入Flex Cache,Adreno GPU开始引入Matrix Cores和Neural Fusion,Hexagon NPU则增加针对Transformer的专用加速和更大的共享内存。三个核心IP看似分别升级,实际上都在解决同一个问题:当AI从一次推理变成长期运行的Agent工作流之后,计算和数据应该如何更高效地组织在一起。
这种变化也正在从芯片端向手机系统端形成呼应。过去AI手机往往是在系统里增加若干AI功能:修图、翻译、摘要、问答。到了今年,手机厂商正在把AI进一步推进操作系统。荣耀把Agent Harness做成系统能力,vivo强调端侧实时感知、个人记忆和跨应用任务,OPPO提出On-Device Compute、PersonaX和Agent Matrix,小米的超级小爱开始理解屏幕内容并执行后台长任务,HarmonyOS也在把小艺从独立助手推向系统智能体。
这意味着手机中的AI负载也变了。
过去大致可以理解为:用户提出需求,NPU运行模型,给出结果,任务结束;而Agent时代的工作流更像是持续感知、保存上下文和个人记忆、理解意图、规划任务、调用应用,再根据执行结果继续判断。CPU负责规划和编排,NPU负责模型推理和低功耗感知,GPU、ISP参与视觉与多模态处理,内存则需要不断保存模型、上下文和应用状态。
可以说,2026年的旗舰SoC正在同时经历两次换代:制造工艺从3nm迈向2nm,而计算架构则开始从CPU、GPU、NPU各自升级,转向围绕AI工作流重新组织整颗芯片。
先进制程的红利,正在从峰值性能转向AI与能效
手机旗舰芯片已经开始进入2nm时代,摩尔定律似乎仍然在起作用。
那么这些新增的晶体管和功耗预算最终被用到了哪里?
过去先进制程升级最直观的结果,是频率更高、峰值性能更强。CPU主频、GPU跑分、单核和多核性能,往往构成一代旗舰芯片最醒目的升级指标。但到了2nm这一代,芯片商开始把越来越多篇幅放在功耗、持续性能、AI计算以及内存系统上。
天玑9600 Pro就是一个典型例子。
它采用2nm工艺,CPU升级为2+3+3全大核架构,包括两颗C2-Ultra超大核,同时把L2、L3和SLC总缓存提高到34.5MB,并支持LPDDR6和UFS 5.0。官方数据显示,单核性能较上一代提高17%,多核提高15%,但同样值得注意的是,其单核功耗降低37%,在上一代峰值性能下,多核功耗降低61%。
也就是说,先进制程带来的收益,并没有全部被换成更高的峰值。其中相当一部分被用来解决另一个问题:同样的性能,能不能用更低的功耗持续更长时间。
这对智能体AI尤其重要。传统应用往往存在比较清晰的高负载区间,例如启动游戏、导出视频,或者进行一次大模型生成,任务完成后负载便会下降。但Agent可能需要长期驻留后台,不断进行环境感知、上下文理解、模型调用和系统任务调度。如果每一次AI唤醒都调用最高性能的计算资源,即使单次任务只持续很短时间,一整天下来的累计功耗也会非常可观。
所以天玑9600 Pro除了继续增强高性能NPU,还专门设计第二代超能效NPU,为Always-On Agent提供低功耗常驻计算域。官方给出的数据是,超能效NPU功耗较上一代降低40%,而高性能NPU则在提升大模型处理能力的同时,将每瓦Token数最高提高55%。这说明“AI性能”本身的评价方式也在变化。现在不再只是单纯强调TOPS,而是强调Performance per Watt——每一瓦电能到底能完成多少AI计算。
这也是为什么,在9月扎堆的旗舰SoC发布会上,同时出现一些过去并不抢眼的指标:缓存容量、内存带宽、每瓦Token、持续性能以及Always-On AI。
Apple的路线虽然不同,但指向类似。A20 Pro同样采用2nm工艺,不过Apple除了升级CPU、GPU和Neural Engine,还把统一内存带宽较上一代提高50%,并调整封装和散热设计。Apple给出的另一个重要指标是,iPhone 18 Pro的持续性能最高较上一代提高40%。
对于手机这样受到电池容量、机身厚度和散热能力严格约束的设备,芯片能够短时间达到多高性能,与能够维持多长时间,本来就是两回事。AI进入后台持续运行之后,这种差别会进一步放大:一颗芯片即使拥有很高的瞬时AI算力,如果几分钟之后就因为温度或功耗限制降频,也很难支撑长期运行的Agent。
NPU不再包办AI,SoC开始重新分工
过去几年,手机芯片谈AI,最容易被量化的指标几乎都集中在NPU:算力有多少TOPS、能运行多大的模型、推理速度提升多少。CPU负责通用计算,GPU负责图形渲染,NPU负责AI,这种相对清晰的分工,也构成了过去几代旗舰SoC的基本架构逻辑。
但从今年Apple、MediaTek和Qualcomm公布的新一代技术来看,这种边界正在变得模糊。
最明显的变化首先发生在CPU。
原因并不复杂。生成式AI时代,很多任务可以理解成一次模型调用:用户提出问题,NPU完成推理,再把结果交回系统。但Agent并不是单次推理。它需要读取上下文、判断用户意图、拆解任务、调用不同应用和工具,再根据执行结果决定下一步做什么。这些操作中,大量工作并不适合全部交给NPU完成。
因此,CPU重新进入AI计算的核心链路。
Qualcomm在已经预披露的下一代旗舰平台技术中,把这种变化表达得最直接。新一代Oryon CPU不只是继续提高频率,还加入Flex Cache,让不同CPU核心能够共享动态缓存池。Qualcomm给出的应用场景之一就是Agentic AI:当Agent连续进行规划、调用工具和执行任务时,CPU需要负责整个流程的编排,同时尽量让数据留在本地缓存,减少反复访问DRAM。
Arm的新一代C2 CPU路线也指向同一个方向。C2-Ultra、C2-Pro配合SME2,不只是提高传统CPU性能,同时让CPU可以直接处理部分低延迟AI负载。Arm对CPU角色的定义也越来越接近“Orchestration”——它需要决定一个Agent任务究竟应该交给CPU、GPU、NPU,还是云端处理。
MediaTek采用的则是另一种方式。天玑9600 Pro没有简单把CPU定义成“Agent处理器”,而是通过天玑智算融合架构,让CPU与NPU深度协同,再由调度系统统一管理算力、电源和内存资源。换句话说,CPU与NPU不再只是两个彼此独立的计算单元,而开始共同参与AI工作流。
Apple的做法又有所不同。A20 Pro依然保留独立Neural Engine,但Apple已经开始把神经网络加速能力从独立AI单元向更广泛的计算体系扩展,同时大幅提高统一内存带宽。相比直接宣传“Agentic AI SoC”,Apple更倾向于把CPU、Neural Engine、内存、系统软件和Apple Intelligence放在同一个垂直体系里优化。
所以,CPU的“回归”并不意味着NPU的重要性下降。更准确地说,NPU继续负责高效率模型推理,而CPU正在成为Agent任务的规划、控制和资源编排中心。
与此同时,另一块传统计算单元——GPU——也开始发生类似变化。
过去移动GPU的核心任务很明确:负责像素、纹理、光照和几何计算。但神经网络渲染正在让GPU变成AI计算的新阵地。
Arm新一代Mali G2-Ultra NX已经把专用Neural Accelerator直接引入GPU内部,目标包括神经网络超分、图形重建和AI增强渲染。MediaTek在此基础上进一步通过天玑神经网络渲染架构,把GPU、AI计算能力和内存数据通路连接起来,用于游戏超分、光追和高帧率场景。
Qualcomm的变化更加直接。其下一代Adreno GPU首次加入Matrix Cores,并推出Adreno Neural Fusion,让AI模型直接进入图形渲染Pipeline,用于AI超分辨率、Frame Generation以及其他神经网络图形任务。与此同时,GPU内部增加18MB HPM本地高性能存储,目的也是减少AI和图形数据频繁访问系统内存。
这实际上意味着,GPU正在从单纯的“图形处理器”,变成一种“图形+神经网络计算”处理器。
从整个行业方向看,一个趋势已经越来越明确:AI正在从NPU向CPU、GPU以及更多传统SoC模块扩散。
这也是为什么2026年的旗舰SoC越来越难再用“CPU性能+GPU跑分+NPU TOPS”三个独立数字解释。
过去AI是“NPU负责的一项能力”;现在,AI开始变成整颗SoC共同参与的一种计算方式。

苹果、联发科、高通三条旗舰SoC路线对比,来源:与非研究院整理
存储技术正在变成新瓶颈
如果说过去几年手机AI的核心问题是“算力够不够”,那么到了2026年,另一个问题开始迅速浮出水面:数据能不能及时送到这些算力单元。
这也是为什么今年旗舰SoC发布会上,缓存、内存带宽、LPDDR6、UFS 5.0这些过去相对“幕后”的技术,突然被反复提及。存力正在取代算力逐渐成为决定AI体验的关键基础设施。
大模型计算本身并不只是做乘加运算。模型权重、KV Cache、中间Tensor、图像、视频、用户上下文以及多个App状态,都需要在CPU、GPU、NPU和DRAM之间不断流动。模型越大、上下文越长、并行任务越多,数据搬运本身带来的延迟和功耗就越明显。
这也是“内存墙”开始进入手机AI讨论的原因。
Qualcomm下一代旗舰平台的设计很典型。新Hexagon NPU把共享内存容量提高50%,目的就是让模型状态、Activation和中间Tensor尽量留在NPU内部,减少DDR访问;GPU则加入18MB HPM本地高性能存储,让Frame Buffer、Tile以及AI渲染数据尽可能留在GPU附近;CPU端的Flex Cache同样是为了减少Agent多步骤任务在不同核心之间切换时频繁回到系统内存。
三个模块看似各自优化,解决的却是同一个问题:把数据放得离计算单元更近。
MediaTek在天玑9600 Pro上也明显强化了这条链路。除了34.5MB缓存,它还率先支持LPDDR6和UFS 5.0,并把CPU Cache、SLC、内存和存储描述为一套端到端高带宽体系。LPDDR6同频有效带宽提升33%,UFS 5.0读写速度相较上一代进一步提高。
为什么今年旗舰SoC开始把这些规格和AI放在一起讲?因为Agent正在把手机从“偶尔调用模型”,推向“长期保留上下文、持续访问数据、同时运行多个AI任务”的状态。这种工作负载对内存系统提出了完全不同的要求。
过去端侧AI更像一次短跑:把模型加载进来,完成推理,结束任务。未来则更像长时间接力,模型可能一直驻留,多个Agent同时保持状态,还要不断访问照片、视频、日历、消息和应用数据。此时,NPU即使拥有很高TOPS,如果内存带宽不足、缓存太小或者数据搬运效率太低,最终性能一样会被拖住。
Apple的变化也很能说明这一点。A20 Pro除了提升CPU、GPU和Neural Engine,还把统一内存带宽提高50%,同时通过新的封装方式优化芯片与内存之间的关系。Apple并没有把这项升级单独包装成“AI内存技术”,但从端侧AI和持续性能的角度看,更高的内存带宽显然是在为更复杂的计算和更高并发负载提供基础。甚至内存和存储厂商也开始主动把AI作为新品的主要应用场景。SK hynix对LPDDR6的定位直接指向On-device AI;Samsung在介绍UFS 5.0时,也明确提到端侧AI对大规模、分散数据实时访问的需求。
因此,缓存、LPDDR6、UFS 5.0以及本地共享内存的重要性上升,并不是偶然。过去它们更多决定App启动速度、游戏加载和多任务体验;现在,它们正在直接决定端侧AI能不能长期、高效运行。不过,考虑到目前存储成本大规模上涨,叠加AI对存力需求的提升,这给各大厂商的价格设计提出了新的挑战。
旧时代是否结束?下一代手机芯片标准是什么?

最后总结一下,如果把今年9月已经发布和预告的手机新品放在一起看,会发现两个很明显的变化:
一边是芯片厂商开始重新组织SoC。Apple强化CPU、Neural Engine、内存带宽和持续性能;MediaTek强调CPU、GPU、NPU、ISP以及内存、电源和调度协同;Qualcomm则分别改造Oryon、Adreno和Hexagon,让CPU承担更多Agent编排、GPU增加神经网络计算、NPU进一步针对Transformer和长上下文优化。三家的技术路线并不相同,但都在削弱过去“CPU负责CPU、GPU负责GPU、NPU负责AI”的清晰边界。
另一边,手机厂商也在改变AI的使用方式。
过去所谓“AI手机”,很多时候是在系统里加入一些独立AI能力:修图、摘要、翻译、语音问答,或者调用一次端侧模型。到了今年,小米、华为、vivo、OPPO、荣耀的系统级AI已经明显向更深一层发展。它们开始强调持续感知、个人记忆、跨应用调用、复杂任务规划以及主动服务。换句话说,AI正在从一个App或者某项功能,逐渐变成操作系统自身的一种运行机制。
这两种变化并不是彼此独立的。
当AI只是完成一次修图或摘要时,一颗更强的NPU就能解决很大一部分问题;但当Agent需要长期存在于系统中,负载模式就完全不同了。它需要持续感知屏幕和环境,保存用户上下文和个人记忆,判断意图,拆解任务,调用一个或多个App,甚至跨设备执行,再根据结果决定下一步动作。
这条工作流里,已经很难找到一个能够“包办所有AI”的单一计算单元。CPU需要负责规划、控制和任务编排;NPU需要承担模型推理,也可能负责低功耗持续感知;GPU和ISP开始参与视觉、多模态和生成式影像;内存必须保存模型、上下文以及多个应用状态;系统调度则要决定不同任务在什么时候、由哪一种计算资源执行。
此外,手机厂商正在从应用层反过来改变芯片需求。
vivo的路线很有代表性。OriginOS 7把端侧实时感知、个人记忆和Harness结合起来,端侧模型负责低延迟感知和记忆,复杂长链任务再交给云端模型;OPPO则提出On-Device Compute、PersonaX和Agent Matrix,并进一步通过Find X10 Pro Max与MediaTek合作,把持续AI直接对应到双NPU和底层调度。荣耀MagicOS 11则把Agent Harness做成系统层能力,让YOYO能够执行长链任务,并根据时间、位置和应用状态主动触发操作。
这些应用案例共同指向一个新的评价标准——把旗舰SoC理解成若干高性能IP简单相加的时代结束了!
478