硬件厂商放弃参数堆叠,转向芯片推理优化
高通等厂商调整策略,用本地推理优化替代规模竞争。对硬件加速和端侧 AI 开发者有参考价值。
高通等厂商调整策略,用本地推理优化替代规模竞争。对硬件加速和端侧 AI 开发者有参考价值。
全球智能终端市场正在经历一场错位:在出货量开始下滑的同时,AI 终端的数量却越来越多。
数据显示,今年上半年,全球智能手机出货量同比下滑 13.9%,但在同一批手机中,具备 AI 能力的比例已经达到 66.4%,相对增幅达到了 21.8%。
根据预测,PC 出货量同比下跌 11.7%,平板电脑下跌 8.6%,但两者的 AI 渗透率同样在走高。
这组数字出自近期由高通委托、市场研究机构 IDC 独立研究制作的一份产业白皮书:《从 AI 设备到个人 AI——智能体驱动的终端进化与产业重构》。
当硬件销量掉头向下,为什么这些设备里的 AI 渗透率反而逆势上扬?
这组反差背后,指向的是个人终端市场正在发生的一次系统性重构。
评价终端的标准正在换轨,过去那套靠“堆参数换销量”的逻辑,已经不再管用了。
屏幕刷新率卷到 185Hz,摄像头像素冲到 2 亿,安兔兔跑分突破 400 万分……这些数字曾经是发布会上最响亮的卖点,但现在越来越难直接转化成销量。
原因也不难想象:硬件成本这几年一直在上涨,供应链波动推高了产品定价,用户的换机周期也随之拉长。
IDC 给出的数据显示,这轮周期里唯一还能带来增长的亮点,只剩下 AI。
但这并不意味着厂商把 AI 塞进设备,用户就会立刻买账。
多数用户对 AI 功能究竟有什么用,心里并没有底。即使手机里多装了几个 AI 功能,他们也不愿意为此多掏钱。
白皮书认为,要系统性地解决这种价值错位,需要推动“个人 AI”的产业范式转变。
转变后的范式,是以智能体为核心运行载体、以用户为中心展开运行的个人智能系统,即“个人 AI”。
“以智能体为核心运行载体”,指的是“个人 AI”的运行载体是智能体本身,这些硬件只是承载智能体的端点。
“以用户为中心展开运行”,指的是这个智能体组织信息的方式都围绕“人”展开,也就是智能体要“跟着人走”。
换言之,在这种范式下,手机、PC、眼镜共用同一份对用户的理解,记住用户的偏好,感知用户所处的环境。
不过,这套系统要真正落地,首先得扛住一笔账单。
从过去的对话式 AI,到后来的推理式 AI,再到如今的智能体 AI,单次任务消耗的 Token 增长了大约 100 倍,而且还在持续增加。
如果把这笔账全部甩给云端,三重瓶颈就会随之出现。
成百上千倍的 Token 消耗,会让推理成本也呈指数级上升。
目前,用户还没有建立起为 AI 服务付费的心智,厂商基本上是在自行承担这笔支出,造成了成本与收益的严重错配。
“个人 AI”需要做到全时感知,并且随时能够替用户拿主意,这两件事都对反应速度有着极高的要求。
一旦决策需要绕道云端,一来一回的网络延迟就会让实时决策变成漫长的反馈,与用户的期待背道而驰。
全时感知意味着设备需要持续记录用户的环境、位置和习惯。这些数据汇总起来,就是一份完整的用户画像。
如果这类信息发生泄露,后果会比单项数据泄露严重得多。
这三个瓶颈,成了压在“个人 AI”这套框架上的三座大山。
归根结底,这三重瓶颈都是因为把所有任务一股脑甩给云端才会遇到的。
面对这三重瓶颈,白皮书给出了建议的解决方案:从“云端集中”走向“端边云分布式”——打破端侧、边缘和云端各自独立的物理节点边界,形成算力可以无缝流转、负载可以动态调度的统一计算体系。
系统根据任务的时延要求、隐私等级与计算复杂度,自动将计算负载分配到最优节点运行:高频轻量任务在端侧处理,中等复杂度任务由边缘节点承接,高复杂度推理任务则按需调用云端算力。
这套思路具体如何拆解,可以对照“个人 AI”定义的五个特征来看。
白皮书为“个人 AI”定义了五个特征,分别是个性化服务、全时感知与自然交互、连续服务、可进化、安全可信。
把这五个特征拼起来看,讲的其实是同一个智能体从感知世界,到记住用户,再到跟着人走的一整条链路,外加一道兜底的安全防线。
说回高通,其技术方案正好沿着这条链路一一对应。
链路的起点是个性化服务,而要实现个性化,记忆必不可少。
高通在端侧构建了个人知识图谱,在数据不离开设备的前提下,就能记录用户的偏好和习惯。
这份记忆中的数据又从哪里产生?这一步依靠的是全时感知与自然交互。
高通的传感器中枢能够脱离主系统独立运行,不需要唤醒 CPU、内存和总线,功耗被压到了数十甚至个位数毫安级别。
依靠如此低的能耗,设备就能保持全天候待机,从而捕捉用户的语音、手势以及所处的环境。
仅仅记住还不够,这份理解还要“跟着人走”,这正是连续服务需要解决的问题。
在高通的体系中,手机、PC、眼镜之间共享同一份对用户的理解,底层连通的不仅是设备与设备,更是每一个具体的人。
基于这一理念,高通把 AI 做成了能够在终端、边缘和云之间协同存在的分布式系统。
高频、轻量的任务留在端侧和边缘处理,不需要事事都排队等待云端,时延压力首先得到缓解,体验问题也有了解法;
能够在端侧完成的推理,不需要额外占用云端算力,云端部分的成本压力也随之减轻。
记忆本身也不是记录完就停止,还需要具备进化能力。
高通的做法,是让端侧的个人知识图谱依靠本地算力持续迭代。用户使用得越久,系统对这个人的判断也就越准确。
眼镜的摄像头、耳机的传感器所采集的信息,本身就是用户的隐私。一旦处理不当,泄露的将是用户生活的方方面面。
高通的做法是将隐私保护做成硬件级能力,同时通过端云分布式计算,把用户个人数据的处理留在端侧,云端的风险敞口也就自然收窄。
针对这五个层次,高通都给出了对应的技术方案,但仍有一笔账单,是这套框架无法回避的。
传统观念认为,端侧 AI 受制于算力。但在高通看来,真正的瓶颈是持续服务能力、多任务并行能力,以及功耗与续航。
设备需要支持智能体全天候在线,同时处理多个任务,又不能把电池耗光。任何一个环节掉链子,“个人 AI”这套系统都无法运转。
高通给出的解决方案,是利用多种不同的专用处理模块协同工作,让它们各司其职。
CPU 负责全局调度,统筹复杂任务应该如何拆解;NPU 专门负责大模型的端侧推理;传感器中枢专门负责毫瓦级的持续感知;GPU 则负责并行计算和图形处理。
四个模块分工协作,才能形成有机的资源调配方案,支撑用户的需求。
芯片内部的分工解决了,但如果把目光放到设备层面,个人 AI 还有一个更大的问题——下一代的入口会是哪种硬件?
高通产品技术专家朱元堃判断,“个人 AI”的核心载体不必局限于某一种具体形态,手机、眼镜、PC 都将成为个人 AI 的入口。
他认为,未来所有设备都会成为智能体的一个端点,底层连通的是每一个具体的人。
也就是说,今天用户在手机、眼镜和 PC 上使用的 AI,背后不应该是三套互不相关的系统,而应该是同一个理解用户的智能体,只不过这个智能体生长在不同的环境中。
这背后的逻辑,与前面提到的技术方案是一致的。个人 AI 要实现真正的连续服务,本来就不是依靠一台设备能够支撑起来的。
这个判断之所以站得住脚,原因之一是几个终端品类各自的规模都太大了。
高通 CEO 安蒙在 COMPUTEX 2026 的主题演讲中给出了一组数据:全球约有 60 亿部手机、20 亿台个人 AI 终端、20 亿台 PC,以及 5 亿辆智能网联汽车。
在安蒙看来,如果把它们都算作智能体的入口,60 亿这个数字其实并不算大,因为智能体真正需要覆盖的,是每个人身边所有能够联网、配备传感器的设备。
其他厂商还在押注哪种形态会胜出,高通则直接跳过了选择,让自己的产品覆盖从功耗仅两毫瓦的耳机,到千瓦级数据中心的全部计算层级。
白皮书认为,到 2030 年以后,终端边界将逐步消解,以屏幕为核心的设备形态会逐渐弱化,感知、算力和执行单元将分布在用户身边的各个角落。
到那时,下一代“个人 AI”的入口究竟是谁,这个问题可能就不会再有人问了。
通过以下地址,即可获取白皮书:
https://www.qualcomm.cn/content/dam/qcomm-martech/dm-assets/documents/files/personal-ai-whitepaper2026.pdf
半价干翻 Fable 5?Opus 5 实测炸场,网友:差点从椅子上摔下来 2026-07-25
具身智能的「ChatGPT 时刻」还没到,科沃斯先把机器人拆开了 2026-07-25
Agent 要数量也要脑子!浪潮信息一边单柜养 4 万 Agent,一边让大模型组队答题 2026-07-13
不同模型厂同一家 Agentic Infra,AGI 时代的地基终于浮出水面 2026-07-20
据国外媒体报道,当地时间周四,芯片制造商高通宣布推出首批支持 Wi-Fi 6E 的下一代无线芯片。
AI 的未来既需要终端侧 AI,也需要云端 AI。
量子位 QbitAI 版权所有 © 北京极客伙伴科技有限公司 京 ICP 备 17005886 号-1