8.0
热点
AI SCORE
模型发布2026-09-23 04:40
高通骁龙8 Gen6端侧跑300亿参数MoE模型,吞吐330 Token/s
IT之家#高通#端侧AI#MoE模型
Editor brief · 编辑速览
高通与阶跃等合作,在第六代骁龙8超级至尊版上端侧运行300亿参数MoE模型,预填充吞吐超330 Token/s,内存需求降低50%以上。
2026 骁龙峰会上,高通携手阶跃、无量火及江波龙,基于第六代骁龙 8 超级至尊版移动平台,端侧适配与推理优化阶跃 StepEdge-Omni 30B-MoE 模型,并现场演示相关智能体助手。
该模型拥有 300 亿参数,依托混合专家架构(Mixture of Experts),仅根据任务需要激活部分专家模块,以降低计算量和内存带宽需求。
合作方通过推理引擎、异构调度及存储方案优化,让模型运行内存需求较行业常规方案降低超过 50%,并支持在智能手机上稳定运行。
高通表示,该方案无需调用云端服务,可以在本地完成邮件理解、行程规划、日历同步、航班及酒店推荐、行程分享和邮件草拟等任务。
测试数据显示,模型预填充(prefill)吞吐性能超过每秒 330 个 Token,解码(decode)吞吐性能超过每秒 28 个 Token。
业内认为,大参数 MoE 模型在手机端的部署,有助于推动低时延和隐私保护型智能体应用发展。不过,实际规模化应用仍取决于终端成本、功耗、模型可靠性及用户接受度等因素。