高通携手合作伙伴基于第六代骁龙8超级至尊版端侧落地MoE模型
2026-09-23
来源:C114通信网
9月23日消息,2026骁龙峰会期间,高通技术公司宣布携手阶跃、无量火与江波龙开展四方合作,基于第六代骁龙8超级至尊版移动平台,将阶跃StepEdge-Omni 30B-MoE(混合专家)模型面向端侧进行深度适配与推理优化,成功打造具备自主服务和个性化能力的端侧智能体助手。
第六代骁龙8超级至尊版移动平台搭载全新Qualcomm Oryon CPU、下一代Qualcomm Adreno GPU和重新设计的Qualcomm Hexagon NPU,并配备LPDDR6内存与高速存储通道,引领打造面向未来的智能体AI体验。
定制Qualcomm Oryon CPU峰值频率高达5GHz,并引入全新的可扩展缓存架构Qualcomm Oryon FlexCache,实现更加强大的智能体多任务处理和系统规划能力;Adreno GPU引入针对AI负载打造的Adreno Matrix Cores,并支持全新Adreno Neural Fusion特性,将AI和图形处理更加紧密结合;Hexagon NPU则面向智能体AI的Transformer工作负载引入全新的Element Accelerator,并将大容量共享内存扩容50%,实现端侧推理性能的进一步突破。
在此之上,无量火的自研Ember推理引擎与Ember Kernel端侧编排内核基于第六代骁龙8超级至尊版移动平台的强大AI性能基础和完整软件栈支持,以XCompute异构调度实现跨CPU/GPU/NPU的统一高性能编排,在不修改模型结构、不损失推理精度的前提下,使阶跃30B-MoE模型的运行内存需求相比行业常规方案降低超50%。
基于江波龙提供的端侧AI存储解决方案,模型权重可从端侧闪存高效加载,通过存储与计算协同减少大模型对运行内存的持续占用,进一步提升模型加载和运行效率,成功打造端侧智能体助手,实现从邮件理解到行程规划、日历同步、航班酒店推荐、行程分享到邮件草拟的全链路自主办公,全程本地完成,无需云端调用。
得益于NPU+GPU双引擎协同,模型预填充吞吐性能超过330Token/s,对比仅使用NPU的通用推理方案提升超过30%,解码吞吐性能超过28Token/s,并能保持持续稳定运行,且首个词元生成速率达到毫秒级,对比云端API调用快数倍至数十倍。
本次合作解决了大参数模型在端侧部署的关键行业痛点,让300亿参数量级模型具备在智能手机上规模部署的条件,将推动更加复杂的智能体AI体验落地智能手机,并利用端侧用户数据和平台能力实现更加个性化的智能体服务。

