Maple-Preview采用20.2B总参数、1.49B激活参数的MoE架构及三值权重,在未明确型号的iPhone上达到127 tokens/s。模型还宣称在13.1万词元上下文下额外内存占用仅7.69GB,但目前仍处预览阶段。
IT之家 8 月 6 日消息,美国独立 AI 研究实验室 DeepGrove 昨日(8 月 5 日)发布博文,推出名为 Maple-Preview 的轻量 AI 模型。该模型在 iPhone(原文并未明确具体机型)上的运行速度可达 127 tokens/s,约为 Bonsai 27B(9.6 tokens/s)的 13 倍。
在模型规模方面,Maple-Preview 的总参数量为 202 亿,采用混合专家(MoE)架构,激活参数量为 14.9 亿。
DeepGrove 表示,目前 AI 行业在本地端侧主要依赖量化技术,但这种方式存在根本性问题,会严重影响模型的性能和效率。
DeepGrove 提出了“三值权重”(ternary-weight)方案,将权重约束并量化为三个值({-1, 0, 1}),大幅降低内存占用和计算带宽需求。该模型包含 24 层、256 个专家(其中 8 个活跃专家),并采用 3:1 SWA-512:GA 混合注意力机制。

在能力展示方面,Maple-Preview 在 MacBook Pro(M5 Pro)上完成了 IMO 2024 P1,取得 7/7 的结果,运行速度为 281.5 tokens/s。

在长上下文场景下,Maple-Preview 也强调了自身的内存控制能力。相关图表将 context length(上下文长度)与维持上下文所需的额外内存占用放在同一坐标系中。结果显示,即使处理 131,000 tokens,Maple-Preview 的内存占用仍仅为 7.69GB。




DeepGrove 表示,Maple-Preview 目前仍处于 preview stage(预览阶段),后续还将继续改进。该公司同时希望构建一套系统,使 AI 模型能够根据对话内容自动调整,并针对单个用户进行优化。
软媒旗下网站:IT之家、最会买、返利返现优惠券、iPhone之家、Win7之家、Win10之家、Win11之家
软媒旗下软件:软媒手机 APP 应用、魔方、最会买、要知