前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8483
  • Rovo 提示注入可窃取企业敏感数据
  • Prime Agent 开源递归式多智能体框架
  • 构建能识别调用异常的 API 监控 Agent
  • 工程团队的软件选型评估框架
  • 生产级 LLM 字幕翻译的完整工作流
  • 昇腾开源强化学习训推一致方案
  • 批量检测 AI 内容模板残留
  • 用Postgres为Claude Code构建长期记忆
  • 自主 Agent 的三层安全威胁模型
  • 多模型降级不能只替换模型名
  • 本地小模型如何应对MCP工具膨胀
  • GPT-Live全双工语音架构解析
  • Qwen3.8登顶Agentic能力榜单
  • AI智能体协作发动全自动攻击
  • 用Next.js构建实时AI代码审计器
  • 用活动图逐节点排查Copilot代理故障
  • AI安全测试因隔离失误波及外部系统
  • 用CLAUDE.md统一团队编码输出
  • Kimi K3开放权重,但个人设备难以运行
  • 用延迟与Token识别Agent空转
  • Maple端侧模型实现每秒127词元
  • 让 AI 生成的界面严守设计令牌
  • 把 AI 界面转成可维护的 Figma 组件库
  • 生产级 LLM 推理的 KV 缓存优化
  • 用 DSPy 把提示词变成稳定接口
  • 别让聊天记录充当 Agent 状态机
  • 用 Git 为编码 Agent 构建有效记忆
  • 生产级 LLM 可观测性不能只看 APM
  • FLUX 3上线原生音视频生成
  • 用300行 Python 自动生成资讯简报
  • 给 AI 编程工具加一道本地隐私网关
  • 用类型系统消除量化模型格式歧义
  • Meta 发布终端编程智能体 Muse Code
  • AI 代码生成平台安全检查清单
  • MiniMax H3登顶开源视频模型社区
  • 动态定价下的LLM预算保护设计
  • 把生产环境提示词当作代码治理
  • 五个被低估的MCP能力
  • 按任务场景选择大模型的方法
  • 欧盟 AI 透明度规则正式生效
  • 让 AI Agent 按工单自动结算
  • 构建可审计的半自主 EDA Agent
  • 让编码 Agent 记住被否决的方案
  • 构建动态多模型路由层
  • 用脚本自检守住高风险正则
  • 让AI代理继承用户权限而非共享密钥
  • 五款自托管AI对话前端怎么选
  • 用命令行低成本批量分析文本
  • MiniMax H3 的 ComfyUI 部署指南
  • Node.js 多模型摘要服务设计
  • 用停止条件预防AI代理越权
  • 已加载 51 / 8483
8.0
热点
AI SCORE
模型发布2026-08-06 14:21

Maple端侧模型实现每秒127词元

IT之家#端侧模型#MoE#三值权重
Editor brief · 编辑速览

Maple-Preview采用20.2B总参数、1.49B激活参数的MoE架构及三值权重,在未明确型号的iPhone上达到127 tokens/s。模型还宣称在13.1万词元上下文下额外内存占用仅7.69GB,但目前仍处预览阶段。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

IT之家 8 月 6 日消息,美国独立 AI 研究实验室 DeepGrove 昨日(8 月 5 日)发布博文,推出名为 Maple-Preview 的轻量 AI 模型。该模型在 iPhone(原文并未明确具体机型)上的运行速度可达 127 tokens/s,约为 Bonsai 27B(9.6 tokens/s)的 13 倍。

在模型规模方面,Maple-Preview 的总参数量为 202 亿,采用混合专家(MoE)架构,激活参数量为 14.9 亿。

DeepGrove 表示,目前 AI 行业在本地端侧主要依赖量化技术,但这种方式存在根本性问题,会严重影响模型的性能和效率。

DeepGrove 提出了“三值权重”(ternary-weight)方案,将权重约束并量化为三个值({-1, 0, 1}),大幅降低内存占用和计算带宽需求。该模型包含 24 层、256 个专家(其中 8 个活跃专家),并采用 3:1 SWA-512:GA 混合注意力机制。

On-device decode speed versus benchmark performance for Maple-Preview with its dense and Flash heads and comparison models.

在能力展示方面,Maple-Preview 在 MacBook Pro(M5 Pro)上完成了 IMO 2024 P1,取得 7/7 的结果,运行速度为 281.5 tokens/s。

文章配图

在长上下文场景下,Maple-Preview 也强调了自身的内存控制能力。相关图表将 context length(上下文长度)与维持上下文所需的额外内存占用放在同一坐标系中。结果显示,即使处理 131,000 tokens,Maple-Preview 的内存占用仍仅为 7.69GB。

Projected resident model-weight and context-state memory at 131,072 tokens for Maple and comparison models.

Incremental context-memory growth above a 640-token baseline through 131,072 tokens for Maple and comparison architectures.

Grouped benchmark scores for Maple-Preview and four comparison models across LCBv6, AIME 2026, HMMT 2026, GPQA-D, and the average, using a consistent model order with Maple first.

文章配图

DeepGrove 表示,Maple-Preview 目前仍处于 preview stage(预览阶段),后续还将继续改进。该公司同时希望构建一套系统,使 AI 模型能够根据对话内容自动调整,并针对单个用户进行优化。

软媒旗下网站:IT之家、最会买、返利返现优惠券、iPhone之家、Win7之家、Win10之家、Win11之家

软媒旗下软件:软媒手机 APP 应用、魔方、最会买、要知

Original source

本文由 AI 翻译整理自 IT之家,原文版权归原作者所有。

阅读英文原文
上一篇
用延迟与Token识别Agent空转
下一篇
让 AI 生成的界面严守设计令牌