微软发布支持多模态输入的 Magma 基础模型,推动智能体应用的能力进步。
Magma 是首个面向多模态 AI Agent 的基础模型。作为多模态 Agent 模型的基石,它不仅具备强大的多模态世界感知与定位能力,还能精准执行目标驱动的动作。通过有效迁移海量免费视觉与语言数据中的知识,Magma 将语言、空间和时间智能融为一体,从而在数字世界与物理世界的复杂任务和环境中灵活行动。
Magma 预训练流程:对于所有训练数据,文本会被 Token 化;来自不同领域的图像和视频则由共享的视觉编码器进行编码。随后,得到的离散 Token 和连续 Token 会被送入 LLM,由其生成语言、空间和动作类型的输出。
Set-of-Mark prompt 通过让模型预测图像空间中可点击按钮或机械臂对应的数字标记,实现对图像中动作的有效定位。该方法同时适用于 UI 截图(左)、机器人操作(中)和人类视频(右)。
机器人操作(左)和人类动作(右)中的 Trace-of-Mark 监督。它促使模型理解视频随时间变化的动态,并在采取行动之前预测未来状态。与下一帧预测相比,ToM 使用的 Token 更少,却能捕捉更长的时间跨度以及与动作相关的动态,同时避免环境中无关信息的干扰。
预训练数据包括教学视频、机器人操作、UI 导航和多模态理解数据。我们针对不同类型的数据应用 SoM 和 ToM:SoM 可以跨所有模态实现统一的动作定位,而 ToM 则专门应用于视频和机器人数据。
Magma 可以为机器人操作任务规划未来的运动轨迹。
任务:拿起薯片袋。
任务:将薯片袋推到桌子的左边缘。
任务:拿起可乐罐。
让多模态模型玩一款 2D 游戏:通过自动向上、向下、向左和向右移动来收集绿色方块。
我们报告的是预训练 Magma 在未进行任何特定领域 finetuning 情况下的结果。Magma 是唯一能够完成全部任务类型的模型。
西雅图的天气怎么样?并打开飞行模式。
将这个内容分享并通过消息发送给 Bob Steve,点击发送按钮完成操作。
WidowX 视频展示了 Magma 模型在真实机器人上的 rollout。(视频已加速至 2.5 倍。)
拿起并放置热狗香肠。
将蘑菇放入锅中。
从左向右推动布料(分布外)。
在软体物体操作和抓取放置任务中,Magma 的表现始终优于 OpenVLA(finetuning),并在真实机器人上的分布内和分布外泛化任务中均展现出可靠的性能。
Magma 在所有任务套件中都取得了显著更高的平均成功率。此外,在预训练阶段移除 SoM 和 ToM 会对模型性能产生负面影响。
Magma 展现出强大的 Zero-shot 跨领域鲁棒性,并在跨机器人形态的操作仿真任务中取得了出色的结果。
即使对于 GPT-4o,空间推理问题也颇具挑战性;但尽管 Magma 使用的预训练数据少得多,它仍然能够给出相当不错的答案。
尽管 Magma 使用的视频指令调优数据少得多,它仍然展现出极具竞争力的性能,并且在大多数基准测试中甚至超越了 Video-Llama2 和 ShareGPT4Video 等最先进的方法。
用户:我真的很想赢下这局游戏。你能建议我下一步该怎么走,才能最大限度地提高获胜概率吗?
Magma:我建议将兵移动到 d4,以最大限度地提高你的获胜概率。
用户:我想在这里放松几个小时。你能建议一些我可以做的事情吗?
Magma:看电视、读一本书,再欣赏秋日森林的景色。
用户:请详细描述这段视频,重点说明主体和正在发生的动作,并预测接下来会发生什么。
Magma:视频发生在一家便利店内,画面聚焦于收银台。视频开头展示了柜台,柜台上有一块写着「PICK 5 FOR $8.00」的标牌,旁边还配有各种零食的图片。柜台上摆满了各种物品,包括零食和一台支付终端。一名身穿黑色上衣、袖子为白色的员工正在操作支付终端。一名顾客可以通过其白色袖子和彩色手链辨认出来,这名顾客将一个装有零食和饮料的红色购物篮放到柜台上。员工继续操作支付终端,同时顾客调整购物篮中的物品。画面重点呈现了顾客与员工之间的互动,员工正在协助顾客处理这些商品。场景继续停留在同一个收银台,写有「PICK 5 FOR $8.00」的标牌依然醒目地展示着。顾客的红色购物篮被放在柜台上,现在篮中装有零食,其中包括一杯标有「Fruit Swoosh」的饮料和一包蓝色包装的饼干。员工正在操作支付终端。顾客戴着彩色手链的手正在摆弄购物篮中的物品。员工继续协助顾客,并调整柜台上的商品。顾客与员工之间的互动仍然是画面的焦点,员工正在帮助顾客处理这些商品。接下来,柜台后的工作人员很可能会完成付款流程,并可能将商品交给顾客。
用户:请重点描述主要动作,详细说明视频中正在发生什么。
Magma:视频一开始是一个手部特写,这只手伸向放在木质搁板上的一盆红色花盆植物。植物长有绿色和黄色条纹的叶片,旁边放着一本名为「YOUNG」的书,以及一个叠放在书上的木碗。这只手小心地调整植物在搁板上的位置,确保它摆放妥当。背景中可以看到一个挂在支架上的米色浇水壶,以及带有白色管道的暖气片。随后,这只手再次调整植物,确保它位于搁板中央。随着场景推进,这只手再次伸出调整植物的位置;此时可以看到手的主人穿着黄色毛衣,左手戴着一枚戒指。之后,手从植物旁移开,镜头转而展示周围更大范围的区域,其中包括一把红色儿童高脚椅,以及摆放着智能手机、小红杯等各种物品的木质台面。视频最后以房间的广角画面收尾,可以看到方格地板和背景中的另外几盆植物,为整个环境增添了温馨的居家气息。
用户:请重点描述主要动作,详细说明视频中正在发生什么。
Magma:视频一开始是厨房水槽区域的特写。水槽配有一个光亮的银色水龙头,水正从中流出,一名人员将一个黑色马克杯放在流水下。水槽左侧放着一瓶洗洁精和一支蓝色牙刷。随后,这个人拿起一块蓝色海绵,开始刷洗杯子内部。接下来的画面中,这个人有条不紊地刷洗马克杯,确保将其清洗干净。视频最后,这个人将刷洗完的杯子放进水槽,并把蓝色海绵放在旁边,表明清洗过程已经完成。
用户:视频中的人选择了什么饮料?
Magma:这个人选择了一款标有「SAVE SOY」的豆乳饮料。
用户:你能预测视频结束之后,这个人接下来会进行哪些操作吗?
Magma:这个人接下来很可能会把热水倒进杯子,然后继续泡茶。
用户:你能描述一下视频中的人在做什么吗?
Magma:这个人正在通过按下按钮与咖啡机交互,很可能是在选择要制作的咖啡。
@misc{yang2025magmafoundationmodelmultimodal,
title={Magma: A Foundation Model for Multimodal AI Agents},
author={Jianwei Yang and Reuben Tan and Qianhui Wu and Ruijie Zheng and Baolin Peng and Yongyuan Liang and Yu Gu and Mu Cai and Seonghyeon Ye and Joel Jang and Yuquan Deng and Lars Liden and Jianfeng Gao},
year={2025},
eprint={2502.13130},
archivePrefix={arXiv},
primaryClass={cs.CV},
url={https://arxiv.org/abs/2502.13130},
}