美团在机器学习顶会 ICML 的论文集合,展示团队在模型和算法创新方向的研究成果。
ICML(International Conference on Machine Learning,国际机器学习大会)是机器学习领域最具影响力的国际顶级学术会议之一。大会旨在探讨机器学习未来发展所面临的关键挑战与核心问题,并通过征集和评估具有重要理论价值和实际影响的前沿研究成果,推动领域发展,引领未来研究方向。
2026 年,ICML 共收到来自全球的 23,918 篇论文投稿,最终接收 6,352 篇,接收率约为 26.6%。本文解读了美团技术团队入选的 13 篇论文,涵盖 Agent 推理、强化学习训练、复杂任务生成、Agent 基准测试、监督微调等技术方向。
MemOCR:面向高效长程推理的版面感知视觉记忆机制
论文简介:长时间跨度的 Agent 推理,需要将不断增长的交互历史有效压缩到有限的上下文窗口中。现有大多数记忆系统会将历史序列化为文本,其中 token 级别的开销是均匀的,并且会随文本长度线性增长。
为此,我们提出了 MemOCR,一种多模态记忆 Agent。它通过视觉布局实现自适应信息密度的记忆空间分配,从而在紧张的上下文预算下提升长时间跨度推理能力。在长上下文多跳和单跳问答基准测试中,MemOCR 优于强文本基线方法,并在极端预算条件下实现了更有效的上下文利用。
ScaleEnv:从零开始构建可扩展的环境合成系统,用于训练通用交互式工具使用 Agent
论文简介:为 Agent 配备交互式环境和可验证任务,使其能够进行自我探索,对于培养可适应多样化场景的通用 Agent 至关重要。
我们提出了 ScaleEnv,一个完全从零开始构建全交互式环境和可验证任务的框架。ScaleEnv 通过程序化测试确保环境的可靠性,并通过工具依赖图扩展和可执行动作验证,保证任务的完整性与可解性。该框架在未见过的多轮工具使用基准测试中实现了显著的性能提升,展现出强大的泛化能力。
V_0:一种适用于任意策略初始状态的通用价值模型
论文简介:大语言模型强化学习训练中的价值模型面临耦合困境:它们需要与持续更新的策略同步训练。
我们提出了 V_0,一种通用价值模型。它将任务重新定义为上下文学习,通过预测未见策略的性能,将价值估计与特定策略参数解耦。实验结果表明,V_0 在 GRPO 训练过程中追踪策略演化的能力优于耦合价值模型,还能够优化冷启动预算分配,并在推理路由中逼近性能—成本的 Pareto 前沿。
学习自我验证,让语言模型具备更强的推理能力
论文简介:近期的大语言模型在为复杂任务生成有潜力的推理路径方面表现出色,但在验证自身答案方面依然薄弱。
我们发现,学习自我验证能够有效提升生成性能,并产生更加高效的推理轨迹。为此,我们提出了一个多任务强化学习框架,将生成和自我验证作为两个独立但互补的目标进行联合优化。实验表明,该方法在生成能力和验证能力上均优于只进行生成训练的方法。
AgentNoiseBench:噪声条件下工具使用型大语言模型 Agent 的鲁棒性基准评测
论文简介:随着基于大语言模型的 Agent 越来越多地被部署到实际工作流程中,现有的 Agent 基准测试已不足以刻画 Agent 面对不完善的用户指令和不可靠的工具反馈时所表现出的鲁棒性。
我们提出了 AgentNoiseBench,一个用于系统评估大语言模型 Agent 交互式噪声鲁棒性的框架。该基准对用户侧指令噪声和工具侧结果噪声这两类主要噪声来源进行建模,并提供模块化噪声注入管道和多维度评估指标。通过评估 25 个工具使用模型,我们发现工具侧噪声引起的性能下降通常比用户侧噪声更为明显。
AJ-Bench:面向环境感知评估的 Agent-as-a-Judge 基准
论文简介:随着强化学习不断推动基于大语言模型的 Agent 训练走向规模化,如何在复杂环境中可靠地验证 Agent 行为,正变得日益困难。现有方法依赖基于规则的验证器或 LLM-as-a-Judge 模型,但这些方法很难泛化到狭窄领域之外。
Agent-as-a-Judge 通过主动与环境和工具交互,获取可验证的证据,从而解决这一局限性,但其能力仍未得到充分探索。我们提出了 AJ-Bench,用于系统评估 Agent-as-a-Judge 在搜索、数据系统和图形用户界面三个领域中的表现,涵盖 155 个任务和 516 条标注轨迹。
该基准全面评估了评判 Agent 在信息获取、状态验证和过程验证方面的能力。实验表明,与 LLM-as-a-Judge 基线方法相比,Agent-as-a-Judge 取得了稳定的性能提升,同时也揭示了基于 Agent 的验证方法仍然面临若干重大的开放性挑战。
LUVE:基于双频率专家的潜空间级联超高分辨率视频生成
论文简介:为了解决超高分辨率视频生成中连贯性与算力难以兼顾的问题,论文提出了基于双频专家的潜空间级联框架 LUVE。
该框架创新性地采用了三阶段架构:首先,通过低分辨率生成保障运动一致性;其次,利用潜空间上采样直接提升分辨率,大幅降低内存与计算开销;最后,融合高频和低频专家细化高分辨率内容,全面增强全局语义与局部细节。
实验表明,LUVE 展现出了卓越的逼真度与内容保真度,其核心思想现已成功应用于美团 LongCat-Video 模型。
Infinite-World:通过无位姿层次化记忆,将交互式世界模型扩展至 1,000 帧
论文简介:Infinite-World 是一个面向真实场景的长程交互式世界模型,其目标是在生成 1,000 帧以上的视频时,依然保持稳定的视觉记忆和动作响应。
针对真实视频中位姿噪声大、视角回访稀少的问题,论文提出了三项创新:使用无位姿层级记忆压缩器,将历史 latent 压缩为固定预算的记忆,降低长程建模成本;使用不确定性感知动作标注,提升噪声轨迹下的动作学习效果;通过高回访数据微调,增强 loop closure 能力。
总体而言,Infinite-World 让世界模型能够更好地从真实视频中学习长时空一致性。
WildActor:无约束身份保持视频生成
论文简介:本文提出了 WildActor,一种面向无约束身份保持的视频生成新框架,旨在解决现有方法在动态长镜头和视角剧烈切换时出现的全身体态不一致、面部漂移及姿态僵死伪影等问题。
在机制层面,WildActor 构建了包含 1.6M 视频和 18M 多视角图像的大规模数据集 Actor-18M,有效解决了原始数据中的正脸偏置问题。同时,它引入非对称身份保持注意力(AIPA),将身份与运动生成解耦;结合身份感知 3D 旋转位置编码(I-ROPE),显式分离时空 Token;并配合视角自适应蒙特卡洛采样,实现鲁棒的任意视角条件控制。
实验表明,在新构建的 Actor-Bench 连贯叙事与泛化测试中,WildActor 的全身一致性与文本对齐度不仅显著优于现有开源及商业大模型,还验证了其在复杂现实场景中保持物理恒常性的优越能力。
SAFT:面向大语言模型的谱自适应微调方法
论文简介:监督微调通常使用交叉熵作为目标函数。虽然这种方式学习效率较高,但交叉熵并不是正确率的光滑近似;同时,由于它会特别关注预测概率较低的样本,因此容易对噪声产生过拟合,并导致模型过度自信。
DFT 在梯度层面等价于优化正确率的光滑近似函数,在保持训练与推理一致性的同时提升了鲁棒性,但也会削弱模型学习可学习难样本的效率。因此,SFT 与 DFT 构成了效率—鲁棒性权衡的两个端点,而真实数据应该选择怎样的折中方案,则取决于其未知的内在 SNR。
我们提出了一套轻量级 pre-test protocol:使用少量训练数据分别训练 SFT 和 DFT,并在验证集上比较二者的表现。如果 SFT 更优,则将数据判定为高 SNR,并选择几何插值 Geo-SAFT;如果 DFT 更优,则将数据判定为低 SNR,并选择调和插值 Har-SAFT。
相比仍然保留低置信度梯度发散问题的线性插值方法,SAFT 通过数据自适应的几何或调和非线性插值,匹配不同的噪声 regime,从而获得更优的鲁棒性—效率 Pareto trade-off。
TRIP-Bench:真实场景中长时域交互式 Agent 的基准评测
论文简介:本论文提出了 TRIP-Bench,一个面向长程交互式 Agent 的旅行规划评测基准。它基于真实世界数据构建,包含 18 个工具和 40 多类旅行约束,重点考察模型在多轮对话中保持全局约束、调用工具、处理用户需求变化,以及反复修改方案的能力。
其中,困难任务最长可达 15 轮用户交互、150 次以上工具调用,甚至超过 20 万 tokens 的上下文。实验表明,现有先进模型在该基准上的表现依然有限。
论文进一步提出了 GTPO 多轮强化学习方法,通过奖励归一化和轮次级奖励差分提升模型的鲁棒性,使 Qwen2.5-32B-Instruct 在评测中的表现超过 Gemini-3-Pro。
InfVSR:面向一致性驱动的流式生成视频超分辨率
论文简介:本文提出了 InfVSR,一种面向一致性驱动的流式生成视频超分辨率新框架,旨在解决扩散式视频超分辨率方法在长视频场景中存在的推理效率低、显存占用大和时序不一致等问题。
其核心机制包括:将预训练视频 DiT 改造成因果流式架构,引入滚动 KV 缓存,以维持局部过渡的平滑性;设计联合视觉引导,通过交叉注意力注入全局语义锚点,抑制累积误差漂移。
在训练阶段,该方法结合分块像素监督与跨块分布匹配,对时序一致性施加双重约束,并将扩散过程蒸馏为高效的单步推理。实验表明,InfVSR 在多项基准上取得了 SOTA 性能,时序一致性显著领先,推理速度提升 58 倍,并且在处理长序列时保持恒定的显存占用。
DRIVE:基于混合分布与检索增强的价值评估出价策略
论文简介:针对标准 Decision Transformer(DT)在复杂竞价环境中的三大痛点——“平均动作”陷阱、长尾幻觉和缺乏推理优化——论文提出了一个“生成—检索—评估”闭环框架:
该方案显著提升了决策的鲁棒性。