LongCat 开源 VitaBench 2.0,在真实生活场景评测 Agent 的长期用户建模与主动性能力,为个性化对话系统设计提供新基准。
一个经常加班的白领,一个带着孩子出游的父亲,你的 AI 助理能分清他们需要什么样的服务吗?
AI 能执行你明确的指令,却很难记住那些藏在场景和身份背后的真实需求。它们是真的无法理解,还是“情商”不够高呢?
自去年 10 月发布 VitaBench 1.0、首次定义生活场景下智能体任务的复杂度后,美团 LongCat 团队再次推出 VitaBench 2.0。它不再仅仅关注任务有多难,而是将目光投向了更深层次的挑战。
VitaBench 2.0 是首个面向真实生活场景中长期动态用户建模的智能体评测基准,系统性地评测大语言模型在长期、真实、动态的用户互动中展现出的个性化与主动性能力。
VitaBench 2.0 的核心“硬核”看点:
能得出这些结论,得益于 VitaBench 2.0 的核心设计。它不再是简单的问答,而是围绕三大创新构建了一个前所未有的评测体系。
不同于一次性的问答,VitaBench 2.0 为 56 位虚拟用户构建了横跨送餐、到店、差旅等多个真实领域的生活轨迹,其中包含 2,000 多种动态偏好,时间跨度长达数年。
这背后是庞大而真实的数据支撑。如下图所示,这些图表直观地展示了我们所构建用户画像和偏好分布的真实性与复杂性。
这些偏好被巧妙地嵌入碎片化的互动历史中,包括对话记录和行为日志,如浏览、搜索、下单。智能体必须像侦探一样,从这些混杂着“信号”与“噪声”的线索中持续理解用户。
传统的 Agent 评测关注“单个任务是否完成”,而 VitaBench 2.0 的核心目标,是评测智能体能否持续理解一个动态变化的人。
为此,我们将评测的时间轴拉长到了前所未有的尺度:用户的平均交互周期长达 1,580 天,约合 4.3 年,最长甚至达到 2,974 天。在这条漫长的时间线上,智能体需要不断提取、利用并更新对用户的理解,才能在后续任务中做出正确决策。
这从根本上改变了评测的焦点:从单次任务是否成功,转向对用户偏好理解能力的考核。
为了探究记忆在长期用户建模中的作用,VitaBench 2.0 搭建了首个真实用户场景下的统一长期智能体评测平台。通过可扩展接口,让两种具有代表性的机制在此展开对决:
通过对比这两种模式,我们可以清晰地看到不同记忆架构,以及同一架构下不同设计对个性化决策产生的真实影响,从而回答“AI 应该如何记忆”这一关键问题。
同时,为了考验 AI 的“眼力劲”,我们还设计了主动性任务。在这些任务中,AI 必须意识到信息不足并主动提问,而不是盲目做出决策。
VitaBench 2.0 不仅给出了总分,还通过数据揭示了模型犯错的具体原因。如表 1 所示,这是主要模型在不同记忆设置下的性能排行榜。
从排行榜(表 1)可以看出,即使在能够看到全部历史记录的“开卷”模式下,最强模型 Claude-Opus-4.6 的平均分也刚刚超过 0.5。这说明,从海量信息中准确提炼偏好,本身就相当困难。而一旦切换到更贴近真实情况的记忆模式,模型的表现便出现了不同程度的下滑。
如下图所示,随着任务序列索引增加,也就是随着时间推移,所有模型的平均性能都在下降。这说明,无论是处理超长上下文的能力,还是记忆模块产生的累积误差,都在严重限制 AI 的长期服务能力。
更关键的是,记忆并没有成为解药。对比实验发现,大部分模型在接入 Agentic Memory 或 RAG Memory 后,性能反而低于直接使用完整历史记录的场景。记忆并不是装上就好,如何正确更新、检索和利用记忆,才是真正的挑战。
一个常见假设是,开启模型的“思考模式”能够提升其表现。然而,VitaBench 2.0 的实验结果给出了相反的答案:开启思考模式,在个性化任务上并不总是有帮助。
下图展示了模型在开启和关闭思考模式时,性能与效率之间的关系。横轴表示完成任务所需的交互轮数,越少越好;纵轴表示平均性能,越高越好。理想的模型应该位于左上角。可以看到,开启思考模式的点并没有稳定地优于关闭思考模式的点。
模型普遍缺乏在信息不足时主动提问的“眼力见”。所有模型家族在需要主动提问的任务上,得分都出现了“断崖式”下跌。例如,Claude 家族的平均分从 46.0 骤降至 27.4。这表明,AI 更倾向于“想当然”,而不是在不确定时“多问一句”。
为了分离“提取偏好”和“利用偏好”这两个难题,我们直接将真实的用户偏好告诉模型。虽然性能有所提升,但仍有很大的进步空间。即便将真实偏好直接告知模型,多数模型依然会失败。
这说明,即使拥有准确的用户画像,如何在高压、多约束的决策中正确应用这些偏好,本身仍是一个巨大的挑战。
我们对模型的失败原因进行了分类统计。在由 66 个真实工具构成的复杂生活服务场景中,早期模型更多会犯工具使用错误(A 类),例如选错 API 或填错参数。
而更强的模型,如 DeepSeek-V4-Pro,虽然工具使用能力有所提升,但在偏好理解和应用(B 类)上的失败却成了主要矛盾。这表明,随着模型基础能力的提升,个性化已经成为当前 Agent 面临的最大瓶颈。
VitaBench 2.0 清晰地揭示了:当前 AI 在成为“高情商助理”的道路上,依然任重道远。
它的核心价值,在于推动了评测范式的演进:从单点任务到长期陪伴,从被动执行到主动沟通,从黑盒到透明。
这使 VitaBench 2.0 成为一座连接技术与产品的“桥梁”。它通过可量化的数据回答了“我的 AI 为什么不够好用”这一问题,并为开发者指出了模型在“服务于人”这一终极目标上的具体短板。
我们希望,VitaBench 2.0 能够成为一个起点,激发更多研究关注智能体的个性化、记忆和主动性,共同推动 AI 从一个强大的“工具”进化为一个有温度的“伙伴”。
VitaBench 2.0 已全面开源,欢迎各大模型前来接受“情商”大考。
项目主页:VitaBench 2.0
论文:VitaBench 2.0 论文
GitHub:meituan-longcat/vitabench-2.0
HuggingFace:meituan-longcat/VitaBench-2.0