总结当前AI研究热点:Agent自主化、长期记忆基础模型、多模态World Model、物理感知视频生成。包含化学领域AI应用案例。
今天,Hugging Face 上获得最多投票的论文清单展示了当前 AI 发展方向的清晰图景:agent 化、长期记忆、world model、具有物理一致性的视频生成,以及对多模态模型的上下文学习能力评估。
在这篇文章中,我将介绍 10 篇杰出论文,重点关注每篇论文的 4 个问题:
他们正在解决什么问题?
实际应用可能是什么?
GitHub: https://github.com/bingyan4science/askchem
Project: https://www.askchem.org
化学文献增长过快,使得从论文中综合知识变得耗时且容易遗漏。研究人员不仅需要查找论文,还需要提取科学声明:哪种物质与哪种物质反应,什么条件导致什么结果,哪些结论由什么证据支持。
AskChem 构建了一个以声明为中心的化学文献综合基础设施。与其说只进行全文语义搜索,不如说该系统围绕可验证和对比的科学命题组织知识。这帮助用户从科学问题转移到一组相关声明、支持证据和实验背景。
值得注意的是从文档检索向声明综合的转变。这是一个巨大的区别:目标不仅是"哪些论文相关?",而是"这个领域的主要结论是什么,它们是否一致,以及如何支持?"。在化学领域,数据分散在文本、表格和反应条件描述中,这种方法特别有价值。
支持文献综述研究
加速材料、催化剂或合成工艺的发现
为化学、制药和材料企业构建 R&D 助手
Project: https://tongyi-mai.github.io/Qwen-UI-Agent/
操纵用户界面的 AI agent 在进入真实世界时仍面临困难:应用程序改变布局、按钮不规范、拖拽操作、意外弹窗,或需要多步推理的操作。
Qwen-UI-Agent 旨在构建一个能够观察屏幕、理解界面结构、规划行动并在真实应用上执行的基础 GUI agent。也就是说,将模型从"知道如何回答的聊天机器人"转变为"知道如何使用软件的代理"。
新颖之处在于以真实世界为中心的定向。许多现有 GUI 基准相对干净和理想化,而实际环境充满噪声。这份技术报告很可能专注于架构、训练数据和机制,以帮助 agent 在真实界面上运行更稳定,而不是在封闭演示中。
自动办公工作流助手
辅助客户操作软件
结合视觉和语言的新一代 RPA
GitHub: https://github.com/MemTensor/Metis
当前大多数基础模型在短期推理上表现强劲,但在长期记忆上表现不佳:难以保留经历、难以回顾旧的上下文,并且缺乏像一个基础组件那样的"内存"结构。
Metis 提出了一个内存基础模型——即将内存作为中心能力的模型,而不仅仅是向量数据库或扩展上下文窗口等附加组件。目标是帮助 AI 能够更有效地随时间记忆、检索和使用信息。
如果以前的系统主要在模型外部的工程级别处理记忆,Metis 似乎将记忆视为学习对象和核心架构组件。这是一个值得关注的方向,因为它与 AI agent、个人助手和长期工作系统直接相关。
个人助手记住用户的偏好、历史和长期目标
软件 agent 执行跨越多天的任务
企业支持系统保留和利用运营知识
GitHub: https://github.com/FrontisAI/OpenRSI
Project: https://frontisai.github.io/OpenRSI/
AI 的一个宏大梦想是递归自我改进:模型可以帮助构建、评估和改进其他 AI 系统。但实际上,ML 工程是一个复杂的过程:需要编写代码、运行实验、修复错误、优化管道、跟踪指标。
Frontis-MA1 是一个朝向 AI for AI 方向的模型:训练一个 agent 或模型,能够直接支持机器学习工程过程。换句话说,这是从"AI 编写代码"到"AI 懂得做 ML 工程师"的进步。
最大的新颖之处在于清楚地定位了 AI4AI 问题和递归自改进目标。与其说通用编码基准,paper 针对真实 ML 工程环境,其中 agent 需要结合对模型、数据、训练和评估的理解。
自动尝试模型和超参数
支持 training pipeline 调试
加快 AI 团队的研究循环
为"AI 研究工程师"开辟半自动化道路
GitHub: https://github.com/yaoyao-jpg/PhiZero
Project: https://phi-zero.github.io/
许多现有 world model 从视频或轨迹等感官数据学习,但缺乏用物理语言表达和推理世界的能力:力、运动、碰撞、约束、因果。
PhiZero 构建了一个围绕所谓物理语言的 world model。核心思想是物理世界不仅应该被编码为隐状态,而且还应该用结构化、易于解释和支持推理的概念来描述。
这里的新颖之处在于尝试连接通常分开的两件事:
在潜在空间中表示世界,
用语言描述物理规律。
如果做得好,模型不仅可以预测接下来会发生什么,还可以解释为什么会发生。
机器人技术和控制
具有可解释性的物理模拟
与真实世界互动的学习系统
为设计、工程和游戏引擎服务的 AI
GitHub: https://github.com/LiJiaxing0213/DistillAlign
Project: https://lijiaxing0213.github.io/DistillAlign/
当将自回归视频模型从教师蒸馏到学生时,通常存在两个目标之间的矛盾:
mode covering: 充分覆盖数据分布
mode seeking: 生成清晰、一致、高质量的样本
优化一方通常会削弱另一方。
DistillAlign 提出了如何在视频蒸馏过程中协调这两个目标的方法。目标是保留多样性和生成质量。
与其说 mode covering 和 mode seeking 是两个互斥的选择,paper 寻求在同一训练过程中对齐它们。这是生成建模的一个核心问题,对视频尤其严重,因为视频还需要时间一致性。
将大型视频生成模型压缩为更小的模型
在资源受限的基础设施上部署视频生成更高效
在广告、内容创意和模拟中的应用
GitHub: https://github.com/micky-li-hd/VideoCoCo
AI 生成的视频往往视觉上漂亮但物理上容易出错:物体穿过彼此、轨迹不现实、运动缺乏一致性。原因是视频生成模型在纹理上强大但在因果-物理结构上薄弱。
VideoCoCo 使用 Code-as-CoT 的想法:与其说纯语言推理,不如说系统使用代码作为结构化思维链来描述场景、规则和物理演进。结合 agentic 双引擎系统,可以理解为两个引擎的协调:一方进行推理/结构化,一方生成视频。
突出的新颖之处是将代码引入视频生成中物理推理的中介角色。这是一个有趣的进步,因为代码具有精确性、可检查性,比自然语言更适合表示动力学规则。
创建更可信的物理模拟视频
支持动画或 previsualization 制作
为机器人和具身 AI 生成训练数据
GitHub: https://github.com/LUMIA-Group/MemoryDecoder-at-Scale
Project: https://rubin-wei.github.io/memory-decoder-at-scale/
语言模型面临上下文窗口限制,通常依赖于模型外检索。但检索不总是足够快、足够稳定或足够紧凑来处理长期知识。
本文提出了一个预训练的内存解码器,作为参数化长期记忆的形式。这意味着模型本身学会充当长期记忆的角色,能够解码和检索在其参数中积累的信息。
与模型外内存不同,这个方向强调大规模预训练的参数化记忆。它暗示记忆可以是独立模块,但仍然可以像标准化神经组件一样学习。
需要维持长期用户知识的助手
多轮问答系统
持续在内部知识库上工作的企业 agent
GitHub: https://github.com/NOVAglow646/Beacon
并非每个视觉问题都需要多步 agentic 推理。如果总是规划长、调用工具、分解问题,系统会变慢且资源消耗重。但如果在需要时不这样做,推理质量会下降。
Beacon 关注一个非常实际的问题:何时应切换到 agentic 视觉推理模式,以及如何切换。这是一个推理策略协调问题,不仅仅是增加感知能力。
新颖之处在于将使用推理的决定视为需要学习的独立问题。这对生产级多模态系统来说是一个重要的想法,其中计算效率和延迟几乎与准确性一样重要。
节省推理成本的 VQA 和视觉助手
智能图像监视系统
机器人视觉根据不同情况选择合适的分析策略
GitHub: https://github.com/IamLihua/CLBench-V
现有多模态基准通常测量单个技能,但对评估上下文学习能力不够好:模型在执行任务时从新上下文学习,从直观接地到获取新知识。
CLBench-V 推出了一个基准来衡量多模态模型的上下文学习能力,涵盖广泛的频谱:从识别/接地到推理和知识积累。
新颖之处在于评估焦点从"模型预先知道什么"转向"模型从提供的上下文中学到什么"。这是一个日益重要的标准,当我们想要构建能够快速适应新环境、文档或规则的 AI 时。
在新环境中评估多模态助手
为低训练数据专业任务选择模型
设计更接近企业需求的基准
观察整个列表,可以看到 4 个突出的趋势。
Qwen-UI-Agent、Frontis-MA1 和 Beacon 等论文表明 AI 不再仅仅是文本生成模型。它正在成为能够观察、决策并在真实环境上操纵的 agent。
Metis 和 Memory Decoder at Scale 反映了一个日益明确的认识:如果 AI 想在长期内有用,它需要良好的内存架构,而不能只依赖越来越长的上下文窗口。
PhiZero 和 VideoCoCo 强调,想要与真实世界互动的模型必须理解物理结构、因果和动力学,而不是仅仅再现数据表面。
通过 CLBench-V,社区不仅想让模型更强大,还想测量得更对:模型是否从新上下文学习,它是否知道何时需要推理,是否有效利用知识。
如果必须总结,今天的顶级论文表明 AI 正按以下方向进展:
被赋予行动的权力
被给予内存系统
被要求理解物理世界
并被更实际地评估
短期内,这些方向将对个人助手、软件自动化 agent、科学研究工具和多模态内容生成系统等产品产生强大影响。长期来看,这些可能是构建真正能在开放、延长和受约束的环境(如真实世界)中工作的 AI 的重要基石。
如果你想要,我可以继续做第 2 部分,遵循以下方向之一:
10 篇论文按目标、数据、基准和应用的比较表
每篇论文极其简短的 3 句总结
选出 5 篇对初创公司/工程师/研究员最值得阅读的论文
以科技通讯风格重写博客
For further actions, you may consider blocking this person and/or reporting abuse