UC Berkeley 发布 CUA-Lite,用统一 action space 和数据 schema 整合 sandbox、环境、trace 与 RL 框架,Docker 镜像仅 0.9 GB。
UC Berkeley 研究团队发布了 CUA-Lite,这是一个用于计算机操作 Agent(Computer-Use Agents,CUA)的开放平台。其背后的论证是基础设施层面的,而非模型层面的:训练和评测一个 CUA 需要四个组件:Agent、环境、轨迹(traces),以及用于评估和训练它们的框架——而这四者目前分散在不同的仓库中,接口互不兼容。CUA-Lite 将它们统一到一个操作空间、一个数据schema和一个命令下,支持桌面、浏览器和移动端。
可以。该技术栈通过 uv sync --all-extras 在 Python 3.12 上安装,轻量级沙箱运行在任何 Docker 主机上,无需 /dev/kvm,因此云实例、CI runner 和嵌套容器均能正常工作。
最具体的贡献是 Lite.OSWorld。OSWorld 提供了一个真实的 Ubuntu 桌面,但它以每个任务一个完整 QEMU/KVM 虚拟机的形式交付,需要嵌套虚拟化——大多数托管基础设施并不暴露这一能力。CUA-Lite 在一个普通 Docker 容器内的 GNOME 桌面上复现了相同的任务套件和相同的评估器。
| Lite.OSWorld | OSWorld | |
|---|---|---|
| Runtime | QEMU/KVM | Docker 容器 |
| 宿主机要求 | /dev/kvm,嵌套 virt |
任意 Docker 宿主机 |
| 内存 | 4.1 GB | 0.9 GB |
| 冷启动 | 29.9 s | 23.8 s |
| 并行度 | baseline | ~4.6× 更多实例 |
| 任务套件 | OSWorld | 相同 |
将 VM 替换为容器后,保真度显然是首要顾虑,团队直接回应了这一点:在 13 个模型上,Lite.OSWorld 的分数与 OSWorld VM 的分数一致,因此在容器中获得的分数或训练信号可以迁移回真实基准。现在同一个基础之上承载了一系列沙箱:Lite.ScaleCUA、Lite.CUAGym 和 Lite.CUAWorld,后者扩展到大约 40 个应用,包括 Blender、QGIS 和 VS Code。该平台总计声称拥有 30k+ 可验证任务。
CUA-Lite 的第二层是 LiteSample,这是一个跨所有环境、Agent 和任务类型共享的单一监督学习 schema,以纯 parquet 格式加图片发布。十多个现有的 CUA 数据集已经预处理入库,并免费发布在 Hugging Face 上,包括 Aguvis、OpenCUA、ScaleCUA、GUI-360、GUIOdyssey 和 Multimodal-Mind2Web。在这些语料库旁边,是通过将前沿教师模型在沙箱中滚动生成的新鲜 rollout 数据集,用于蒸馏到更小的学生模型。
由于不同模型家族期望不同的脚手架,框架为每个模型提供了一个适配器,将统一的 LiteSample 打包成各模型自己的训练格式,包括历史折叠(history collapsing),使多个步骤共享一次前向传播。
Agent 和环境在 lite.gym 中相遇:截图上传,动作下达,每个平台一个操作空间。内置了 10+ 个基于 GPT、Claude、Gemini、Qwen3-VL、UI-TARS、Fara-7B、MAI-UI 等的 Agent,并集成了 15+ 个基准测试,涵盖:
在 scripts/rollout.py 中切换 --model-id 和 --env-id 就是全部接口。
同一循环也服务于训练。对于 SFT,README 记录了基于 Lite.ScaleCUA 桌面轨迹对 Qwen3-VL-2B-Instruct 进行微调的情况,将 332 任务 lite.osworld 评估分割上的平均 episode return 从 0.138 提升到 0.237,这是双 GPU 上的单一报告配置,并非独立复现的结果。对于 RL,在环境中评分的 rollouts 驱动 atop GRPO 更新,配套的 MobileGym 示例覆盖了 28 个应用的 416 个移动任务。
CUA-Lite 将 Agent、环境、轨迹和训练统一在一个操作空间和一个 LiteSample schema 下。