NVIDIA开源NOOA框架,将Agent的提示模板、工具模式、回调代码、工作流图谱全部折叠为一个Python类,方法即动作、字段即状态、文档即提示词。
NVIDIA AI 发布了 NOOA:一个面向对象的 Python 框架,将 AI Agent 变成一个 Python 类
NVIDIA Labs 开源了 NOOA(NVIDIA Object-Oriented Agents),一个与模型无关的 Python 框架,用于构建 AI Agent。当前的 Agent 开发分散在提示词模板、工具模式定义、回调代码和工作流图谱中。NOOA 将所有这些整合到一个 Python 类中。方法是模型可以执行的操作,字段是 Agent 的状态,文档字符串是提示词,类型注解是运行时强制执行的契约。如果一个方法的方法体是 ...,则在运行时由 LLM 驱动的循环来完成;而方法体为普通代码的方法则保持为确定性 Python 代码。开发者和模型因此共享同一个接口,Agent 的行为可以像普通软件一样进行测试、追踪、重构和版本控制。NVIDIA 报告在 SWE-bench Verified 上达到 82.2%、CyberGym L1 上达到 86.8%、ARC-AGI-3 上平均 RHAE 达到 85.1%——而其 token 消耗大约只有对比的开源 harness 的一半。
是的,但只能在 OS 级别隔离内执行。NOOA 采用 Apache 2.0 协议,可通过 pip install nooa 安装(v0.0.8,2026 年 7 月 30 日发布),需要 Python 3.12–3.13。PyPI 将其归类为 alpha 阶段,NVIDIA 描述其为研究预览版。Agent 可以执行 LLM 生成的代码,NVIDIA 明确表示其 AST 检查和模块拒绝列表是纵深防御 guardrail,而不是隔离边界。真正的隔离边界是容器、虚拟机或 NVIDIA OpenShell。模型通过 LiteLLM 可插拔替换,因此托管 API、Ollama 和 vLLM 端点都可以使用。
公司层面:构建内部 Agent 的 AI 原生初创公司和中间市场平台团队。运行评估或试点项目的企业 AI 平台和应用研究团队。受监管的生产工作负载应等待稳定版本发布。
行业:开发者工具、网络安全、云和 DevOps、数据分析、金融服务运营、客户服务。
应用:仓库 Issue 分诊和修复、终端和基础设施自动化、漏洞验证管道、大批量内存数据分类和提取、类型安全的多 Agent 编排。
NVIDIA Labs 发布了 NOOA(NVIDIA Object-Oriented Agents),一个与模型无关的 Python 框架,用于构建 Agent。传统的 Agent 开发将源代码分散在提示词模板、工具模式定义、回调和工作流图谱中。NOOA 将所有这些整合到一个类中。
方法是模型可以执行的操作,字段是状态,文档字符串是提示词,类型注解是运行时强制执行的契约。如果一个方法的方法体是 ...,它就成为一个 Agent 方法,在运行时由 LLM 驱动的循环完成;方法体为普通代码的方法则保持为确定性 Python,模型可以将其作为工具调用。
框架提供了两种策略。PredictStrategy 是单次类型化 LLM 调用,带有验证失败时的本地重试循环。CodeActStrategy 运行一个迭代式 Python REPL,模型在其中反复调用 execute_python(...) 直到提交 return_result(...),然后根据返回注解进行验证。
研究团队识别出六个面向模型的理念,声称是首个将它们组合在一起的:类型化输入输出、通过引用传递活对象、代码即操作、可编程循环工程、显式对象状态、以及模型可调用的 harness API。NVIDIA 评估了十四个框架和 harness——LangGraph、Google ADK、PydanticAI、smolagents、Claude Agent SDK、OpenAI Codex、OpenHands 等——使用相同的评估维度,报告在其他所有框架中都只有部分覆盖。
通过引用传递是其中承重的一个。参数作为活 Python 对象传入;模型只看到一个有界的预览,包含具体类型、实际长度和头尾样本。一个包含一百个元素的列表渲染约需三十个 token,而完整变量保留在 REPL 中。上下文被分割为可缓存的静态前缀、仅追加的类型化事件历史,以及尾部的动态块,这保证了跨轮次的 KV-cache 重用。
一个可选的内存子系统附加到未修改的 Agent 上。七个模型可调用的工具写入和检索按 ACT-R 激活值排名的记录,全部存储在一个人类可检查的 SQLite 文件中。
能力测试在十个模型上各运行 88 个测试五次:4,400 条记录中有 4,309 条通过(97.9%)。涵盖批处理、错误恢复和分解的六族压力测试子集通过率为 84.7%,其中小型模型和前沿模型之间的差距从 3.2 分扩大到 23 分。
端到端来看,一个与 benchmark 无关的 253 行 Agent 在 GPT-5.5 xhigh 推理努力下达到 SWE-bench Verified 82.2%,对比 OpenCode 的 78.6% 和 PI 的 78.2%,以及 Opus 4.6 的 79.8%。在 Terminal-Bench 2.0 上,它在 high 推理努力下达到 73.0%,对比 60.7% 和 68.5%,不过 PI 在 xhigh 下以 75.3% 领先。在 CyberGym L1 上,它在阻断网络访问的情况下解决了 86.8%,是报告的最高开源结果。在 ARC-AGI-3 上,一个带有单页世界模型技能的 Agent 在 GPT-5.5 下达到平均 RHAE 50.2%,在 GPT-5.6-sol 下达到 85.1%,每个游戏成本低于 20 美元。
效率是更有意思的结果:82.2% 的成绩大约消耗 110 万 token 和每个任务约 28 次模型调用,而 PI 在 78.2% 时消耗 220 万 token 和 66 次调用。Trace 分析还将这一结果归功于经验证的终止机制——OpenCode 在模型回复不带工具调用时停止,而 NOOA 要求一个携带证据和验证命令的 typed TaskResult。
一个 Agent 就是一个 Python 类——方法是操作,字段是状态,文档字符串是提示词,注解是强制执行的契约。
一个 ... 方法体变成 LLM 循环;真实的方法体保持为模型可调用的确定性 Python。
通过引用传递让大数据保留在 REPL 中,因此在 SWE-bench 上不需要上下文压缩。
SWE-bench Verified 82.2% 和 CyberGym L1 86.8%,token 消耗大约只有对比开源 harness 的一半。
Apache 2.0 协议,可 pip 安装,但是 alpha 阶段——只在 OS 级别隔离内执行生成的代码。
查看 Paper、GitHub Repo 和 Technical Blog。也欢迎在 Twitter 上关注我们,不要忘记加入我们的 150k+ ML SubReddit 并订阅我们的 Newsletter。等一下!你用 telegram 吗?现在你也可以加入我们了。
需要与我们合作推广你的 GitHub Repo 或 Hugging Face Page 或产品发布或网络研讨会等?请联系我们
Asif Razzaq 是 Marktechpost Media Inc. 的 CEO。作为一位有远见的企业家和工程师,Asif 致力于将人工智能的潜力用于社会公益。他最新的事业是推出了一个人工智能媒体平台 Marktechpost,该平台以深度报道机器学习和深度学习新闻而著称,内容既技术严谨又通俗易懂。该平台每月浏览量超过 200 万次,展示了其在受众中的受欢迎程度。