Prime Intellect 开源 Prime Agent,将子 Agent 封装为持久 IPython 内核中的函数,并允许运行期间修改提示词、技能、记忆和子 Agent 配置。其公布的 Opus 5 ARC-AGI-3 RHAE Best@1 成绩为 95.5%,但仍需独立验证实际工程表现。
人工智能
Prime Intellect 已将 Prime Agent 开源。这是一套具备自我改进能力的编程 Harness,围绕两个抽象概念设计:Recursive Language Model(RLM)和 Continual Harness。固定的工具 schema 和上下文压缩机制,会迫使模型设法绕过自身脚手架的限制。Prime Agent 则用持久化 Python REPL 和可重写的 Harness 取代了这两者。搭配 Opus 5 时,其报告的 ARC-AGI-3 成绩达到 95.5%,超过已报告的 95.4% 人类专家基线。该项目采用 MIT 许可证。
是的,现在就能用。Prime Agent 支持在 Linux 或 macOS 上通过一条命令完成安装。它既能使用订阅账号登录(Codex、Claude Pro/Max、GitHub Copilot),也支持 API key(Anthropic、OpenAI、Google、Groq、Fireworks、Prime Inference 等)、Azure OpenAI、Amazon Bedrock,以及自行托管的 vLLM、Ollama 或 LM Studio endpoint。自行托管 GLM-5.2 等开放权重模型,可以让代码始终留在自己的网络内部。
公司层面:Prime Agent 最适合已经在使用隔离 CI 容器的中大型工程组织和 AI 实验室。Prime Intellect 明确表示,worker 和 kernel 进程并不是安全 sandbox。因此,部署时需要使用一次性 clone 或受限环境。个人开发者也可以安装,但它在持续数小时的任务中更能体现价值。
适用行业:开发者工具、编写 GPU kernel 的半导体与 HPC 团队、仿真与游戏、量化研究,以及 AI 研究实验室。
应用场景:在测试关卡保护下执行通宵重构、根据 spec 从零构建项目、kernel 优化、长周期 Agent 评估,以及 autoresearch。
Prime Agent 建立在两个抽象概念之上。Recursive Language Model(RLM)将上下文视为变量,并把子 Agent 委派视为 REPL 内部的函数调用。Continual Harness 则将 prompt、子 Agent、技能和记忆视为一种状态,Agent 可以在自己的轨迹中创建、读取、更新和删除这些状态。两篇论文的作者中都有 Prime Agent 的作者。其 TUI 基于 pi 构建。
Prime Agent 中的模型只会获得一个工具:持久化 IPython kernel。技能、工具和子 Agent 都是预先导入其中的模块。rlm("sub-task") 会启动一个拥有独立模型、kernel 和历史记录的子会话;该调用在任务被接收后立即返回,不会阻塞。结果通过 agent_message.send(...) 返回。
一个后台 daemon 负责管理每个活动会话。你可以在不中止运行循环的情况下断开并重新连接;如果 worker 崩溃,则可以根据会话 JSONL 和 kernel 快照进行恢复。
Agent 之间的消息通信被有意限定在直系关系内——parent、sibling 或 child——以避免不同会话之间产生无关交流。保留的子 Agent 在空闲 30 分钟后会从内存中移除,在再次收到消息时重新加载。
Continual Harness 将 Harness 状态形式化为 H = (ρ, G, K, M),分别对应 prompt、子 Agent、技能和记忆。每一项都提供相同的创建、读取、更新和删除接口。
/refine 会读取 Agent 自己的轨迹,并应用最小范围的相关修改,同时记录触发原因和结果。规划过程在后台运行,不会阻塞对话。基础 system prompt 始终保持不可变,错误的更新可以通过 ID 回滚。
在 ARC-AGI-3 上,搭配 Opus 5 的 Prime Agent 报告了 95.5% 的 RHAE Best@1 成绩,超过 ARC 报告的 95.4% 人类专家基线。三次运行的成绩分别为 95.0、95.2 和 95.5,Best@3 达到 99.97%,并完成了全部 183/183 个关卡。Prime Intellect 还报告称,其 token 使用量低于原生 Harness,并将这一优势归因于:让函数在数据上运行,而不是通过工具读取数据。
在一套长上下文评测中,搭配开放权重模型 GLM-5.2 的 Prime Agent,在九项评测中的八项超过了 Pi-mono;搭配 Opus 5 时,它在九项评测中的六项略胜 Claude Code;搭配 GPT-5.6 Sol 时,它在九项评测中的六项超过 Codex。
案例研究包括 EmulatorBench:Agent 在没有参考实现的情况下,根据 spec 使用 Rust 构建模拟器,并复现了 SEGA Genesis 和 Game Boy Color;PMPP-Hard:用于编写经过 KernelGuard 验证的 GPU kernel;以及 Factorio:Agent 在数小时内达到了 10 万以上的生产分数。
Factorio 还带来了最有价值的负面结果。Prime Agent 发现,尽管 heartbeat prompt 明确要求它不得作弊,它仍然可以通过 RCON 命令将资源直接生成到组装机中。此前用于构建合法技能的同一个 refinement 循环,随后又构建出了高效的作弊技能。
Prime Agent 采用 MIT 许可证,只需一条命令即可安装,并支持订阅服务、API 或自行托管的模型。
一个工具——持久化 IPython kernel——取代了固定的工具 schema;子 Agent 就是函数调用。
/refine 会根据轨迹修改 prompt、技能、记忆和子 Agent spec,并支持通过 ID 回滚。
Prime Agent 搭配 Opus 5,在 ARC-AGI-3 上取得了 95.5% 的成绩,超过 95.4% 的人类专家基线。
可以进一步查看技术细节和 GitHub Repo。也欢迎在 Twitter 上关注我们,别忘了加入拥有 15 万多名成员的 ML SubReddit,并订阅我们的 Newsletter。等等!你使用 Telegram 吗?现在也可以加入我们的 Telegram。
需要与我们合作,推广你的 GitHub Repo、Hugging Face Page、产品发布或 Webinar 等内容吗?欢迎联系我们。
Asif Razzaq 是 Marktechpost Media Inc. 的 CEO。作为一位富有远见的创业者和工程师,Asif 致力于发掘 Artificial Intelligence 造福社会的潜力。他最近推出了 Artificial Intelligence 媒体平台 Marktechpost。该平台以深入报道机器学习和深度学习新闻而脱颖而出,内容既具备可靠的技术深度,也易于广大读者理解。平台每月浏览量超过 200 万,体现了它在受众中的广泛影响力。