Agent 运行时正从短时模型循环演进,LangGraph、OpenHands、CrewAI、AutoGen 等框架已将持久化、检查点、中断恢复、沙箱执行作为一等公民。
持久化、检查点、中断、恢复、沙箱以及结构化运行时操作正在成为标准基础设施。
作者:JoinWell52 Research Center · 2026-08-02
Originally published at JoinWell52 Research Center. Visit the Research Center home page for more research and articles. This cross-post uses the original English article as its canonical source.
最强的开源工程信号之一,是 Agent 系统正在超越短期模型循环。如今重要的运行时问题是:状态存储在哪里、执行在哪里暂停、失败后工作如何恢复、如何审查风险操作,以及工具实际在哪里运行。
LangGraph 将持久化、检查点、人工中断和容错恢复作为一等公民运行时原语。OpenHands 将 Agent 逻辑与沙箱执行环境分离。 CrewAI 将团队与持久化流程和运营部署相结合。AutoGen 暴露了保存/加载状态、团队控制、终止、跟踪日志和结构化事件日志。
研究中心判断:
生产级 Agent 运行时不再由工具调用单独定义。其最低工程契约包括持久化状态、中断、恢复、隔离、可观测性以及明确的完成控制。
以下官方材料被选中,因为它们描述了具体的运行时机制,而非一般产品定位:
LangGraph 持久化和人在环中间件文档 — 检查点、线程、待写入、故障恢复、批准/编辑/拒绝决策以及恢复行为。
OpenHands 运行时和沙箱文档 — Docker 隔离、进程和远程沙箱、运行时插件、命令执行和服务暴露。
CrewAI 文档 — 有状态流、长时间运行工作流恢复、护栏、人在环触发器、可观测性和部署。
AutoGen 文档 — 团队状态、保存/加载、终止、跟踪日志、结构化事件日志以及面向运行时的团队控制。
这些来源记录了可用的机制。它们不能独立证明在所有生产工作负载下的可靠性。
LangGraph 将图状态保存为按线程组织的检查点。检查点支持中断、内存、时间旅行调试和故障恢复。当某个步骤中某些节点成功而另一个失败时,待写入可以减少不必要的重新执行。
AutoGen 单独支持保存和加载 Agent、团队和终止条件。 CrewAI Flows 描述了长时间运行工作流的状态管理、持久化和恢复。
共同方向很明确:运行时状态必须超越一个模型响应或一个进程生命周期。
LangGraph 人在环中间件可以在敏感工具调用之前暂停,并在批准、编辑或拒绝决策后恢复。这不仅仅是 UI 确认;图状态被持久化,以便执行可以安全停止,之后从同一线程继续。
CrewAI 同样将人在环触发器放在任务和流程控制内部。因此工程模式是:
Proposed action
↓
Policy evaluation
↓
Persisted interrupt
↓
Human decision
↓
Resume / modify / reject
Diagram: joinwell52 Research Center synthesis from official runtime documentation.
OpenHands 在沙箱内运行命令、编辑文件和启动服务。Docker 是推荐的隔离提供者;进程模式更快但明确不安全;远程沙箱支持托管和托管执行。
这表明工具能力和执行安全不能被视为独立的事后考虑。运行时必须知道操作在哪里执行以及适用什么隔离边界。
AutoGen 区分了人类可读的跟踪日志和面向机器消费的结构化事件。 CrewAI 为生产流提升可观测性。LangGraph 将检查点化的执行连接到跟踪和调试。
这种区别很重要:操作员日志帮助人们理解一次运行,而结构化事件支持自动化、指标、告警和治理。
运行时能力矩阵
Note: This matrix summarizes documented mechanisms. It is not a performance benchmark.
Work identity / thread
↓
Persistent state
↓
Executable step
↓
Checkpoint + event
↓
Policy / human interrupt
↓
Resume, retry, or recover
↓
Evidence-backed completion
省略这些层中任何一层的运行时可能仍然可以演示一个 Agent,但难以作为长时间运行的 worker 运行。
检查点正在成为演示和持久化系统之间的分界线。持久化运行时必须从记录状态恢复,而不是从头重新开始推理。
人工审查必须建模为生命周期状态。批准不能停留在外部聊天约定。
执行隔离属于运行时契约。没有沙箱上下文的工具权限是不完整的。
结构化事件和人类可读日志服务于不同的消费者。两者都需要。
完成需要一个明确的状态转换。自然语言的成功声明不是足够的证据。
本报告不修改 TMPA 出版物。作为研究输入,它强调了事件、生命周期、权限、完整性和读者重建在中断和恢复执行中的重要性。
数字员工运行时必须在会话之间持久化工作标识符、当前状态、待批准项、工具环境、恢复历史、证据和完成授权。
CodeFlowMu 已经包含 FCoP 生命周期文件、任务状态、恢复操作、运行时日志和基于角色的完成门控。下一个工程步骤是通过一个稳定的运行时契约来提供检查点、中断、恢复和完成事件,而不是单独的运营约定。
LangChain, LangGraph overview: https://docs.langchain.com/oss/python/langgraph/overview
LangChain, LangGraph persistence: https://docs.langchain.com/oss/python/langgraph/persistence
LangChain, Human-in-the-loop: https://docs.langchain.com/oss/python/langchain/human-in-the-loop
OpenHands, Runtime Architecture: https://docs.openhands.dev/openhands/usage/architecture/runtime
OpenHands, Sandbox overview: https://docs.openhands.dev/openhands/usage/sandboxes/overview
CrewAI, Documentation: https://docs.crewai.com/
CrewAI, CrewAI AMP: https://docs.crewai.com/enterprise/introduction
Microsoft AutoGen, Managing State: https://microsoft.github.io/autogen/stable/user-guide/agentchat-user-guide/tutorial/state.html
Microsoft AutoGen, Logging: https://microsoft.github.io/autogen/stable/user-guide/core-user-guide/framework/logging.html
Original English article
JoinWell52 Research Center