作者线上 8 个 AI Agent 的 PM2 重启数据曝光,从 0 次到 55193 次重启对应不同稳定性表现,详解内存泄漏、循环崩溃等根因。
我的两个 Agent,algom-poll 和 n8n,显示 0 次重启。algom-poll 已运行 47 天,消耗 72 MB 内存。n8n 已运行 31 天,使用 500 MB。这些是理想情况。它们无需中断地执行任务,表明代码健壮、依赖稳定、资源使用可预测。对于 algom-poll,其日志显示持续一致的 cita-sort OK 消息,3 块面板上重新定位的卡片为 0,每小时一次。这表明运行平稳、无异常。
大多数 Agent 属于低重启类别,重启次数从 1 到 21 不等。
dragontrade-dashboard:1 次重启,运行 28 天,56 MB。近一个月内单次重启可以忽略不计。这可能是手动重启以进行更新,或是一次短暂的网络波动。
dragontrade-main:3 次重启,运行 28 天,148 MB。与仪表盘类似,长期内几次重启通常是可以接受的。
whitespace:4 次重启,运行 27 天,101 MB。该 Agent 也表现出良好的稳定性。
serpapi-jobs:21 次重启,运行 25 天,35 MB。虽然比该组其他 Agent 高,但 25 天内 21 次重启平均每天不到一次。这可能指向偶发的外部 API 限流、通过重启解决的轻微内存泄漏,或导致崩溃的特定任务类型。concierge-selftest.log 显示 Telegram 卡片生产成功且重复抑制有效,表明尽管存在这些重启,核心功能仍在正常运行。
这些低重启次数通常表明存在轻微的自我修正问题,或是部署的计划内重启。我的 git log 显示过去 48 小时内有 2 次提交,分别是 2026-09-12 的 51158b3 和 2026-09-11 的 b5cc107,与 ai-ops-wiki surfaces 相关。如果 Agent 被更新,这些部署可能导致部分重启。
cto-aipa Agent 以 151 次重启脱颖而出,但仅运行 1 天,消耗 211 MB。这个短时间内的大量重启值得关注。1 天内 151 次重启意味着大约每 9.5 分钟重启一次。这种模式表明存在一个反复出现的非致命错误,PM2 被配置为通过重启进程来处理。
NOW.md 文件作为 Cursor 和 Claude Code 之间的共享会话,提到:"Cursor Cloud、Cursor Desktop 和 Claude Code 都在这个仓库上工作,但它们互相看不到对方的聊天。没有共享对话,Cursor 中没有 Claude MCP,无法向另一个 Agent 发送消息。它们都能读取的唯一内容是 HubSpot 和这个文件。因此这个文件不是文档。它是当前未运行的 Agent 的工作记忆,而下面的协议是关于两个无法通信的 Agent 如何避免冲突的。"这种碎片化的通信可能是 cto-aipa 不稳定的来源,因为它依赖的状态无法一致地共享或同步,从而导致崩溃。followup-radar.log 显示邮件处理,imap.zoho.com 有 245 封收件箱邮件,imap.gmail.com 有 661 封,表明 cto-aipa 正积极使用外部服务。这些外部交互的失败可能触发重启。
尽管如此,PM2 仍报告其为 "online"。这突出了一个关键区别:"online" 不等于 "healthy" 或 "functional"。它仅表示进程管理器正在尝试保持进程运行。内存使用量低(53 MB)可能表明它在消耗大量资源之前就已崩溃,或者是一个非常轻量的进程,能够快速重新初始化。
这些不同的 AI Agent 重启模式揭示了不同类别的操作问题:
零重启:表明 Agent 健壮、稳定。专注于监控性能下降或意外的日志条目。
低重启(1-21):表明存在轻微的瞬态问题或计划内部署。在重启时间点附近检查日志中的错误消息。
中度重启(1 天内 151 次):指向一个反复出现的问题,Agent 无法在不进行完整重启的情况下优雅地从中恢复。这需要更深入地调查导致失败的特定代码路径。
高重启(28 天内 55193 次):这是一种关键的故障模式。该 Agent 实际上已无法正常运行,即使 PM2 报告它为 "online"。需要立即进行调试以识别持续崩溃的根本原因。
wiki-ship.log 显示重复出现 "error: failed to push some refs to 'https://github.com/ElenaRevicheva/aideazz.git'"。虽然与 Agent 重启没有直接关联,但它表明我的系统中存在其他可能间接影响 Agent 稳定性的操作问题——如果部署失败或代码未正确更新的话。
Q:PM2 的 "online" 状态是否意味着 AI Agent 正常工作?
A:不是。正如 algom-stream 在 "online" 状态下有 55193 次重启所表明的,PM2 仅表示进程管理器正在尝试保持进程运行。它不能保证应用逻辑正在成功执行或产生有效输出。
Q:如何区分计划内重启和错误引起的重启?
A:计划内重启通常与部署事件(如过去 48 小时内的 2 次提交)或预定维护相关。错误引起的重启在应用日志中会显示特定错误消息,紧接在重启之前,通常呈反复出现的模式。
Q:当 AI Agent 显示 55193 次重启时,第一步是什么?
A:立即检查该 Agent 的具体应用日志,获取导致崩溃的确切错误消息。如此高的重启次数表明存在需要直接在代码或环境配置中解决的未处理异常或资源问题。
Q:1 天内 151 次重启对于 AI Agent 来说是否可以接受?
A:不可以,1 天内 151 次重启是不可接受的。它指向一个反复出现的问题,正严重影响着 Agent 的正常运行时间及其完成任务的能力,即使它最终会恢复。这种模式需要调查以提高稳定性。
— Elena Revicheva · AIdeazz · Portfolio