企业 AI 失败多是架构失败而非模型失败——真正需要的是 Schema、验证循环、访问控制、成本限制等无聊工程,而非换模型。
企业运行在工作流之上,这些工作流必须可审计、可解释、可预测且正确。一处算术错误不是「小瑕疵」,它直接造成财务损失。访问控制、数据隐私和健壮性也不是「加分项」,而是准入门槛。
而 LLM 恰恰是另一种机器:概率性的、开放式的、通用型的大脑。擅长处理歧义,却不擅长提供确定性。
把这两个事实放在一起,就得到了 2026 年企业 AI 的核心矛盾:
我们需要从概率引擎中获得确定性结果。
任务不是削减模型的能力,而是约束它的运行方式而不封顶它的能力。让它飞,但要装在机翼之内。
大多数厂商的宣讲材料不会告诉你:大多数企业「AI Agent」失败其实是架构失败,而不是模型失败。团队在遇到问题时想到的是换一个更好的模型,而实际上他们需要的是枯燥的工程工作:Schema、验证循环、访问控制、成本限制。
由此得出的预测是:在未来两年内,大多数企业 AI 的采纳将由聚焦的、受约束的工作流引领,而不是在你系统中自主游荡的自主 Agent。受约束的工作流在成本、延迟和控制力上全面胜出。每一次都是。
在第二至第四部分讨论解决方案之前,先正视失败模式。在生产环境中的 Agentic 系统中,问题以六种常见方式爆发:
┌──────────────────────────────┐
│ Agentic system in prod │
└──────────────┬───────────────┘
┌──────────┬──────────┬─────┴─────┬──────────┬──────────┐
▼ ▼ ▼ ▼ ▼ ▼
Hallucination Loops Injection Silent State Garbage in
confident runaway & exfil, drift, corruption concurrent
wrong facts costs confused quality vague user
deputy decays input,
agent guesses
Hallucination(幻觉):模型自信地陈述了错误的事实。
Loops(死循环):Agent 原地打转,你的账单却不断攀升。
Injection and exfiltration(注入与数据泄露):恶意输入把你的 Agent 变成手握凭证的「糊涂代理人」。
Silent drift(静默漂移):一次模型更新悄悄改变了输出,什么都没崩溃,质量只是慢慢衰减。
State corruption(状态损坏):并发执行时互相覆盖写入,因为没有人设计锁机制。
Garbage in(垃圾进):用户很懒,他们遗漏细节,而 Agent 选择猜测而不是追问。
这些问题没有哪个是靠更聪明的模型就能解决的。全部要靠设计来解决:Eval、测试 harness 约束、隔离、确认流程、在关键节点设置人工审核。
选一个你想让它具备 Agent 能力的工作流。在选择模型、选择框架或写 Prompt 之前,先为它写一个任务专用的 Eval。二十个正确行为的示例。这个产出将比任何架构辩论更能解决争议。
下一期:第二部分,《你买错了智能》。我们将 DeepSeek V4 Flash 与 Claude Fable 5 正面交锋,算一笔前沿厂商希望你不会算的账。