Chain-of-Thought 已成为主流 LLM 调用策略,文章系统梳理了 CoT 的几种变体(zero-shot、few-shot、自洽等)及各自的适用场景,并指出团队协作中误用 AI 的典型案例。
大语言模型(LLM)在被要求完成复杂、多步骤推理时,往往难以给出直接答案。链式思维(Chain-of-Thought,简称 CoT)提示技术正是为了解决这一局限性而设计的。它让推理逻辑更加透明,帮助团队调试错误输出并验证模型结论的有效性。
本文将探讨链式思维提示技术及其在工作流中的实现方法。
CoT 提示通过引出模型得出响应时所使用的中间推理步骤序列来发挥作用。它的目标是减少 LLM 生成的不完整、不准确的答案。
LLM 的设计初衷是在大多数情况下直接给出响应。
当复杂查询缺乏高质量答案时,AI 幻觉发生的概率会大大增加。
CoT 通过将复杂问题拆解为可管理的子问题来模拟人类逻辑,从而提高回答的准确性。事实上,Frontiers Media SA 发表的一项研究表明,与其他提示方法相比,CoT 的幻觉率最低:CoT 为 18.1%,而零样本(zero shot)为 34.5%。
以下是链式思维提示与标准技术的对比示例,以说明两者差异:
CoT 提示是 ReAct Agent 的主要机制之一。在这种 Agent 架构中,LLM 在推理、采取特定行动和观察外部工具或数据库返回的结果之间交替运行。
虽然 CoT 本身是一种查询推理模型的技术,但它有多种变体。你使用的策略取决于查询类型和具体用例。需要注意的是,部分生成式 AI 模型已经内置了链式思维,例如 Google 的 Gemini、Anthropic 最新的 Claude 以及 OpenAI 的部分模型。
以下是几种最常见技术的对比:
三种常见提示技术对比:简单提示、链式思维(CoT)和自洽性 CoT。图片来源:https://www.promptingguide.ai/techniques/tot

技术团队使用这种变体来触发推理,但不提供具体示例。相反,他们在提示中添加简单的指令,如"think step-by-step"(逐步思考),如上文所示的示例。零样本 CoT 使用直接命令来发挥 LLM 固有的推理能力。
用例示例:开发者可用此技术为复杂的调试任务或算法逻辑生成解释。
少样本提示为模型提供三到五个高质量示例,包括问题和理想答案,并附有完整推理过程。AI 模型从这些示例中学习推理模式,然后在解决相关问题时模仿它们。
用例示例:业务分析师可将此用于复杂推理任务,例如在价格大幅上涨后计算盈亏平衡点或最优产量。
这种方法为同一问题生成多条推理路径,并通过多数投票选择最终答案。它通过减少偶发错误并在五到二十个样本中平均化个别逻辑失误来发挥作用。
用例示例:医疗分诊系统可使用此技术确保诊断建议在各种内部"思维"过程中保持一致。
这种技术指示系统在尝试处理特定任务之前先提取高层级原则或概念性事实。它通过先关注全局再深入细节和原始数据来拓宽模型的逻辑。
用例示例:营销团队可使用此方法在确定具体策略之前先定义行业范围的价值主张。
ThoT 提示使用特定的引导语,如"walk me through this context in manageable parts"(带我逐步理解这段内容),来在大型上下文中保持连贯的逻辑线。它引导模型通过连续的思维链来分析信息,有助于在长对话中调试推理失误。
用例示例:技术支持人员可使用此方法来管理跨越十轮或更多对话的故障排查会话。
使用 CoT 的方式因你用于构建和管理 AI Agent 的具体产品而异。如果你需要对成本和延迟进行完全控制,代码实现更为合适。
n8n 让团队可以在可视化画布上设计各种提示技术。即使是技术团队也能以透明的方式迭代和测试不同方法。所有步骤都可见,不会埋在代码内部。
使用 Data Tables 管理 CoT 变体进行提示版本控制,使用条件分支处理子工作流选择技术。团队可以通过原生工作流原语管理这些变体——如零样本、少样本和自洽性——而无需改动应用程序代码。
从确定性的 Basic LLM Chain 节点开始,获得可预测的结果,然后逐步引入 Agent 节点。Agent 使用外部工具对照真实世界数据库验证推理。执行历史使这些链条完全可审查。
此设置完全可审计,留下清晰、可追溯的日志。每次执行都会在每个节点留下完整的 prompt/completion 对记录,让管理员检查模型的推理链。
团队可以打开日志查看模型在内部处理过程中具体在哪一步出错。这为每次运行提供了即时、详细的可见性和可审计性。用 n8n 的评估功能针对标准提示测试 CoT,监控每个输出的可靠性、语气和准确性。
使用 CoT 推理并非对每个查询都有意义,你也不应该将其强加到每个工作流中。它最适合那些在得出答案之前确实需要通过多个步骤迭代的复杂任务。寻找那些中间步骤能够捕捉到直接答案会遗漏的错误的场景。以下是几个常见判断标准:
对于简单任务使用逐步 CoT 指令可能会损害性能并降低输出质量。例如,事实查询需要快速答案,很少需要多个步骤。假设用户向聊天机器人询问今年员工有哪些法定假日。请求逐步推理可能会给处理带来不必要的负担,甚至可能鼓励模型自我怀疑并产生幻觉,而它的即时回答本来是正确的。
选择提示词以适应任务的复杂性和准确性需求。简单的自动化目标不需要复杂的逻辑,但生产系统通常需要少样本 CoT 的可靠性。
虽然 LLM 思维链能产生聚焦、准确的答案,但这不仅仅是提示的问题。你选择的工具可以决定系统的可靠性,也可以破坏它。
n8n 的 AI Agent、条件分支和执行历史使设计增强 CoT 的工作流变得容易。通过模块化模板和简单的基于节点的画布管理动态执行。你可以在需要时运行评估,n8n 自动记录每个中间步骤以供调试和审计,提供你每次运行后迭代和改进所需的可见性。
实时追踪每一步推理。
n8n 用户来自各种背景、拥有不同经验水平和兴趣。我们一直在希望在博客文章中突出展示不同用户及其项目。如果你正在使用 n8n 并希望为社区带来灵感,请联系我们 💌