舍弃 CoT 中的叙述句子,仅保留中间状态数字和关键转换,保持推理精度同时削减 token 消耗 80%。Xu et al. 2025 论文成果。
Chain-of-Thought(链式推理)通过让模型写下中间步骤而不是直接跳到答案,可靠地提高推理准确性。但是仔细看一个 CoT 追踪,你会注意到一些问题:在一个简单的算术问题上,模型输出一个段落,而实际工作只是一个减法。Chain-of-Draft(Xu 等人,2025,Zoom)就是解决方案——相同的逐步推理,但每一步被限制为只有几个单词的简洁草稿。该论文报告在算术、常识和符号基准测试上,推理 token 数量减少约 80%,同时准确性接近 CoT。
把一个 CoT 追踪分成两部分。承载答案的 token 是中间数字和一个关键转换。连接 token 是解释工作过程给人类读者的散文("为了找出他送出了多少,我们从起始数量中减去剩余数量,所以...")。承载答案的 token 只占很小一部分;其余的是模型为你而不是为自己写的叙述。
CoT 打败直接回答的原因不是文笔流畅——而是写下中间状态给模型一些具体的东西来依赖其下一个 token 的生成。这个机制在压缩后仍然存在。20 - 12 = 8 锁定的状态与解释减法的句子相同。
CoT -> 叙述详尽,每步一个完整句子:
"To find how many he gave away, we subtract the
remaining lollipops from the starting amount, so..."
CoD -> 最小化草稿,每步几个词:
"start 20"
"left 12"
"20 - 12 = 8"
"#### 8"
整个行为存在于一条指令中(论文的确切措辞)。它做两件事:限制草稿长度使模型停止叙述,以及在最终答案前要求一个分隔符,这样你可以干净地解析它。
const COD_SYSTEM =
"Think step by step, but only keep a minimum draft for " +
"each thinking step, with 5 words at most. Return the " +
"answer at the end of the response after a separator ####.";
这是对 CoT 调用的即插即用替换——相同的 SDK,相同的形式,只有系统字符串改变。因为输出更小,成本和延迟都会下降,无需改变管道。输出 token 是你付费的内容和驱动生成时间的内容,所以 80% 的 token 削减大致就是每项 80% 的削减。
function extractAnswer(text) {
const i = text.lastIndexOf("####");
return (i >= 0 ? text.slice(i + 4) : text).trim(); // "8"
}
不要假设成功——测量它。用两个提示词运行相同的问题,用真实的分词器计算输出 token,然后比较。该论文在 GSM8K 上看到 CoD 降落在约 CoT 推理 token 的 8%,准确性相当。
零样本 CoD 可能在步骤被压缩到低于必须承载的信号,或在无法隐式保持状态的非常小的模型上时下降。两个廉价的修复:一样本简洁格式使其坚持,并将真正困难的问题路由回完整 CoT。
You are a careful reasoner. Think step by step, but only keep a
MINIMUM DRAFT for each thinking step — 5 words at most per step.
Do not write full sentences or explanations; use fragments,
numbers, and equations only. One draft step per line.
After the final step, output a line with the separator #### followed
by the final answer only (no units, no extra words).
Example —
Q: A shirt costs $40 after a 20% discount. Original price?
A: 0.8*x = 40
x = 40 / 0.8
x = 50
#### 50
因为每个 CoD 样本比 CoT 样本便宜 5-10 倍,你甚至可以抽取更多,用多数投票进行自我一致性检查——通常 n 个 CoD 抽取的成本小于单个 CoT 抽取。CoD 是一个推理格式技术:它可以在任何使用 CoT 的地方插入,并且与上下文管理不同(上下文管理缩小输入历史),因为 CoD 缩小了模型的输出推理。
在这里观看详细的 CoT 追踪和紧凑的 CoD 追踪并排达到相同答案,带实时 token 计数器:https://dev48v.infy.uk/prompt/day53-chain-of-draft.html
如需进一步操作,你可以考虑屏蔽此人和/或报告滥用。