🧠 REASONING PARADIGM EXPLAINER

什么是大模型的 Chain of Thought(CoT 思维链)

一句话搞懂:做复杂数学与逻辑题时,大模型的“草稿纸分步推导法则” —— 不要直接猜答案,一步一步写下推理!
❌ 直接作答 (Direct Prompting)

心急口快蒙答案

要求小学生 0.1 秒心算 3 位数乘法,十有八九算错
复杂题目输入 23 × 17 = ? 直接蒙答案 "350" ❌ 答错!
缺乏中间算力缓冲 1 步盲猜极易翻车 无法处理多步逻辑
VS
✅ 思维链 (Chain of Thought)

草稿纸演算流

把大问题拆成 3 个简单小步,步步为营 100% 正确
📝 草稿纸推导过程 (CoT) ① 先算 20 × 17 = 340 ② 再算 3 × 17 = 51 ③ 相加 340 + 51 = 391 ✅ 答对!
吐出思考字数 = 增加算力 步步自洽无逻辑跳跃 复杂推理能力质的飞跃

🔬 为什么 CoT 能让模型“智商翻倍”?

从 Transformer 计算本质看思维链的威力

1. 算力预算充值 (Test-time Compute)

字数即算力

把原本压缩在 1 个 Token 里的巨大推理压力,均摊到 50 个中间推导 Token 上,算力充沛自然算得准。

🧩

2. 复杂问题降维 (Decomposition)

大拆小,难变易

将一个极其复杂的 5 步应用题,拆解成 5 个小学生都能答对的单步直觉运算,规避单步推理错误。

🔍

3. 自我校验与回看 (Self-Reflection)

KV Cache 记忆支点

前面生成的推导步骤会被存进 KV Cache,后续生成最终答案时可以随时“回头看”,绝不丢掉上下文。

🎮 互动实验:亲手对比“直接答”与“思维链推导”

选择不同的趣味推理题,观察 CoT 是如何一步一步写出推导草稿并得出正确结论的

选择题目:
📥 题目输入 (User Prompt) CoT 模式就绪
商店原本有 20 个苹果。上午卖给小明 2/5,下午小红又买了 3 个,傍晚果园新送来 10 个。请问现在店里一共有几个苹果?
💡 经典咒语:在 Prompt 结尾加上 “Let's think step by step (让我们一步步想)”
🧠 大模型推导过程 (Reasoning Scratchpad) 消耗思考 Tokens: 48
🪄

1. 为什么那句“神咒语”能生效?

2022 年东京大学与谷歌研究发现,只需加上 "Let's think step by step",零样本下的模型就会被激活预训练中学习过的“解题草稿格式”,强迫自己在输出最终数字前先吐出中间推导词!

🎲

2. 什么是 Self-Consistency(自洽采样)?

与其只生成 1 条思维链,不如让模型同时跑 5 条不同的推导路径!如果其中 4 条路径虽然算法不同,但最终殊途同归指向了同一个答案,就以多数票胜出,正确率进一步暴涨!

🚀

3. 现代强化学习推理模型(o1 / DeepSeek R1)

现代推理模型不再依赖人类教它写思维链,而是通过大规模强化学习(RL)自主学会了超长思考(<think> 标签):包括自我反思、主动回溯、探索备用解法!