🧠 REASONING PARADIGM EXPLAINER
什么是大模型的 Chain of Thought(CoT 思维链)?
一句话搞懂:做复杂数学与逻辑题时,大模型的“草稿纸分步推导法则” —— 不要直接猜答案,一步一步写下推理!
❌ 直接作答 (Direct Prompting)
心急口快蒙答案
要求小学生 0.1 秒心算 3 位数乘法,十有八九算错
缺乏中间算力缓冲
1 步盲猜极易翻车
无法处理多步逻辑
VS
✅ 思维链 (Chain of Thought)
草稿纸演算流
把大问题拆成 3 个简单小步,步步为营 100% 正确
吐出思考字数 = 增加算力
步步自洽无逻辑跳跃
复杂推理能力质的飞跃
🔬 为什么 CoT 能让模型“智商翻倍”?
从 Transformer 计算本质看思维链的威力
1. 算力预算充值 (Test-time Compute)
字数即算力
把原本压缩在 1 个 Token 里的巨大推理压力,均摊到 50 个中间推导 Token 上,算力充沛自然算得准。
2. 复杂问题降维 (Decomposition)
大拆小,难变易
将一个极其复杂的 5 步应用题,拆解成 5 个小学生都能答对的单步直觉运算,规避单步推理错误。
3. 自我校验与回看 (Self-Reflection)
KV Cache 记忆支点
前面生成的推导步骤会被存进 KV Cache,后续生成最终答案时可以随时“回头看”,绝不丢掉上下文。
🎮 互动实验:亲手对比“直接答”与“思维链推导”
选择不同的趣味推理题,观察 CoT 是如何一步一步写出推导草稿并得出正确结论的
选择题目:
📥 题目输入 (User Prompt)
CoT 模式就绪
商店原本有 20 个苹果。上午卖给小明 2/5,下午小红又买了 3 个,傍晚果园新送来 10 个。请问现在店里一共有几个苹果?
💡 经典咒语:在 Prompt 结尾加上 “Let's think step by step (让我们一步步想)”
🧠 大模型推导过程 (Reasoning Scratchpad)
消耗思考 Tokens: 48
🪄
1. 为什么那句“神咒语”能生效?
2022 年东京大学与谷歌研究发现,只需加上 "Let's think step by step",零样本下的模型就会被激活预训练中学习过的“解题草稿格式”,强迫自己在输出最终数字前先吐出中间推导词!
🎲
2. 什么是 Self-Consistency(自洽采样)?
与其只生成 1 条思维链,不如让模型同时跑 5 条不同的推导路径!如果其中 4 条路径虽然算法不同,但最终殊途同归指向了同一个答案,就以多数票胜出,正确率进一步暴涨!
🚀
3. 现代强化学习推理模型(o1 / DeepSeek R1)
现代推理模型不再依赖人类教它写思维链,而是通过大规模强化学习(RL)自主学会了超长思考(<think> 标签):包括自我反思、主动回溯、探索备用解法!