📖
思维链
训练方法
一句话概括
让模型在给出答案前先输出推理步骤,显著提升复杂推理能力的提示技巧。
详细解析
思维链(Chain-of-Thought, CoT)是一种提示技巧,让模型在给出最终答案前先输出中间推理步骤。简单形式是在提示中加入"让我们一步一步思考",复杂形式是在few-shot示例中展示推理过程。
CoT通过引导模型生成中间token,为复杂推理分配更多"计算量",让模型能够分解问题、逐步推导。它在数学、逻辑、多步推理任务上效果显著,是GPT-4、Claude等模型强推理能力的重要来源。
CoT的演化包括Zero-Shot CoT、Auto-CoT、Self-Consistency(多次采样取多数)等。OpenAI的o1/o3系列将CoT内化为模型训练,通过强化学习优化内部推理链,进一步突破推理上限。