大模型的训练速度正在加快
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning 是 DeepSeek 2026 年发布最新论文,里面讲述了可以通过纯强化学习(pure RL)来激发 LLM 的推理能力,而不需要人工标注的推理轨迹。
背景
chatgpt 的训练论文 Training language models to follow instructions with human feedback 中
描述了 ChatGPT 是如何使用 人类反馈强化学习(RLHF) 进行训练。
- 初始模型的有监督微调(Supervised Fine-Tuning)
- 比较数据构建奖励模型(Reward Model)
- 使用奖惩信号进行强化学习微调(PPO)
并附带了一个 训练方法(3 步流程)示意图:

其中很重要的是人类标注的数据集,人力是很昂贵的,openai 研发大模型需要付出庞大的经济价值和时间价值。
论文新发现
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning 指出针对推理能力训练这个特定环节,不需要人工标注推理过程的监督学习阶段,直接从预训练模型用 RL 来诱导模型自主发展出推理能力(如自我反思、验证、动态策略调整)!
这个理念带来的影响是巨大的。
这意味着:
- 成本降低:人工标注高质量的推理轨迹非常昂贵且耗时
- 突破人类上限:模型可能发现人类没想到的推理策略
- 可扩展性:纯 RL 方法更容易规模化