大模型的训练速度正在加快

DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning 是 DeepSeek 2026 年发布最新论文,里面讲述了可以通过纯强化学习(pure RL)来激发 LLM 的推理能力,而不需要人工标注的推理轨迹。

背景

chatgpt 的训练论文 Training language models to follow instructions with human feedback

描述了 ChatGPT 是如何使用 人类反馈强化学习(RLHF) 进行训练。

  1. 初始模型的有监督微调(Supervised Fine-Tuning)
  2. 比较数据构建奖励模型(Reward Model)
  3. 使用奖惩信号进行强化学习微调(PPO)

并附带了一个 训练方法(3 步流程)示意图:

其中很重要的是人类标注的数据集,人力是很昂贵的,openai 研发大模型需要付出庞大的经济价值和时间价值。

论文新发现

DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning 指出针对推理能力训练这个特定环节,不需要人工标注推理过程的监督学习阶段,直接从预训练模型用 RL 来诱导模型自主发展出推理能力(如自我反思、验证、动态策略调整)!

这个理念带来的影响是巨大的。

这意味着:

  1. 成本降低:人工标注高质量的推理轨迹非常昂贵且耗时
  2. 突破人类上限:模型可能发现人类没想到的推理策略
  3. 可扩展性:纯 RL 方法更容易规模化

附录

与 claude code 讨论过程

发表评论